{"as_of":"2026-08-07T19:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f7923a89361f5ea1a2e9419b7385acac9c94568366e5c20f6defa2276ce73fc","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:07:44.228190Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T06:38:04.459129Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:16:28.883932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"cited_work":{"arxiv_id":"2507.00992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniglyph: Unified segmentation-conditioned diffusion for precise visual text synthesis.ArXiv, abs/2507.00992, 2025f.https://api.semanticscholar.org/CorpusID:280069916","venue":null,"work_id":"aec809fe-7254-45ce-8770-8e756d9d8de6","year":null},"citing_paper":{"arxiv_id":"2604.28185","last_updated":"2026-04-30T17:59:02Z","snapshot_observed_at":"2026-07-06T23:13:29.310140Z","submitted_at":"2026-04-30T17:59:02Z","title":"Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-07T06:38:04.459129Z"},"links":{"cited_paper":"/paper/2507.00992","citing_paper":"/paper/2604.28185"},"observation_digest":"sha256:1ec2e0f416f97c3fccafdeaa9fb2ae38f4689d4cc4ddc0859ba6f6836d921ef1","observation_id":"6b2b842f-6b4f-4a34-9a2b-3a89513fc44d","resolution":{"observed_at":"2026-05-12T10:16:28.886236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00992/citation-record","integrity":"/paper/2507.00992/integrity","json":"/paper/2507.00992/citation-record.json","paper":"/paper/2507.00992"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.510431Z","title":null,"venue":null,"work_id":"b9700cb3-2448-4ce0-ab86-492e624eedc0","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.874831Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:5404bfe44b6e9e9c66e7b0d226b0f940bc06b04a19862dbf725eeb3edea4921b","observation_id":"28ec29b1-c70a-43cf-ba84-567cdb546803","resolution":{"observed_at":"2026-08-06T21:07:45.517671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16465","last_updated":"2023-11-28T04:02:40Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-28T04:02:40Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16465","snapshot_observed_at":"2026-08-06T21:07:43.882932Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.882932Z"},"links":{"cited_paper":"/paper/2311.16465","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:bce0cd5a71ee67248ed802b51d56dfafd251d2eab7efe09c86535de5f740d421","observation_id":"9257fe4e-4b10-4ca9-a301-6a6ce1b7d706","resolution":{"observed_at":"2026-08-06T21:07:43.882932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10855","last_updated":"2023-10-30T06:33:01Z","snapshot_observed_at":"2026-07-06T15:29:08.848146Z","submitted_at":"2023-05-18T10:16:19Z","title":"TextDiffuser: Diffusion Models as Text Painters","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10855","snapshot_observed_at":"2026-08-06T21:07:43.890731Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.890731Z"},"links":{"cited_paper":"/paper/2305.10855","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:b547242ede57c3c17ad96aaeb70f1e0f930bd71f4d44678d9a6e4473e0d03627","observation_id":"7c0a2b13-de15-4e71-8cfe-7a29ad32aae7","resolution":{"observed_at":"2026-08-06T21:07:43.890731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.483717Z","title":"Control3d: Towards controllable text-to-3d generation,","venue":null,"work_id":"346bb570-6a5e-4a09-849f-40959649c20c","year":null},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.896484Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:acaaafc44dd5e6faaabd6d79f3ac87a7ef29f5e96ac8d6dc5d1f76dc95361c80","observation_id":"9a37a80c-e056-447c-9b0c-5066d3d3d3c5","resolution":{"observed_at":"2026-08-06T21:07:45.490375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08099","last_updated":"2025-06-11T05:50:16Z","snapshot_observed_at":"2026-08-07T17:14:10.560498Z","submitted_at":"2025-03-11T07:01:35Z","title":"Whoever Started the Interference Should End It: Guiding Data-Free Model Merging via Task Vectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08099","snapshot_observed_at":"2026-08-06T21:07:43.901697Z","title":"Whoever started the interference should end it: Guiding data-free model merging via task vectors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.901697Z"},"links":{"cited_paper":"/paper/2503.08099","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:9cc5a63cb741aaffdc3b99c22ae790b5112491efc8835cc74b5e7f9ff8837f2f","observation_id":"32394b3f-a65e-4967-b6c0-236223cdc334","resolution":{"observed_at":"2026-08-06T21:07:43.901697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08341","last_updated":"2024-12-11T12:31:30Z","snapshot_observed_at":"2026-07-06T20:05:14.412418Z","submitted_at":"2024-12-11T12:31:30Z","title":"ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts","version":1},"cited_work":{"arxiv_id":"2412.08341","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08341","snapshot_observed_at":"2026-08-06T21:07:44.721535Z","title":"ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts","venue":"cs.CV","work_id":"c6f85d67-8ec0-4bfa-bf9c-6683c64b1a64","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.908675Z"},"links":{"cited_paper":"/paper/2412.08341","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:5aa9b87e714a78bde30db2ad577fe69aec6d26a84cc2bbfd38a0b58f0e4a59cc","observation_id":"519f8f0f-4074-489d-83ea-7cf3c4ee0af7","resolution":{"observed_at":"2026-08-06T21:07:44.729047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.463664Z","title":"Scaling rec- tified flow transformers for high-resolution image synthesis","venue":null,"work_id":"55124bc2-7e02-4a16-9735-630c427bfa61","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.915762Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:7eb5fd81fa84f21c9eab7f8ff19ac7a90b5ba61356f048bf84d9e8a89a88952d","observation_id":"c0ba18f1-51ae-4fce-8bc3-1945170f98a7","resolution":{"observed_at":"2026-08-06T21:07:45.469315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.445705Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models, 2023","venue":null,"work_id":"d91b4018-381d-4c2d-976b-537ab25edbb0","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.921851Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:8a531f6671d1a8befb9ccffd3ed0975ea05f7f3fb093b6038cd7334ab426651c","observation_id":"c01146fd-6b7c-4f0f-8053-4ef61ae18e9c","resolution":{"observed_at":"2026-08-06T21:07:45.451813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06767","last_updated":"2022-09-29T03:37:02Z","snapshot_observed_at":"2026-07-06T12:37:32.486119Z","submitted_at":"2022-02-14T14:37:15Z","title":"Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark","version":4},"cited_work":{"arxiv_id":"2202.06767","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06767","snapshot_observed_at":"2026-08-06T21:07:44.688641Z","title":"Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark","venue":"cs.CV","work_id":"1e2bb39b-00f7-4342-a0a1-9a14eca28b91","year":2022},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.927668Z"},"links":{"cited_paper":"/paper/2202.06767","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:47e62cbe1ca6567de0bfefbb997c271b988de736c94920758827fd5fd432a885","observation_id":"b2e9c88f-b1d2-4b29-8ee5-2372cbb9e861","resolution":{"observed_at":"2026-08-06T21:07:44.697290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.426436Z","title":"En- hancing logits distillation with plug&play kendall’s τ rank- ing loss, 2025","venue":null,"work_id":"db3c5719-921c-4cb3-b93b-56a92c77cbbe","year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.934626Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:618c518729b7d99c12e3cdbbf87fe66a6645739dba7b534ec3923db8a204de13","observation_id":"74d48cac-46bf-4cb1-ad40-38e5519f9540","resolution":{"observed_at":"2026-08-06T21:07:45.433127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.409219Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"12ac11f1-641b-4f63-9906-b14df6142a90","year":null},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.941560Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:ae02128490a1058aa4ce5e204e37e3ebc0af357bfb47a4210c863a49f534d958","observation_id":"e79461d0-b430-49fa-aadf-1610f1d3fe7c","resolution":{"observed_at":"2026-08-06T21:07:45.414838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-06T21:07:43.947462Z","title":"Composer: Creative and controllable im- age synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.947462Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:b19ba33ebe34bd456923a91d4bd61d13680417939db1e1743b3f2a1d4bf5c9be","observation_id":"b8724014-6f75-43f2-a924-902a369832bc","resolution":{"observed_at":"2026-08-06T21:07:43.947462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:43.954466Z","title":"Improving diffusion models for scene text editing with dual encoders,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.954466Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:ad7c1a28eebcc6d9e335e55203f359cfd8bcc5ae3f68a39ab6206b860eac1840","observation_id":"c98c904c-6bbe-4a3a-9884-f37cc9562b90","resolution":{"observed_at":"2026-08-06T21:07:43.954466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.373164Z","title":"Kingma and Max Welling","venue":null,"work_id":"2f33df01-81e3-45a9-8e30-0e87388081e5","year":2014},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.963391Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:efb589a86b072f732f8e2fecd94d78084de6d4654418f9316f5296b094f30d98","observation_id":"a2dd28e5-e48b-42b9-a033-9524c67e998d","resolution":{"observed_at":"2026-08-06T21:07:45.379114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T21:07:43.970072Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.970072Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:728cd481dc0fc5399b86a51c890a5b66afecb0243d13fd7a5bab04195ee1d01f","observation_id":"29d80fbc-68d5-41e4-97e4-16b8dd01efcc","resolution":{"observed_at":"2026-08-06T21:07:43.970072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.352927Z","title":null,"venue":null,"work_id":"9cf42648-73d9-4702-b3a2-954405a1c8f9","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.976312Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:5ccbe27a053ad22710073fae97932fd027697eedcacd27f4cb38b8d8e309c6aa","observation_id":"474cd821-cf88-4c2f-b146-013174b5bfa2","resolution":{"observed_at":"2026-08-06T21:07:45.358244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.334409Z","title":"Layoutprompter: Awaken the design ability of large language models, 2023","venue":null,"work_id":"419e0675-9dcd-463a-923d-4f24d76e8219","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.982417Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:7a5347982a7e0f9c42446a21bc757385c9cd39b6e20c38a7cfb01e4ba7d31172","observation_id":"b98c08c8-4137-4bc3-8dbb-bf80d5faa927","resolution":{"observed_at":"2026-08-06T21:07:45.341179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.311642Z","title":null,"venue":null,"work_id":"e8c2ecbc-2ab3-4a85-835d-41523e0d43fe","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.989421Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:497ccda19fc579c219ac30c68fea3b2d4e43526904aca84c1f773cb14e98931e","observation_id":"2592a445-96df-4523-9056-f0870bf9d149","resolution":{"observed_at":"2026-08-06T21:07:45.317609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.284635Z","title":"Character-aware models improve visual text rendering","venue":null,"work_id":"dae0aa9e-a824-41ac-860f-4121be1e3f22","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:43.994867Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:5ce1f2a4a0343cc0a987bdbf4aba198a11931b0568784feab1366701111c5084","observation_id":"5658022d-f97b-41f3-ab5b-a3adc092bf00","resolution":{"observed_at":"2026-08-06T21:07:45.292971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09622","last_updated":"2024-07-12T16:39:31Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:55:33Z","title":"Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09622","snapshot_observed_at":"2026-08-06T21:07:44.000625Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering.arXiv preprint arXiv:2403.09622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.000625Z"},"links":{"cited_paper":"/paper/2403.09622","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:f2b8500b76aef43b483c5abd21bdf812f2cdfdbadc6fc1b8cc02d48e7d4ccfcd","observation_id":"64e623d4-63af-4fe0-8dd8-6a3b972785fa","resolution":{"observed_at":"2026-08-06T21:07:44.000625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10208","last_updated":"2024-07-12T16:26:40Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:44:09Z","title":"Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10208","snapshot_observed_at":"2026-08-06T21:07:44.007905Z","title":"Glyph-byt5-v2: A strong aesthetic base- line for accurate multilingual visual text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.007905Z"},"links":{"cited_paper":"/paper/2406.10208","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:d83f209428ce4b181b5302fced8294766e3a32cbe32c45bb2104ec702f3c5db2","observation_id":"830d693d-71df-4dbe-b1a3-d86f52c1bad1","resolution":{"observed_at":"2026-08-06T21:07:44.007905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.014070Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.014070Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:de6d6f7b9ff4eb1ea01486ed050305c9b335e540efc9d4f796bd57391dab960f","observation_id":"0cdbd8b2-a75e-4af2-8d9c-623fc6db15bf","resolution":{"observed_at":"2026-08-06T21:07:44.014070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.255896Z","title":"Glyphdraw2: Automatic generation of complex glyph posters with diffusion models and large language models","venue":null,"work_id":"e1a98f57-d49a-48e0-a12c-98786691b2f7","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.018896Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:f75bef43940349256ac630e75830de523e311ce27759ee3ce9b875071baba556","observation_id":"ac20871a-deaa-4b07-96a9-49217aa8085f","resolution":{"observed_at":"2026-08-06T21:07:45.261746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.237417Z","title":"Chargen: High accurate character- level visual text generation model with multimodal encoder,","venue":null,"work_id":"52231152-6143-4cd9-ba38-697d93a1796c","year":null},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.024243Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:f43923ac1e39fced0075383b612fb0270374283f1c0f6918897f0878b22c3bbd","observation_id":"72c2d6e6-aea4-4bf1-b95d-13b7768a6f87","resolution":{"observed_at":"2026-08-06T21:07:45.242791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.029403Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.029403Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:34a50b585488784b7e71ba833462265eded5e7a547725c595c0ec95fee93be3f","observation_id":"15d08a01-66e1-4976-938c-a646889ebfcf","resolution":{"observed_at":"2026-08-06T21:07:44.029403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04590","last_updated":"2025-06-05T03:11:48Z","snapshot_observed_at":"2026-08-07T10:36:04.209889Z","submitted_at":"2025-06-05T03:11:48Z","title":"Follow-Your-Creation: Empowering 4D Creation through Video Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04590","snapshot_observed_at":"2026-08-06T21:07:44.034191Z","title":"Follow-your-creation: Empowering 4d creation through video inpainting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.034191Z"},"links":{"cited_paper":"/paper/2506.04590","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:a2f0f22feaf8cac21e44f5c50cfe33ab0fb4206e12d5557e3993c144a85613af","observation_id":"759e8097-c38f-4a1d-8da3-a3cace8e61e3","resolution":{"observed_at":"2026-08-06T21:07:44.034191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.039407Z","title":"Follow-your-click: Open-domain regional image animation via motion prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.039407Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:92aadd2589a69c2fed9517572376cbafa86f7db683380eb344dadfbd1838ec65","observation_id":"e1d060c2-1f1f-4935-8c1d-cb2df859a355","resolution":{"observed_at":"2026-08-06T21:07:44.039407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.046024Z","title":"Follow-your-motion: Video motion transfer via efficient spatial-temporal decoupled finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.046024Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:44842b006d2c89d1b746e97e46d326a46fcac11c2fabd354a56f469e59c832da","observation_id":"95cc10a5-dbfe-462d-87aa-ba7b9e243a1a","resolution":{"observed_at":"2026-08-06T21:07:44.046024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-06T21:07:44.051530Z","title":"T2i-adapter: Learning 9 adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.051530Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:d80e0c54a0864fcd771a2de5c48ddd27433dca596096ac032179897adf0dbcd1","observation_id":"85c6a035-d149-40c5-9571-d5e7e9412d20","resolution":{"observed_at":"2026-08-06T21:07:44.051530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.183451Z","title":null,"venue":null,"work_id":"bf6e8519-48b3-4902-8469-b637ed31c2ec","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.057057Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:a9cbfa36f339992b21806c657660cc76d084a980fd77a6924e5d0c65e9ea7ac4","observation_id":"f7257145-48d7-4055-99cc-c9c9e2be3c24","resolution":{"observed_at":"2026-08-06T21:07:45.188706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.165278Z","title":"Pp-ocrv4","venue":null,"work_id":"4965373e-1c29-4417-a129-79e1d95265ce","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.062676Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:b6e9799275b99d4cd0cfe55c94d95fda6f27192bc29fe5b1fa9dda9971e5c814","observation_id":"eca7f108-8b6a-4260-ab83-dbb222952ac5","resolution":{"observed_at":"2026-08-06T21:07:45.170912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.146024Z","title":"Customtext: Customized tex- tual image generation using diffusion models, 2024","venue":null,"work_id":"1bce7fcb-c2a0-4d48-8f20-0ee987056ab7","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.068222Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:787493d1d319d8d2f0864ea018c7b880c1b800f63952af6277b93955ea1a5273","observation_id":"5e2dcd64-21a8-4ab4-91c3-32fe4b885b28","resolution":{"observed_at":"2026-08-06T21:07:45.151663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.129255Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":"aa145a55-68c5-4533-816c-68777b48ca7a","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.073350Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:66cd9c2732bfd2b6d2dca8058c75cd543c46f523a649edb93f29df2f61bfb44c","observation_id":"c00299d2-de25-4147-8e5a-b7a6fded0ce6","resolution":{"observed_at":"2026-08-06T21:07:45.134504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T21:07:44.079729Z","title":"LAION- 400M: open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.079729Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:cf98812be27b26d50a1380ffd551c8a9908097bdf3dd21d2d55a7430535035d6","observation_id":"f1d565d6-219c-41ed-b286-b83687af698d","resolution":{"observed_at":"2026-08-06T21:07:44.079729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.112879Z","title":"Gsrender: Dedupli- cated occupancy prediction via weakly supervised 3d gaus- sian splatting, 2024","venue":null,"work_id":"d5fe0bd0-f690-46d2-b148-ea2bd4256f24","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.086243Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:b7a1fb6942710f6ed56c3614682b3bb387c57b13f68753b22df9e45906339035","observation_id":"baf90487-c830-4b09-8db0-cf0c9f4a32be","resolution":{"observed_at":"2026-08-06T21:07:45.117661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.092479Z","title":"Llama: Open and efficient foundation lan- guage models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.092479Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:7e9308d7823969b6db3d18a277a2398e61fb0235ad82707c7097792d1ae47910","observation_id":"3a1ba1c1-0ed4-4f34-a40c-12f8709cf312","resolution":{"observed_at":"2026-08-06T21:07:44.092479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.077862Z","title":"Llama 2: Open foundation and fine- tuned chat models, 2023","venue":null,"work_id":"f4f616c4-3e78-45d0-a75e-0b22120b6655","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.099000Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:9995823c8c5abd3c851fd64c673b330eeb3116984c84a80e24ed2ef229583042","observation_id":"e2f123c0-3ec0-4c37-9432-779ed9a3975b","resolution":{"observed_at":"2026-08-06T21:07:45.085294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.052187Z","title":"Anytext: Multilingual visual text gener- ation and editing","venue":null,"work_id":"8ff1f242-9099-446f-b3d4-14650c87c021","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.109747Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:2dd6740f672545bc8b9e0da3ea36adde11812c93634d48f3670b84041b71557f","observation_id":"f24461fc-4c95-4b2d-bbe4-d58f9451e0ba","resolution":{"observed_at":"2026-08-06T21:07:45.063489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.117265Z","title":"Anytext2: Vi- sual text generation and editing with customizable attributes,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.117265Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:0afd791bea77ce16cfbd4103acc4010eff58a2e109e74a4dbc528d67080feca8","observation_id":"3557ce56-9f8c-4c0f-8c73-8feb98e0b5ea","resolution":{"observed_at":"2026-08-06T21:07:44.117265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:45.019289Z","title":"Rectified diffusion: Straightness is not your need in rectified flow, 2024","venue":null,"work_id":"057e86b0-6d32-4a1a-a6ab-422af54f27a4","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.123151Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:0eb1f71330fa778f01adb29f3eb9ddb3dc04ea69de63c5b3414328ad3a019dec","observation_id":"dafd02e2-9225-47b9-aaea-76fd515de825","resolution":{"observed_at":"2026-08-06T21:07:45.024497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.129443Z","title":"Perceive, understand and restore: Real-world image super- resolution with autoregressive multimodal generative mod- els, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.129443Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:a14908de1a39092d33d9bcf7380aa2e3b7057635a8087b3bc1c08428327b43a2","observation_id":"f8a01ebb-951d-4d13-b4ea-61ecd62c6ce7","resolution":{"observed_at":"2026-08-06T21:07:44.129443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01230","last_updated":"2025-05-26T13:01:08Z","snapshot_observed_at":"2026-07-06T20:15:45.334609Z","submitted_at":"2025-01-02T12:45:21Z","title":"Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01230","snapshot_observed_at":"2026-08-06T21:07:44.134485Z","title":"Modeling multi-task model merg- ing as adaptive projective gradient descent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.134485Z"},"links":{"cited_paper":"/paper/2501.01230","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:770ae8be45d379408e2bfcacd58a59dc689badc28616353a7d715612ae4bde81","observation_id":"522060b4-323c-494b-873b-20e3b2127e82","resolution":{"observed_at":"2026-08-06T21:07:44.134485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.980401Z","title":"Bts: a bi-lingual benchmark for text segmentation in the wild","venue":null,"work_id":"7b24df59-929e-424b-96b2-93c512501556","year":2022},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.141670Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:e4c8e934892bdc3b421813854107fe0b3910305235e845872d90bc58a1fd301b","observation_id":"fe25d4dc-4367-4c39-93ab-3b1758a6d06d","resolution":{"observed_at":"2026-08-06T21:07:44.987704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15915","last_updated":"2024-06-19T03:58:32Z","snapshot_observed_at":"2026-07-06T17:08:00.380938Z","submitted_at":"2023-12-26T07:20:55Z","title":"ChartBench: A Benchmark for Complex Visual Reasoning in Charts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15915","snapshot_observed_at":"2026-08-06T21:07:44.147943Z","title":"Chartbench: A benchmark for complex visual reasoning in charts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.147943Z"},"links":{"cited_paper":"/paper/2312.15915","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:fb60cdd3ab74306b3f421a00bc12364249cc086b335402798dd03966c41e8714","observation_id":"5abc69fc-fd2d-4307-aa5a-84377c948c3f","resolution":{"observed_at":"2026-08-06T21:07:44.147943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.958619Z","title":"Chartmoe: Mixture of di- versely aligned expert connector for chart understanding","venue":null,"work_id":"99581c84-f764-44bd-af7e-f9be859e78c6","year":2025},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.155012Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:6959935a37b5cce7b2aeda99dfd7e3cd6ae23b30b6048cad5b8dee1367f54ba8","observation_id":"0c31202c-0975-4b26-8f88-d1509db64f49","resolution":{"observed_at":"2026-08-06T21:07:44.964337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18259","last_updated":"2023-11-11T20:56:44Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:27:59Z","title":"GlyphControl: Glyph Conditional Control for Visual Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18259","snapshot_observed_at":"2026-08-06T21:07:44.162209Z","title":"Glyphcontrol: Glyph condi- tional control for visual text generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.162209Z"},"links":{"cited_paper":"/paper/2305.18259","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:8142c9557ffb85251f904f3ba5f724af918e51f75e15b4ec7ba6a1179a4ca591","observation_id":"32bc8583-9f43-4e1a-8d30-0b3a2ede3a12","resolution":{"observed_at":"2026-08-06T21:07:44.162209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.937976Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":"b107bfe2-b7e7-4bb4-a123-589af198ddc9","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.168175Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:e73b9df68336250036e7843d689edd8ed2afd37928cecf72211d64a8d7b70958","observation_id":"f7fb9823-60f4-421d-af5d-afcb3b9cc4ff","resolution":{"observed_at":"2026-08-06T21:07:44.945489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.917587Z","title":"Hi-sam: Marrying segment anything model for hierarchical text segmentation","venue":null,"work_id":"d64341ab-0c6f-432f-a97a-1389a39a3696","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.173914Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:dff4d5b42efc044eb71ebf7c4225d2d9004a72567b383ab061cb9fa287d159a8","observation_id":"e89e5119-c991-4136-b5f7-70b5e9781984","resolution":{"observed_at":"2026-08-06T21:07:44.923547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.891219Z","title":"Artist: Improving the generation of text-rich images with disentan- gled diffusion models and large language models, 2024","venue":null,"work_id":"fb0d8e33-53bd-44e7-9c05-5e2789642ee3","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.180598Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:e18f6d9d6c007919593e138f0428c81388878dc1b6a4310ac927d7ff8c12fd68","observation_id":"aad58259-1dea-467c-a0de-cd284818e564","resolution":{"observed_at":"2026-08-06T21:07:44.898659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-06T21:07:44.186728Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.186728Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:54d93e2426ca93001beae35645c6b3415f16dd0a5ed0beb1b8fbf752ea46f6bc","observation_id":"c5e97818-cffd-4158-8687-a9bcc2c1bd33","resolution":{"observed_at":"2026-08-06T21:07:44.186728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.868801Z","title":"Brush your text: Synthesize any scene text on im- ages via diffusion model, 2023","venue":null,"work_id":"ffd1b062-1c76-49f7-acca-3c4385ca8fc6","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.191824Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:523f409c0f29d5e1940c674318754e0f960ec44909239cfc5ff2aef1bc6be45d","observation_id":"15123d1d-dc64-4163-9353-9272287b781d","resolution":{"observed_at":"2026-08-06T21:07:44.875641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.208944Z","title":"Metaxas, and Praveen Krishnan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.208944Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:839e91de53e7d95cb915b71dfd2135263412c0be08d4babb6c0360a1143239b5","observation_id":"e013010e-7b22-478a-9dac-5799932759f4","resolution":{"observed_at":"2026-08-06T21:07:44.208944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.215339Z","title":"Udifftext: A unified frame- work for high-quality text synthesis in arbitrary images via character-aware diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.215339Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:31d77f1e8be184b4011853e8824cef06067453005f1bdb662124fbcafc850222","observation_id":"4d545e60-7feb-462e-aaf1-9755832c7f90","resolution":{"observed_at":"2026-08-06T21:07:44.215339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.820830Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting, 2023","venue":null,"work_id":"0da9e0ed-3ee0-4925-b036-554ecb793dfe","year":2023},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.221809Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:9e6b1c0bdc1202315b49efea3957cd497900b5a1102e0ebdb0cebf8200c29f4c","observation_id":"b423d296-bef3-413e-9c68-ed34d5f7fceb","resolution":{"observed_at":"2026-08-06T21:07:44.826533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:44.802674Z","title":"Colorflow: Retrieval- augmented image sequence colorization, 2024","venue":null,"work_id":"06a686ff-df83-4a29-a327-d56923e8e890","year":2024},"citing_paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:44.228190Z"},"links":{"citing_paper":"/paper/2507.00992"},"observation_digest":"sha256:2d55111766aa4755b08566263969f713c30c3494ecf66807bd6f534b68986155","observation_id":"9b7ba74b-e7fb-4925-a627-e4edbaa3c848","resolution":{"observed_at":"2026-08-06T21:07:44.808665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00992","last_updated":"2025-07-02T04:08:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:58:36.305028Z","submitted_at":"2025-07-01T17:42:19Z","title":"UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2507.00992."}