{"as_of":"2026-08-18T22:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83ac65f1483f851e4b473d272726f807a4eb48e6dbd71d7e87394a2bb8d3dd28","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:25:59.357898Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T21:23:41.271521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.273805Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"cited_work":{"arxiv_id":"2603.11593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.11593","snapshot_observed_at":"2026-07-20T03:19:15.682913Z","title":"Weedit: A dataset, benchmark and glyph-guided framework for text-centric image editing","venue":null,"work_id":"332d4cb2-01dd-4221-b10d-c05af70c6c22","year":2026},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2603.11593","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:607b264393c57e96750092fd26505188a689aa145096954bb77b2cc3810b84ad","observation_id":"df92818b-f87d-41e2-82f7-820b887676e6","resolution":{"observed_at":"2026-07-20T03:19:15.682913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"cited_work":{"arxiv_id":"2603.11593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.11593","snapshot_observed_at":"2026-07-20T03:19:15.682913Z","title":"Weedit: A dataset, benchmark and glyph-guided framework for text-centric image editing","venue":null,"work_id":"332d4cb2-01dd-4221-b10d-c05af70c6c22","year":2026},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-16T19:26:50.550156Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-02T13:56:43.671622Z"},"links":{"cited_paper":"/paper/2603.11593","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:6244ba3ac7703fae8c647f230f332509b95f44f4f1c2e128330bdba49cc4e165","observation_id":"df6303bf-c7bf-4db1-8a01-e1b46657565a","resolution":{"observed_at":"2026-07-20T03:19:15.682913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"cited_work":{"arxiv_id":"2603.11593","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.11593","snapshot_observed_at":"2026-07-20T03:19:15.682913Z","title":"Weedit: A dataset, benchmark and glyph-guided framework for text-centric image editing","venue":null,"work_id":"332d4cb2-01dd-4221-b10d-c05af70c6c22","year":2026},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-16T19:26:50.550156Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-03T21:23:41.271521Z"},"links":{"cited_paper":"/paper/2603.11593","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:22dcd600607ee868da605f107a4e0dd247cff7060793942401fb5527d3598aae","observation_id":"2f1b7dfd-0f28-4722-907a-2227c894b1d4","resolution":{"observed_at":"2026-07-20T03:19:15.682913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.11593/citation-record","integrity":"/paper/2603.11593/integrity","json":"/paper/2603.11593/citation-record.json","paper":"/paper/2603.11593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.186388Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.186388Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:70dfd54e5ffb720dc87d8147203509db5b066134fa64a1d541788d8c4115974e","observation_id":"497a3e10-6c61-4278-a297-7ab13d62553e","resolution":{"observed_at":"2026-08-02T18:25:50.186388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.287784Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.287784Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:0166c7cbdb3fa6396bb78a5635d24783268f7aaef81de06646051d819009f579","observation_id":"fa3916fd-18c8-4fc3-95e1-c7e840d87ed8","resolution":{"observed_at":"2026-08-02T18:25:50.287784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.345344Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.345344Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:8c1112da765c9cc6522b5330bd712c424c4b9edee2c53f14553dc6d07d706c37","observation_id":"146445f9-fe9d-435d-a2d8-f9b32b0608bd","resolution":{"observed_at":"2026-08-02T18:25:50.345344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.413670Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.413670Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:bc130a46100fb0ca366ab8e4909e1f252b3706a06e7d739bba4cff153ad7e7af","observation_id":"45f39006-f063-4ff9-b389-ceefe0151d11","resolution":{"observed_at":"2026-08-02T18:25:50.413670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.495216Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.495216Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:b5bef193d4efcae8900074b8b942fd0be59f62aa7c9955b4535a59ae0908b9ab","observation_id":"684a42c1-beb0-4463-901b-d4805feb1d91","resolution":{"observed_at":"2026-08-02T18:25:50.495216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.551475Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.551475Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:32824a9e0db68f2497f26c4a856cf8716508b94bac6a89e1c430a44d2a19ba32","observation_id":"568aecae-e2c8-4b06-af5d-15381dcefd73","resolution":{"observed_at":"2026-08-02T18:25:50.551475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.662214Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.662214Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:9fa51f80052053e40ab33c05f474eba8f878fc3481be2a2a0a7679ca5ed8b087","observation_id":"8de09d47-effc-44f4-a828-ee9e6c65fd7a","resolution":{"observed_at":"2026-08-02T18:25:50.662214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.733512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.733512Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:3b4ef28f2817f704fc0c4db97f63d34a7eb6c0345b5a0e61f8f1fb15a2434090","observation_id":"99e45f93-8860-4851-a687-514092a880b0","resolution":{"observed_at":"2026-08-02T18:25:50.733512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.804854Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.804854Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:b5d99630ffc90360018eed809490f4035a7ee64f165a2b883cb457fe5c92d41a","observation_id":"f97792dd-c1c8-4721-b4cc-e8940d11700e","resolution":{"observed_at":"2026-08-02T18:25:50.804854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.867889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.867889Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:1fa6cc994f947167856db442f303fe8e580488e7cc56b9ab37b8dbaa46dd5d15","observation_id":"ad7fb4d6-b8ec-4fdc-bcb6-f471c42695fb","resolution":{"observed_at":"2026-08-02T18:25:50.867889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:50.939236Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:50.939236Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:12030eee2e769716701a7e8beef5b6ba42053b2ccbc29ff0cc2643dfecf5cdda","observation_id":"0ca1954e-efa5-4bd0-8c96-4b7f3a0e05cb","resolution":{"observed_at":"2026-08-02T18:25:50.939236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:51.026361Z","title":"https://blog.google/innovation-and-ai/technology/developers-tools/ gemini-3-pro-image-developers/, 2025.11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.026361Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:a584fa6768a72ccba43c5d246f0ee2b957dc69b8acedfc11f3fbb49d9919df67","observation_id":"c128f45f-1d81-4b06-bc87-7dadb1a09a27","resolution":{"observed_at":"2026-08-02T18:25:51.026361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:25:51.149194Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.149194Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:fbfdd39b9c3ce1c12e681c87e31636f20ea9a75efdff9d4eceacc6572baac49c","observation_id":"c835e926-ff75-476b-bb2c-d70d00eff150","resolution":{"observed_at":"2026-08-02T18:25:51.149194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:51.304223Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.304223Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:f0e037adfad36d87a8abe69fe0053f481dee9130256ac757ee19dfbea33bcda2","observation_id":"7c023666-e061-4857-8ae5-f1f9810cbc0f","resolution":{"observed_at":"2026-08-02T18:25:51.304223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-08-14T05:30:11.702159Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-02T18:25:51.463871Z","title":"Hidream-i1: A high-efficient image generative foundation model with sparse diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.463871Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:ef29f3bb3bee7351d747ae3fa995a373410892442d534c76c5e56e6a79f84d5c","observation_id":"b40c3b83-26c3-4cf3-b1bb-bc1931208efb","resolution":{"observed_at":"2026-08-02T18:25:51.463871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-16T05:43:37.647093Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-08-02T18:25:51.624195Z","title":"Hunyuanimage 3.0 technical report.arXiv preprint arXiv:2509.23951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.624195Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:a6e10e96cae2bb316fc5a0267ab70d5bd2acd02c7b2b2bd87665113d5b9bd4a5","observation_id":"2567134f-1279-4405-a264-17c4562c088e","resolution":{"observed_at":"2026-08-02T18:25:51.624195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03107","last_updated":"2025-06-11T06:11:36Z","snapshot_observed_at":"2026-08-13T15:37:59.000522Z","submitted_at":"2025-06-03T17:39:47Z","title":"ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03107","snapshot_observed_at":"2026-08-02T18:25:51.802196Z","title":"Bytemorph: Benchmarking instruction-guided image editing with non-rigid motions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.802196Z"},"links":{"cited_paper":"/paper/2506.03107","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:1dd55cc1030065d29b59d4706044b631db42b61dcc5bce6424802120c471197f","observation_id":"bf30f40b-4c19-46a6-ae56-9b63bfd7883e","resolution":{"observed_at":"2026-08-02T18:25:51.802196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:51.947062Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:51.947062Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:b09838a8987970c74812f75202da2e3898164ec488eeefd383bcbcfa70be89d5","observation_id":"456bbd3a-cab7-4738-a983-a598b0185aa9","resolution":{"observed_at":"2026-08-02T18:25:51.947062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:52.104904Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.104904Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:d56a7e58a6f51c6d244d3c2ab4ef5c77be6b052ea37e90be92c071d03e8147af","observation_id":"4e31a50d-ece1-4863-8faf-69584b48a3fa","resolution":{"observed_at":"2026-08-02T18:25:52.104904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:52.342580Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.342580Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:32f1c3cc46d427ccdaf2d26db6a4262c7d0e9f3c1294395a51c20c1990e6b22b","observation_id":"eb830778-b908-4c77-8592-84a3490ae6d5","resolution":{"observed_at":"2026-08-02T18:25:52.342580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-02T18:25:52.501547Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.501547Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:bd7c854fa1a8cd5e0fabe2b06f06523d4e22180a705be1668c6d11ef505c8fe5","observation_id":"e2391c0d-6086-4f42-b788-8402b6c26b5d","resolution":{"observed_at":"2026-08-02T18:25:52.501547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-02T18:25:52.604284Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.604284Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:2f854b4fbe108496c846ed194c4829453026d2e820a0b0b069a6af7ed1bf96a3","observation_id":"35772a41-bbc4-4737-b365-352d08d46ff9","resolution":{"observed_at":"2026-08-02T18:25:52.604284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-02T18:25:52.779316Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.779316Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:6af505ad2f6b57522d82c0106003334f02f9d5123be53533895631fe215f7368","observation_id":"1a42ac87-73fd-44eb-81cb-aa8f4a00da49","resolution":{"observed_at":"2026-08-02T18:25:52.779316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:52.978785Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.978785Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:225512c98b156b1b63d9e01a0440c96082ba521cfbd9afe172adef8690890770","observation_id":"51b6c7f2-3be6-4c69-82ed-ed014c7f86d9","resolution":{"observed_at":"2026-08-02T18:25:52.978785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:53.215287Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.215287Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:30d5dc2c94f71502a14e8292cfc9348eae5d0ca76974aba786d1983a0da1d4e4","observation_id":"d3a00fa5-fd29-44a6-82b5-16b0c64d03a7","resolution":{"observed_at":"2026-08-02T18:25:53.215287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-16T13:53:57.994391Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-02T18:25:53.388773Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.388773Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:202ae3e841b35abec2dfecc75bc8fdab95776be20e327bea992d81429c0ebb85","observation_id":"a1c7b072-6116-4d0d-9a7a-7cef17bd31ae","resolution":{"observed_at":"2026-08-02T18:25:53.388773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-08-16T15:39:15.923412Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-02T18:25:53.536048Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.536048Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:f1f3f505e0f4e3ad341262db6c6c96f915a52875f3e69d45aac9425f3852aae1","observation_id":"919939fb-0d9f-4c8d-a67c-7a9c0b4a7902","resolution":{"observed_at":"2026-08-02T18:25:53.536048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:53.663986Z","title":"Unireditbench: A unified reasoning-based image editing benchmark.arXiv preprint arXiv:2511.01295, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.663986Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:dd5d74dbdfadc858e20949a41c9785ba68c139e81b6821e9e2e874c4ed87e0ad","observation_id":"eadedf43-2507-4b54-b214-32650a25e9df","resolution":{"observed_at":"2026-08-02T18:25:53.663986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:53.819052Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.819052Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:52c3f0ab74d91939984d9255609637c6f39e28058277cebf97b61f8f1757e1d0","observation_id":"09c77f50-4dae-46dd-8e64-9410fe17cf2c","resolution":{"observed_at":"2026-08-02T18:25:53.819052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:53.968106Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:53.968106Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:1d08cd88c35d5b8c54d1153eb8e3df0bedd8a78bcac453b24c0f92ea11ff75bf","observation_id":"331bf65c-f5cc-49c9-9333-b1972737565e","resolution":{"observed_at":"2026-08-02T18:25:53.968106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:54.068225Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.068225Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:991de1a2bc2c6bce854e4e14ef2360b3ec968c4199e69bc0043d3c6e40d29542","observation_id":"d1649735-bfc7-4142-8104-870464c24b91","resolution":{"observed_at":"2026-08-02T18:25:54.068225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-17T23:31:59.305347Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-02T18:25:54.225573Z","title":"In-context lora for diffusion transformers.arXiv preprint arXiv:2410.23775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.225573Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:9eb6bc4d46ca4ba98ea3adbe37445d4a57af68777787a31a4ff026f985f222b7","observation_id":"e56911de-a6d2-4c4b-be43-06436abed170","resolution":{"observed_at":"2026-08-02T18:25:54.225573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:54.311943Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.311943Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:fe3cf0a3e220956de3b4fce91917dc5b66f867c4340011bb35c6ad8213b7a26b","observation_id":"3fdad22e-0ecd-430e-a9d5-0526859c900f","resolution":{"observed_at":"2026-08-02T18:25:54.311943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01744","last_updated":"2025-06-06T17:53:30Z","snapshot_observed_at":"2026-08-16T13:13:16.474767Z","submitted_at":"2024-10-02T16:55:01Z","title":"Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01744","snapshot_observed_at":"2026-08-02T18:25:54.474338Z","title":"Leopard: A vision language model for text-rich multi-image tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.474338Z"},"links":{"cited_paper":"/paper/2410.01744","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:392203ceffa394483f7c074c097a26e9c60cfb9fc007e8d657cebba43b59bb6a","observation_id":"872371d5-98bb-46c7-8d72-2500494c21c9","resolution":{"observed_at":"2026-08-02T18:25:54.474338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-02T18:25:54.610097Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.610097Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:e025724791381802afaef6745b9a14d40802e90ed3d7594a1769bbc5debd546e","observation_id":"06e74491-959a-417f-8b03-cd91c75ea3e3","resolution":{"observed_at":"2026-08-02T18:25:54.610097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:54.745982Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.745982Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:5de92151460ae93262a29822bb96c4e5af5ffd183e69c275f68bad9514121564","observation_id":"5cfd87b4-bac1-457d-9fe1-a919a15b76d8","resolution":{"observed_at":"2026-08-02T18:25:54.745982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:54.809757Z","title":"Flux.1-dev.https://blackforestlabs.ai/announcing-black-forest-labs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.809757Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:36d343327082f26432b10887f32603c7d1a5f2bbbc818503a8213908d196da12","observation_id":"c334d8dd-f2d8-43f7-b8c7-452b0e6eb3c9","resolution":{"observed_at":"2026-08-02T18:25:54.809757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:54.871940Z","title":"Flux.2-dev.https://huggingface.co/black-forest-labs/FLUX.2-dev, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:54.871940Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:db1f4f0962ddcfc575a3de637721df69c139ff882df851c3058bb811d930e447","observation_id":"495d9cf3-c497-4509-8b50-beb7b27a7293","resolution":{"observed_at":"2026-08-02T18:25:54.871940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-02T18:25:55.060368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.060368Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:6bde087c78e22b1627d8611a5d5928562c7143f76a9e32f757ea6d622eb52690","observation_id":"6bf21ce2-0a0d-407f-9625-e62dfefbb164","resolution":{"observed_at":"2026-08-02T18:25:55.060368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:55.213315Z","title":"What matters when building vision-language models? NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.213315Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:0d807ed8152b2644fe1098156d25aa7ebf3f7648923379f5a4acbc665cc9f0f0","observation_id":"bba047c2-70b0-4cae-b344-e39b02c06f8e","resolution":{"observed_at":"2026-08-02T18:25:55.213315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09029","last_updated":"2024-03-14T01:40:40Z","snapshot_observed_at":"2026-08-16T14:09:59.275779Z","submitted_at":"2024-03-14T01:40:40Z","title":"Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09029","snapshot_observed_at":"2026-08-02T18:25:55.359076Z","title":"Unlocking the conversion of web screenshots into html code with the websight dataset.arXiv preprint arXiv:2403.09029, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.359076Z"},"links":{"cited_paper":"/paper/2403.09029","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:65a364714b9d0037cc2b76f325e8bab70fd8d01f3e79b8a1de8952079e611e28","observation_id":"9082ce14-9fd9-4036-84f6-92f924a6e56b","resolution":{"observed_at":"2026-08-02T18:25:55.359076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-15T05:27:54.901099Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-02T18:25:55.487831Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.487831Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:e8c7dbfbf824c65d22686046c912ab0ea2a7f397260889499bfa3b91018e7012","observation_id":"b53cd30e-aeaf-490c-a020-e02ce5c46acd","resolution":{"observed_at":"2026-08-02T18:25:55.487831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:55.562254Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv e-prints, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.562254Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:a0bcc77bf8b7efa240301e85c0cd99a64519feb684d00a8d23cd567cb4c6df29","observation_id":"30d4fdce-1a39-4ca0-ae5f-eba2bd783e86","resolution":{"observed_at":"2026-08-02T18:25:55.562254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-08-16T11:51:43.064429Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16888","snapshot_observed_at":"2026-08-02T18:25:55.636781Z","title":"Uniworld-v2: Reinforce image editing with diffusion negative-aware finetuning and mllm implicit feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.636781Z"},"links":{"cited_paper":"/paper/2510.16888","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:8cf61d3e279fc2beed7ea55981d3e7c17586b230eabba2dda5acd7c3a8e6e963","observation_id":"46220900-93bc-4278-bf64-e650f2e2257e","resolution":{"observed_at":"2026-08-02T18:25:55.636781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-02T18:25:55.733988Z","title":"Uniworld-v1: High-resolution semantic encoders for unified visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.733988Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:27f048e3b3e3bc80e8c8454e0b13c3e0318116a7d5e3944503b61ba7579c2d84","observation_id":"7b1be1e1-25e7-4926-9bb4-68e645d6a4c9","resolution":{"observed_at":"2026-08-02T18:25:55.733988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-16T13:18:02.646429Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-02T18:25:55.817521Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.817521Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:cd1e64af957dbed36d8cfb4202ef0c3544c9e07c2af99bcb1b4b77ad06ce0feb","observation_id":"fa2482c6-3010-442f-898e-3e3ff850af99","resolution":{"observed_at":"2026-08-02T18:25:55.817521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:55.869754Z","title":"Flow-grpo: Training flow matching models via online rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.869754Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:3aeb516ba55cd0caa2c353a6487a0b038d36a56cdafb8888543d5d1a2c5c93af","observation_id":"1fe61889-8328-4bf2-bd87-4fe5ac2784db","resolution":{"observed_at":"2026-08-02T18:25:55.869754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-02T18:25:55.936773Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprintarXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.936773Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:92f951532b4ad5a9650ac078012ce433241679eeea46ddbdda6d3535d6a126a2","observation_id":"c844d8df-2da4-48e5-b9c0-3d29eae4278d","resolution":{"observed_at":"2026-08-02T18:25:55.936773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.011659Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.011659Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:6c41701253fd914546b3506385abb433d8a1a2ce5cfe48955f792c746be0907e","observation_id":"1fcd1dfb-8d87-4f65-8286-f13486f64d2d","resolution":{"observed_at":"2026-08-02T18:25:56.011659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.085866Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.085866Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:4619f8d5b29c2d1eaf12c25f0d7c79c90705c0ea17f024b1e51bf8603a3baeca","observation_id":"2dc8c338-17d4-4d84-8b48-7411e84012f7","resolution":{"observed_at":"2026-08-02T18:25:56.085866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10208","last_updated":"2024-07-12T16:26:40Z","snapshot_observed_at":"2026-08-18T20:06:25.680652Z","submitted_at":"2024-06-14T17:44:09Z","title":"Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10208","snapshot_observed_at":"2026-08-02T18:25:56.191301Z","title":"Glyph-byt5- v2: A strong aesthetic baseline for accurate multilingual visual text rendering.arXiv preprint arXiv:2406.10208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.191301Z"},"links":{"cited_paper":"/paper/2406.10208","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:7e2d57166736687610c18be4f49338f37c7156226a38c1b1ecf392f4fc4ef2e2","observation_id":"5b01989d-772e-4e26-a67c-ca269beabb75","resolution":{"observed_at":"2026-08-02T18:25:56.191301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.283730Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.283730Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:2e67fc7f0c835ced76c7c005d89649e71b1c40e27c2fdce1278ec6669607d228","observation_id":"d4c4c8d9-0b1f-44d7-b4d7-3212ace3aede","resolution":{"observed_at":"2026-08-02T18:25:56.283730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-18T18:23:41.968310Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-08-02T18:25:56.357238Z","title":"Glyphdraw: Seamlessly rendering text with intricate spatial structures in text-to-image generation.arXiv preprint arXiv:2303.17870, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.357238Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:b82c71174efb1ab11e95d957d4cb8701c7bca322cf5c49feec55d648de4c12f0","observation_id":"53b7500e-ca88-4854-8171-9f19b3084096","resolution":{"observed_at":"2026-08-02T18:25:56.357238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.457872Z","title":"X2edit: Revisiting arbitrary- instruction image editing through self-constructed data and task-aware representation learning.arXiv preprint arXiv:2508.07607, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.457872Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:aafd7fe75d76bfa8da655611f10006fda3b1104f61441ad4de826b6df9418903","observation_id":"7dc32abf-7197-457c-8f8c-9f16fd6096e9","resolution":{"observed_at":"2026-08-02T18:25:56.457872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.564178Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.564178Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:d8b88b4ec5c523d5486ee45c36fc3bd5ab41f64a1b1b61b93585b17ce2bee4b6","observation_id":"0294cc2f-ca87-4f7d-aa2c-ee30d5908766","resolution":{"observed_at":"2026-08-02T18:25:56.564178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.633486Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.633486Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:ccaa91a462b23cbcb6316638ec77f762bfbb38a9ffcb81d464d4e310294eb826","observation_id":"dc4062f6-1556-4adf-97c1-c8ac0c018501","resolution":{"observed_at":"2026-08-02T18:25:56.633486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.702842Z","title":"Pico-banana-400k: A large-scale dataset for text-guided image editing.arXiv preprint arXiv:2510.19808, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.702842Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:d4fd8f6c603b3f3e43f5c5abe427006dc1bc6bdbca5c785e1a2df1f3e1136359","observation_id":"fc0b4974-ded4-4683-82f7-ea997df2c7ee","resolution":{"observed_at":"2026-08-02T18:25:56.702842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.790489Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.790489Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:ae8c84d035797c69932f38d783ed5cb670a355cce5798b312392b5eb097fd225","observation_id":"5a01faa9-f004-41db-904e-213313b699ea","resolution":{"observed_at":"2026-08-02T18:25:56.790489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.867973Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.867973Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:f8372d2cd878bde11cbd33ce366943409830995cee8dc213198b5d7e81cdb52b","observation_id":"08ea00fd-9087-42be-9b16-2a47ae0e877d","resolution":{"observed_at":"2026-08-02T18:25:56.867973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.934873Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.934873Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:eb6886e1bec15172937ffa819311b3ec7bb387502a1db3887a5ec80da62f0c4a","observation_id":"1384296f-078b-4a63-8a99-3c3f469c2269","resolution":{"observed_at":"2026-08-02T18:25:56.934873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:56.988929Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:56.988929Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:4be295b83dc3e0429f4bf411ac274a04bca84f1e8627f83c5e9bc98e31d8fdb7","observation_id":"0c15b93a-2886-430f-8b47-b98ff3dabaa2","resolution":{"observed_at":"2026-08-02T18:25:56.988929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.094195Z","title":"MIT press, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.094195Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:2a7b600db56a24222db48ca9c80e0cc8e3155346119f1d882df5a3cae6572e09","observation_id":"dea0fc42-9d44-41b5-88cb-4a6ae793da5d","resolution":{"observed_at":"2026-08-02T18:25:57.094195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.180839Z","title":"Ominicontrol: Minimal and universal control for diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.180839Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:9bd458d6cf62456657ed31d47e6e3a89fbb839af128bd364bcce2a3184825ada","observation_id":"d21b5d1b-19af-4291-9c77-d77f5f3010fc","resolution":{"observed_at":"2026-08-02T18:25:57.180839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-08-16T15:04:17.022785Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-02T18:25:57.227130Z","title":"Longcat-image technical report.arXiv preprint arXiv:2512.07584, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.227130Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:bd8ea7d1dd86ffe0394e01e45d9c76596c5fee7155f9fb32034ad54377a43093","observation_id":"90ecf533-48e8-4a48-bf94-91fda535ab25","resolution":{"observed_at":"2026-08-02T18:25:57.227130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.312745Z","title":"Firered-image-edit-1.0 techinical report.arXiv preprint arXiv:2602.13344, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.312745Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:452e00c5e611c5440df8a68bc90893ad803b2a44b12ed847e4675d62e19b8b02","observation_id":"d20801b6-3697-433d-bce6-aad5659dc08a","resolution":{"observed_at":"2026-08-02T18:25:57.312745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-18T18:25:23.717451Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-02T18:25:57.379685Z","title":"Anytext: Multilingual visual text generation and editing.arXiv preprint arXiv:2311.03054, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.379685Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:032019ef8f498e865be8ce42754fab00487d0b879a980d087f369ea3180c0c4a","observation_id":"22e4bc87-69f7-4303-8334-90d22498be55","resolution":{"observed_at":"2026-08-02T18:25:57.379685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.439520Z","title":"I2i-bench: A comprehensive benchmark suite for image-to-image editing models.arXiv preprint arXiv:2512.04660, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.439520Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:ea53abc73aad8d7a35e4837197813f67f0847d95942bd661c1dd1b4e199c2821","observation_id":"3c6ff124-2ebf-49e2-be4e-9ed7b45cf401","resolution":{"observed_at":"2026-08-02T18:25:57.439520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-12T23:50:24.433472Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-02T18:25:57.474554Z","title":"Gpt-image-edit-1.5 m: A million-scale, gpt-generated image dataset.arXiv preprint arXiv:2507.21033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.474554Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:4450019643e915c9143ae73741ce7d60e04c889448e979bf2a0ba5d2e3a3f792","observation_id":"f74e0d7c-be25-4471-8ba8-b45fe48e28f6","resolution":{"observed_at":"2026-08-02T18:25:57.474554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.523572Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.523572Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:4eec6a3284ea9bb2c0afed4e71368488185af133cd3aef2800d86ac3d949ceb5","observation_id":"1d2f2c6e-9ede-441e-8e68-bdae169a014c","resolution":{"observed_at":"2026-08-02T18:25:57.523572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.573589Z","title":"Chain-of-thought prompting elicits reasoning in large language models.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.573589Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:c7539df8530a113f9acd442df65756e345906db7e12f4d09e5d067905bdc1c39","observation_id":"f009c49c-861d-4c5b-9dde-b8404fe561d4","resolution":{"observed_at":"2026-08-02T18:25:57.573589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-02T18:25:57.635235Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.635235Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:905739880f00a54fcb7e09e90269f35df0505bbb0f7f691ee3273a5f210461b5","observation_id":"411af40f-e151-46cf-b848-fdc318aa1ce5","resolution":{"observed_at":"2026-08-02T18:25:57.635235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-08-18T21:48:45.801096Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-02T18:25:57.683143Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.683143Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:d4cb13e0a62a7618a767d6fc6727bee4047a8e838ccc607438381e5642bf71e8","observation_id":"a3bdcf0c-3a3a-4055-8e2e-283613f01ae2","resolution":{"observed_at":"2026-08-02T18:25:57.683143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.758850Z","title":"Chronoedit: Towards temporal reasoning for image editing and world simulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.758850Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:a9b67b5a2c2bc8326eec92f90b112f9b8eba6415fee0c8aef5086fc7f3cb5888","observation_id":"063dd370-6886-4a33-91fd-024be025a392","resolution":{"observed_at":"2026-08-02T18:25:57.758850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.918642Z","title":"Editreward: A human-aligned reward model for instruction-guided image editing.arXiv preprint arXiv:2509.26346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.918642Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:fb3f44311f05acfb4c99e666e4138a3cba65a2d2227585ea837a5740b5a33d8a","observation_id":"14b1cc6b-39cb-4900-bcbd-b2a2c54db953","resolution":{"observed_at":"2026-08-02T18:25:57.918642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:57.965240Z","title":"Less-to-more generalization: Unlocking more controllability by in-context generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.965240Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:cfd00cf3f636d0aa527f0d8d7bcb60e82bbd7641811dabdcc4feedd9945c07a2","observation_id":"80dd6ab2-3b5f-47e4-a4ae-00b74a611bd7","resolution":{"observed_at":"2026-08-02T18:25:57.965240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.019139Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.019139Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:0d03555f8eb3d6fe828eed6f2e9c5612c634bfb63c00d2fa084ee4996934b456","observation_id":"4d28bdc7-a608-4efe-9acd-af421db85222","resolution":{"observed_at":"2026-08-02T18:25:58.019139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.095839Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.095839Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:2f2211dc8ba88c8b06f01b387090032c6c10352b6348dfa54fc98d3cfa501e15","observation_id":"eb5f8bdd-de55-4791-ac88-71976b7a85ae","resolution":{"observed_at":"2026-08-02T18:25:58.095839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-08-15T21:26:30.952106Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-02T18:25:58.162492Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.162492Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:b03d2cebe223dc3a7021f68dde65aaffec803525a3ac262f75491f68d338fffa","observation_id":"e6718861-7cda-4028-a645-ffdad54657b9","resolution":{"observed_at":"2026-08-02T18:25:58.162492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.243104Z","title":"Glyphcontrol: Glyph conditional control for visual text generation.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.243104Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:785504df3ae8c9363c4faf8cf6dbd35bae0b0901d92f3cb4e7d55856a57faf61","observation_id":"4cac92d7-2605-46d4-b882-db3732ea784e","resolution":{"observed_at":"2026-08-02T18:25:58.243104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-16T09:12:52.847939Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-02T18:25:58.290824Z","title":"Echo-4o: Harnessing the power of gpt-4o synthetic images for improved image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.290824Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:17f13188b6fbb107b97405e0780a18c22a0d3256a93e70d257e5cc55b896b51d","observation_id":"431cceef-dc42-4ef3-a2e3-06fdd4459c29","resolution":{"observed_at":"2026-08-02T18:25:58.290824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-02T18:25:58.358063Z","title":"Imgedit: A unified image editing dataset and benchmark.arXiv preprint arXiv:2505.20275, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.358063Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:b46978d9f1218edc70de1e809bf9864b0279479d78de4aee5f7d31bb444445f8","observation_id":"0990e47d-aaf8-45e9-885f-c7077b2a7913","resolution":{"observed_at":"2026-08-02T18:25:58.358063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.438027Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.438027Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:708407fa3a3eae31ed370e8e3319f753d30e43e79a4a4ebdeae075954cd72639","observation_id":"51df0a60-8feb-4791-9d38-1068ef9c86ca","resolution":{"observed_at":"2026-08-02T18:25:58.438027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.514838Z","title":"Creatilayout: Siamese multimodal diffusion transformer for creative layout-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.514838Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:dff6cbb028543aac162d13b9446d98b12ca9a154a873b6f2d8eae4e2538a91cd","observation_id":"12839497-cd86-48bf-817d-5a082a2eab51","resolution":{"observed_at":"2026-08-02T18:25:58.514838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.566345Z","title":"Creatidesign: A unified multi-conditional diffusion transformer for creative graphic design","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.566345Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:e46671b5bf9261ecdf438205fc775281124b20565cd215dc9e2813dfbc714e2f","observation_id":"f7b425f2-8f5a-4f8f-b815-58e6af5e864c","resolution":{"observed_at":"2026-08-02T18:25:58.566345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.625258Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.625258Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:9dda72d0befc98980df316caca7a9435fd4d688471243fe67191c9ea6793dad7","observation_id":"7540a95b-56ab-4e79-8db2-7e0449bde025","resolution":{"observed_at":"2026-08-02T18:25:58.625258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.691643Z","title":"Enabling instructional image editing with in-context generation in large scale diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.691643Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:1075ffdca194034275c94d5af685624e172f773cbd2c6ae977354cb991d2ba61","observation_id":"2ee31b4d-eeb3-460f-9210-3b8c60e2bde9","resolution":{"observed_at":"2026-08-02T18:25:58.691643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10890","last_updated":"2025-06-12T16:54:39Z","snapshot_observed_at":"2026-08-18T18:29:00.356709Z","submitted_at":"2025-06-12T16:54:39Z","title":"CreatiPoster: Towards Editable and Controllable Multi-Layer Graphic Design Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10890","snapshot_observed_at":"2026-08-02T18:25:58.771116Z","title":"Creatiposter: Towards editable and controllable multi-layer graphic design generation.arXiv preprint arXiv:2506.10890, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.771116Z"},"links":{"cited_paper":"/paper/2506.10890","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:e4e17da6b17f609fc6690f833e4c5f465f402c9b858ba9f815487ef1149d9ec1","observation_id":"f601a3ca-b9ea-47a5-9d97-14c509e5cc1c","resolution":{"observed_at":"2026-08-02T18:25:58.771116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.839910Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.839910Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:4482e4a4f02680527fc3d727e583feae3b3be5e41936fc67cb475e050e212090","observation_id":"989c3d6b-5231-4c63-9f74-9d3b9353c53e","resolution":{"observed_at":"2026-08-02T18:25:58.839910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02826","last_updated":"2025-05-27T15:54:58Z","snapshot_observed_at":"2026-08-18T20:22:46.816439Z","submitted_at":"2025-04-03T17:59:56Z","title":"Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02826","snapshot_observed_at":"2026-08-02T18:25:58.919055Z","title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.919055Z"},"links":{"cited_paper":"/paper/2504.02826","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:633677b7170f3efda32522d307cecaa3b12813f3e428af29e65e2ebdef3b4d0a","observation_id":"1cf4fa16-dfd6-4b08-b7f6-d075b5abe4a3","resolution":{"observed_at":"2026-08-02T18:25:58.919055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:58.963382Z","title":"Udifftext: A unified framework for high-quality text synthesis in arbitrary images via character-aware diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.963382Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:78c5bbb2cf9c98611ff613bb62585ff15e7b60f78b9c3c550fdbff8edecfd69d","observation_id":"a1834dcb-3031-4e85-b99b-d94bf50e2f80","resolution":{"observed_at":"2026-08-02T18:25:58.963382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-08-17T17:00:34.924478Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-08-02T18:25:59.032945Z","title":"Diffusionnft: Online diffusion reinforcement with forward process.arXiv preprint arXiv:2509.16117, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:59.032945Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:5f10aa173049ee327fd4c20218433dc4ce52b799bf75b93920105c555c79548d","observation_id":"06b307c4-bef8-4c60-994c-6850f400a37d","resolution":{"observed_at":"2026-08-02T18:25:59.032945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:59.113573Z","title":"Cogview3: Finer and faster text-to-image generation via relay diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:59.113573Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:332a6f7eed216ac4d28d3662bf73c053950d6423279b7092a5165a69e4cec594","observation_id":"1522fcd8-63bc-4efe-b417-781b6cd67933","resolution":{"observed_at":"2026-08-02T18:25:59.113573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:59.205393Z","title":"Migc++: Advanced multi-instance generation controller for image synthesis.TPAMI, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:59.205393Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:f1a6d5349f7f3ec48e6744158af68af8de227d502358e64733123542861a0c49","observation_id":"872000da-919a-4644-9c49-aa51132d62dc","resolution":{"observed_at":"2026-08-02T18:25:59.205393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:59.288837Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:59.288837Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:d8f8b1ab0f887d3c38275f23f5dea79e5a331631ff62153b8f52f09fab2cc45b","observation_id":"7c2f8687-c5f5-4576-a668-b86236d8a422","resolution":{"observed_at":"2026-08-02T18:25:59.288837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:25:59.357898Z","title":"Dreamrenderer: Taming multi-instance attribute control in large-scale text-to-image models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:59.357898Z"},"links":{"citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:9472789ae9c90b05d85e87a1d82bc774f1a6390abf363ba90b9572277e804a5b","observation_id":"05e95358-a391-4f02-8e55-547ce4fd6325","resolution":{"observed_at":"2026-08-02T18:25:59.357898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 3 inbound Pith citation observations for arXiv:2603.11593."}