{"as_of":"2026-08-11T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13b307b1365a4a8e4b3ae02aa4debf77bb47d87c9315724c0eec1c7ee69cd935","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T07:47:34.464711Z","state":"measured"},{"denominator":193,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":193,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":168,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:44.468825Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:46:41.215139Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-07T05:25:44.468825Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-09T14:38:22.529752Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:44.468825Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2506.07977"},"observation_digest":"sha256:9e13643461166db32d6b5dc23096ce5c951c9135b3cd6d390cfd104f4bf66056","observation_id":"c67b9732-02e1-478b-8c54-be1a6568717f","resolution":{"observed_at":"2026-08-07T05:25:44.468825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:aa7d08e5cda6b8b899a97660b2bf95bdde485ffae7b959c4f290c82b2e7be069","observation_id":"57d336e4-0130-43a1-9f55-007a8c728c3d","resolution":{"observed_at":"2026-05-12T18:51:15.772653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-06T22:31:39.642465Z","title":"a dog” or “a tree stump","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21416","last_updated":"2025-06-26T16:04:16Z","snapshot_observed_at":"2026-08-10T11:21:16.777585Z","submitted_at":"2025-06-26T16:04:16Z","title":"XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:39.642465Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2506.21416"},"observation_digest":"sha256:ae763efe5de6a682efd9ebc2e0edb9c82546ba697610b6c2449373a559d12680","observation_id":"c6695ebe-3967-4611-900a-7da26f6548a4","resolution":{"observed_at":"2026-08-06T22:31:39.642465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-06T22:01:20.967384Z","title":"OmniGen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.967384Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:6d77fe735ac1c2c2e33d95d789cf72c94b573233a7ff087a6ca4cd90bb5a9bca","observation_id":"df0d8873-5fd2-4ce5-9671-a01b95f3a8e0","resolution":{"observed_at":"2026-08-06T22:01:20.967384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-06T13:05:39.715086Z","title":"net/forum?id=Hlm0cga0sv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-10T22:57:25.438394Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:05:39.715086Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2507.21033"},"observation_digest":"sha256:52017619205561dc6bf9cd2c41d4bfbb2638b660315612e60a8bbbd02bd77553","observation_id":"74e7d532-c840-4003-b8b1-7aa5177ed517","resolution":{"observed_at":"2026-08-06T13:05:39.715086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-06T12:10:08.247786Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:10:08.247786Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2507.22058"},"observation_digest":"sha256:d41371fb68820f1c9ffba38fc3f2f9af87f8c9e09d0d2039438b8406f357de0d","observation_id":"0317847f-23ca-44d5-ad3c-a9b2990ae033","resolution":{"observed_at":"2026-08-06T12:10:08.247786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:29:06.883874Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2508.02324"},"observation_digest":"sha256:594454b266c899337f97435859440b94c962fd37ab51eead460283f961209d1b","observation_id":"2fcca5d7-f0e3-42cd-aa47-7cb2d58663e5","resolution":{"observed_at":"2026-05-10T14:29:07.083490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-05T20:44:16.475472Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.475472Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0780b89d7611f6ea5042f7094e99860c8c55748064a6506e4cfb616cba4b31a8","observation_id":"276f6e35-9182-4dfc-a0df-9f322ea10bf2","resolution":{"observed_at":"2026-08-05T20:44:16.475472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-05T16:07:24.709716Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18966","last_updated":"2025-08-26T12:10:24Z","snapshot_observed_at":"2026-08-10T12:07:58.643256Z","submitted_at":"2025-08-26T12:10:24Z","title":"USO: Unified Style and Subject-Driven Generation via Disentangled and Reward Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T16:07:24.709716Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2508.18966"},"observation_digest":"sha256:1c8ff715cd6043c7706d213e0b2882c74c3c0c2b7742a868e4e69e530b439b1a","observation_id":"bac6495b-4c04-458e-b93f-75e5e925cdec","resolution":{"observed_at":"2026-08-05T16:07:24.709716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-05T12:53:41.973087Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01181","last_updated":"2025-09-01T07:06:36Z","snapshot_observed_at":"2026-08-06T10:09:29.462010Z","submitted_at":"2025-09-01T07:06:36Z","title":"FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:53:41.973087Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.01181"},"observation_digest":"sha256:5d3dbc290a3af39522ff21cec7eb4037f371971e21de7d1bf33484cf3c6e0d8e","observation_id":"33e764d5-9f95-4abd-a8a4-42e0097ae95d","resolution":{"observed_at":"2026-08-05T12:53:41.973087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-05T12:04:28.975261Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01977","last_updated":"2025-09-02T05:40:07Z","snapshot_observed_at":"2026-08-10T11:21:45.793993Z","submitted_at":"2025-09-02T05:40:07Z","title":"MOSAIC: Multi-Subject Personalized Generation via Correspondence-Aware Alignment and Disentanglement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:04:28.975261Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.01977"},"observation_digest":"sha256:7a3dfd352d83252bd9bfc7608978112b8b50ff408362a2ee9da9febb94b53c8a","observation_id":"0cd68c83-9b9a-4dc1-8953-e73c63c7c53e","resolution":{"observed_at":"2026-08-05T12:04:28.975261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T23:06:09.110105Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06818","last_updated":"2025-09-08T15:54:55Z","snapshot_observed_at":"2026-08-07T03:29:53.530054Z","submitted_at":"2025-09-08T15:54:55Z","title":"UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:06:09.110105Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.06818"},"observation_digest":"sha256:fbeaeef3edfff5f82920c23569676b5abf9809c5522a059bae166b8984eba0ce","observation_id":"5be15ec2-2c39-4bb6-ad8c-3a652241a015","resolution":{"observed_at":"2026-08-04T23:06:09.110105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T22:55:44.967227Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-07T20:36:07.154043Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.967227Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:1cab89fdfab0367eb0c6d9ef2217123e48227f2afc2271a63293360d03fff348","observation_id":"84579299-7ced-436f-8ae8-b816cbe7fedd","resolution":{"observed_at":"2026-08-04T22:55:44.967227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T22:36:08.233784Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.233784Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:16cead9a1b0917796a770584b76c655e5bd1d454659b6699962ca7e70f37b701","observation_id":"b8339fa3-58e9-4268-a468-04193c791a09","resolution":{"observed_at":"2026-08-04T22:36:08.233784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T18:48:03.845193Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.845193Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:7c8f44f82909cfac0b685b7d9093c671e0fc7715bda61e388de90b2d0302ec2c","observation_id":"41db8f31-f4b4-4a70-b193-2734420b0857","resolution":{"observed_at":"2026-08-04T18:48:03.845193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T15:39:40.863193Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-04T15:39:16.754746Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:40.863193Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:e647a459564cb4f0dd790c197d04723ac4e834f541239cd9fc9bb1c1412a6a56","observation_id":"4604da4f-afdc-492d-8ad8-bf46b607764f","resolution":{"observed_at":"2026-08-04T15:39:40.863193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T13:44:09.835527Z","title":"Omnigen2: Exploration to advanced multimodal generation, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25682","last_updated":"2026-06-30T07:06:33Z","snapshot_observed_at":"2026-08-09T12:23:04.844284Z","submitted_at":"2025-09-30T02:36:40Z","title":"Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T13:44:09.835527Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.25682"},"observation_digest":"sha256:53653c18796c40b9aa9ee0de73a9aad0949e04c11e88b1fe6d8804d75c20d8f7","observation_id":"68362cee-3233-4960-8091-bf7eb83ddc59","resolution":{"observed_at":"2026-08-04T13:44:09.835527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T10:47:12.656350Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08532","last_updated":"2026-07-21T10:18:45Z","snapshot_observed_at":"2026-08-08T06:26:02.256146Z","submitted_at":"2025-10-09T17:51:03Z","title":"Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T10:47:12.656350Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2510.08532"},"observation_digest":"sha256:e8797e7f892f7c51d4e92e75a9c221844e2801d34ceaa665e2e53cdb24e00422","observation_id":"d0d8e164-b510-4ecb-9384-2566a2feea1a","resolution":{"observed_at":"2026-08-04T10:47:12.656350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2510.20512","last_updated":"2026-08-10T11:31:48Z","snapshot_observed_at":"2026-08-11T09:19:21.654236Z","submitted_at":"2025-10-23T12:56:33Z","title":"Adversarial Concept Distillation for One-Step Diffusion Personalization","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-18T04:50:01.364000Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2510.20512"},"observation_digest":"sha256:2f45747c7abe2417ad7091caa148b9e824ce5ac26a0fc4280ddbffc110fcf984","observation_id":"ca619714-e36c-48d0-939b-d8e4c6ae6da9","resolution":{"observed_at":"2026-05-18T04:50:53.709691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:022424a1e48146ef336bb4b6c9dc4be24e099f45c8b5fa33ef09ec5cd204a1cc","observation_id":"32282b4f-8d65-4661-b3fc-7d3bb3cb4a24","resolution":{"observed_at":"2026-05-18T01:12:13.597119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T21:09:25.470721Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-06T04:41:40.984877Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:25.470721Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.16672"},"observation_digest":"sha256:5554ca660f860ef63205a5335d5c35e019b357e474bc173cb937984249b10b43","observation_id":"9ce26491-9f90-47a9-bab3-09760e8f20b4","resolution":{"observed_at":"2026-08-03T21:09:25.470721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2511.19365","last_updated":"2026-04-08T04:08:23Z","snapshot_observed_at":"2026-08-11T04:23:34.279866Z","submitted_at":"2025-11-24T17:59:06Z","title":"DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T05:47:24.669763Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.19365"},"observation_digest":"sha256:88efe66c97359a39c010913b65a5e687c7970649bff4a393e6b5182757801498","observation_id":"7491b3a8-d985-448c-a654-e3d6fca166e1","resolution":{"observed_at":"2026-05-17T05:49:08.249750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T06:47:09.354756Z","title":"Omnigen2: Exploration to advanced multimodal 10 generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.354756Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:e75e25300b12ec21fdad980edf73cc83dfc948a4a4024ebdb36f39b10ac611b6","observation_id":"fe4599e1-f29a-4df5-9c6c-ec9a0030f03f","resolution":{"observed_at":"2026-08-04T06:47:09.354756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-08-11T08:21:56.075227Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T04:17:07.534291Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.22663"},"observation_digest":"sha256:c238553681b1ac04824fc5bd25e2d719202b022983ea5861650d30fd17d17c2f","observation_id":"11b91c64-a878-487a-bb71-a56fb007dc49","resolution":{"observed_at":"2026-05-17T04:19:00.546980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1babd5850c344772079ecbdb62e9633bd27cfb6a644504674d6acb17dbdeac1d","observation_id":"bfe0fc3c-fa9b-4878-8e7e-c1fad62ebae5","resolution":{"observed_at":"2026-05-11T14:08:37.183455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T19:47:32.893816Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.893816Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:bf81c4cac417c205ed4cf52e4bb2fd7dc0856bf25c53800c305108e8f04ffef6","observation_id":"51eaf0c8-952c-4956-a7cf-6ffc95dbe6bf","resolution":{"observed_at":"2026-08-03T19:47:32.893816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.01236","last_updated":"2026-04-09T08:04:17Z","snapshot_observed_at":"2026-08-11T09:52:31.934038Z","submitted_at":"2025-12-01T03:25:49Z","title":"PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T03:49:05.489626Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.01236"},"observation_digest":"sha256:0fab42ecf952faabe8c30f2e957326e4e0925102fbc3a512ec396354b466d5cf","observation_id":"dfdec00f-77ff-480a-b1b4-e4cb8b5927e5","resolution":{"observed_at":"2026-05-17T03:51:29.402078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T19:17:16.595440Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01382","last_updated":"2026-05-24T09:40:04Z","snapshot_observed_at":"2026-08-09T19:20:44.017599Z","submitted_at":"2025-12-01T07:56:06Z","title":"Reversible Inversion for Training-Free Exemplar-guided Image Editing","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T19:17:16.595440Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.01382"},"observation_digest":"sha256:dc7e9856e03ade00203455f56c35fd975893bead41ed515afedef11f81c605c8","observation_id":"4132ca51-24ac-4cb3-a6ad-6cece81a4d18","resolution":{"observed_at":"2026-08-03T19:17:16.595440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:609f03e4a4cd93431915c9714706ebf815a0652425849d7d8d76e88798335396","observation_id":"de38a0ad-99a0-4b45-b251-06a9f1714c97","resolution":{"observed_at":"2026-05-16T08:04:13.062179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T17:06:57.942013Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-11T04:30:28.956132Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.942013Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:13fb67980e1a1b492347ba2bace26915d0e4d54f0d0323af5906393ac1c0e17b","observation_id":"9b43ddf8-2a52-4ed1-8c08-51624a0e48d7","resolution":{"observed_at":"2026-08-03T17:06:57.942013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.12675","last_updated":"2026-06-09T11:29:25Z","snapshot_observed_at":"2026-08-03T16:37:02.565200Z","submitted_at":"2025-12-14T12:58:19Z","title":"Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T22:39:32.955779Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.12675"},"observation_digest":"sha256:59a99ae108fb9649cdfbda1fa925a4e3159ddf768ab1a6c105a0a90e776ea6a7","observation_id":"aeec8005-b4ab-453b-a695-d4ce9600be17","resolution":{"observed_at":"2026-05-16T22:41:19.264235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T16:37:06.867182Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.12675","last_updated":"2026-06-09T11:29:25Z","snapshot_observed_at":"2026-08-03T16:37:02.565200Z","submitted_at":"2025-12-14T12:58:19Z","title":"Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T16:37:06.867182Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.12675"},"observation_digest":"sha256:281d6f231e9923ec6d08c8923d00f72a6f862bd45cf22c79b74c5b2a94256fff","observation_id":"ec8b6838-caf7-4b18-a516-544778224030","resolution":{"observed_at":"2026-08-03T16:37:06.867182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T16:21:37.852349Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-04T04:44:58.323566Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:37.852349Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:962db2eeb9c5c5ffc75109ee49e3ec6c14f4d61b6600c6926cfca8f681cbd8b9","observation_id":"9fa80018-870b-444a-9a83-36ae5772908a","resolution":{"observed_at":"2026-08-03T16:21:37.852349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.18951","last_updated":"2026-05-13T02:13:34Z","snapshot_observed_at":"2026-08-06T23:01:14.782843Z","submitted_at":"2025-12-22T01:58:17Z","title":"Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T20:37:18.523951Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.18951"},"observation_digest":"sha256:41513da78ed9f8fa941e24b9224eb3423c030ee2c3d28e9effa55bfb8a812da7","observation_id":"b3077067-172e-481c-8614-c371964cb528","resolution":{"observed_at":"2026-05-16T20:38:24.699463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.21788","last_updated":"2026-05-03T22:31:54Z","snapshot_observed_at":"2026-08-03T16:27:21.158436Z","submitted_at":"2025-12-25T21:37:12Z","title":"InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T19:10:47.425041Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.21788"},"observation_digest":"sha256:9382258ac12da7f8bb735a0d3582a181d447a55965418a52e3811405c715ab0e","observation_id":"d46e0128-8174-407f-a488-ffc1ec27817a","resolution":{"observed_at":"2026-05-16T19:11:11.458899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.22437","last_updated":"2026-04-10T13:28:12Z","snapshot_observed_at":"2026-08-11T09:22:08.594886Z","submitted_at":"2025-12-27T02:18:36Z","title":"EmoCtrl: Controllable Emotional Image Content Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T19:35:52.111730Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.22437"},"observation_digest":"sha256:453fdd29569d5533c2d1358798f14857c4b2a3647c0242eb280f8d01dd15088e","observation_id":"892b9c55-ffb1-41ba-950c-15e9530cb652","resolution":{"observed_at":"2026-05-16T19:38:20.746947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2601.15507","last_updated":"2026-05-08T04:00:14Z","snapshot_observed_at":"2026-08-09T08:43:51.665949Z","submitted_at":"2026-01-21T22:29:33Z","title":"A Unified and Controllable Framework for Layered Image Generation with Visual Effects","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T11:54:46.989748Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2601.15507"},"observation_digest":"sha256:2e48de4124076041d3dfb3c39e2c207616f6eef757ef0e16b973dda303b5bf73","observation_id":"0fde9377-a7af-4fc8-886a-23b5b077b765","resolution":{"observed_at":"2026-05-16T11:57:50.137049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T05:01:44.685777Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03448","last_updated":"2026-06-22T13:40:25Z","snapshot_observed_at":"2026-08-07T16:57:19.093444Z","submitted_at":"2026-02-03T12:13:29Z","title":"Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T05:01:44.685777Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2602.03448"},"observation_digest":"sha256:2207d5efea74bda89b6b0b2b7472b80535954ab58e44d72cdc248735bcf2ae53","observation_id":"318707f5-890d-4c51-8954-70b29ae56e3f","resolution":{"observed_at":"2026-08-03T05:01:44.685777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T07:39:52.824687Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:115c1adc74f2c68196096b9c0015f979417ab2ff963376988160f370c1dbdc80","observation_id":"5f3f31d1-ceda-44ce-be33-d2661a195fb3","resolution":{"observed_at":"2026-05-16T07:10:43.103815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2602.23622","last_updated":"2026-05-19T03:38:52Z","snapshot_observed_at":"2026-07-06T22:47:15.482910Z","submitted_at":"2026-02-27T02:59:34Z","title":"DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T12:04:08.487678Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2602.23622"},"observation_digest":"sha256:9bf332ecc519413b19b85eed70a55aad9e015d06c2d670e1ff4334e6f6441f7b","observation_id":"cb75bae4-4c56-4e74-afd4-77cfa223ab65","resolution":{"observed_at":"2026-05-21T12:05:04.993012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-02T18:25:57.683143Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-07T15:25:42.104111Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.683143Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:d6ef55dcdef393cb2177858ac4b63e794740a8d1fbaf0cd9119a6d43e1137b51","observation_id":"a3bdcf0c-3a3a-4055-8e2e-283613f01ae2","resolution":{"observed_at":"2026-08-02T18:25:57.683143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-14T22:40:05.611340Z","title":"arXiv preprint arXiv:2506.18871 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11734","last_updated":"2026-06-29T07:23:54Z","snapshot_observed_at":"2026-07-14T22:40:04.398352Z","submitted_at":"2026-03-12T09:38:46Z","title":"VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T22:40:05.611340Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.11734"},"observation_digest":"sha256:25b83a3359ff759b542a90aae6885255ef5fc45fa26aa07c8ecb2cf5e94edbfe","observation_id":"a62bb644-a175-40c0-8495-aecb17fb2300","resolution":{"observed_at":"2026-07-14T22:40:05.611340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2506.18871 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:111bdef43ee2985beb42cd9744134dc8342c5e420f4e29a2de76396f2a849f56","observation_id":"3d07ef0a-c423-43c0-bf56-8ca976ea3dbe","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T02:33:59.925218Z","title":"arXiv preprint arXiv:2506.18871 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.925218Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:519e4ac7944be6546857c67ecd696f01d6b229dff05cc8f297fff654148d5098","observation_id":"9df42cb4-f0c1-4cdf-9ea2-3e0d77a4cf38","resolution":{"observed_at":"2026-08-03T02:33:59.925218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-08-11T06:30:51.892484Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:de0d4fda20ce592947b5f62d33d7152476ee09c422a156e008cecc8cc1d87d3e","observation_id":"f2debca2-c864-42a6-b137-d91ef1b07d80","resolution":{"observed_at":"2026-05-15T07:39:50.485071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T02:31:04.995834Z","title":"arXiv preprint arXiv:2506.18871 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-09T20:08:00.005515Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.995834Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:174da5d4302dfe2590dbca53fed806389da4bbcba3375ba58905e56e0e908540","observation_id":"1ba346ef-4557-4dbc-ac8e-74b445b4a9fd","resolution":{"observed_at":"2026-08-03T02:31:04.995834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.04887","last_updated":"2026-04-06T17:36:05Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:36:05Z","title":"HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T19:39:31.357223Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.04887"},"observation_digest":"sha256:a1e04affc48b6afe63a5ee900bfa62dcdbf2c993ffee12811dd51bbfd0b4eaf3","observation_id":"49d3ce28-6fcd-45cc-a024-537f7821a90e","resolution":{"observed_at":"2026-05-10T22:40:50.145090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.04911","last_updated":"2026-04-08T04:54:06Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:54:42Z","title":"SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T19:23:50.614589Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.04911"},"observation_digest":"sha256:18dfa486bb2f6aa8f046d24f863a6da83f6339256fc50657350b44598921fe78","observation_id":"497b72ab-8d42-40fb-a74e-e3d27832cac5","resolution":{"observed_at":"2026-05-10T23:00:50.306536Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.06870","last_updated":"2026-04-08T09:32:15Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:32:15Z","title":"RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T19:11:43.172296Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.06870"},"observation_digest":"sha256:64b65c58f414899a83e6f0f75ec667f68aa77f3e10015a8a3bb45dce512e69ba","observation_id":"120fb9cc-33fa-4170-98a9-9a6707b7fd14","resolution":{"observed_at":"2026-05-10T23:20:54.197919Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.08646","last_updated":"2026-04-09T17:59:02Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-04-09T17:59:02Z","title":"InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T17:39:59.791758Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.08646"},"observation_digest":"sha256:d167b7db2b36c8715893255558b36b3d26988db45e95b92de347d291b4c95e2a","observation_id":"97abfa03-6e42-4d1d-ae4c-c3913a7cd11f","resolution":{"observed_at":"2026-05-11T06:25:57.652254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.10454","last_updated":"2026-04-12T04:32:30Z","snapshot_observed_at":"2026-08-08T22:20:27.221223Z","submitted_at":"2026-04-12T04:32:30Z","title":"AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:49.575589Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.10454"},"observation_digest":"sha256:0f9a6f2640508654b06ccf19eadcdd2068610f8a67558cb862659ce9387f9168","observation_id":"2e80d05a-68f4-4e28-8f5f-e15db5bd8618","resolution":{"observed_at":"2026-05-11T10:11:04.299361Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:6428285bec0a9ea52fb3a3ef7212237df797306474d3ceee1743d91a820d54c7","observation_id":"c25219df-fce1-47f4-a4f6-85975d722c22","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-08-11T09:55:17.776939Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.551829Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:780e0080b2b0b7da8200844bdf48c8649535e93d6ec29c4dd43bf410fd7df0f2","observation_id":"f6778d0b-6094-4bd0-98ef-118084e33d7f","resolution":{"observed_at":"2026-05-11T10:21:03.155574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-08-11T09:55:17.776939Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T08:59:10.877437Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:e65c6a093bd5b18687481e853450a5ce15b4ce565d7c58a90b78ce5a046d1700","observation_id":"cd658068-bc06-4582-8d91-32ef9fdc7a1b","resolution":{"observed_at":"2026-05-21T08:59:55.321131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.10949","last_updated":"2026-04-13T03:46:45Z","snapshot_observed_at":"2026-08-02T17:46:44.490061Z","submitted_at":"2026-04-13T03:46:45Z","title":"Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:14.491492Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.10949"},"observation_digest":"sha256:a3f9cdf1164a61a126ddd3c6ce01cb12ac79fe5309a4380f348d063f27ac1600","observation_id":"882b8cdf-cdc2-4754-bab8-c7a7f7572e38","resolution":{"observed_at":"2026-05-11T08:50:59.262264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.10954","last_updated":"2026-04-13T03:50:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T03:50:56Z","title":"FineEdit: Fine-Grained Image Edit with Bounding Box Guidance","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T16:15:23.578176Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.10954"},"observation_digest":"sha256:2efe3207b7d5fe394a22db30dd170cc6933538f6605c5f6529d63d81d7d26b4d","observation_id":"396e7ff4-29e2-4f81-bbce-b73a27080530","resolution":{"observed_at":"2026-05-11T09:06:00.012081Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.12163","last_updated":"2026-04-14T00:43:23Z","snapshot_observed_at":"2026-08-11T01:38:55.664916Z","submitted_at":"2026-04-14T00:43:23Z","title":"Nucleus-Image: Sparse MoE for Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T15:30:46.994872Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.12163"},"observation_digest":"sha256:97e35c6c17bef5b1c44013a1206456c7226f51bb9985562d3d33e978c9db24d3","observation_id":"3e29a58a-36e7-4657-ac6b-cb29f6e018fd","resolution":{"observed_at":"2026-05-11T10:26:00.466256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.13938","last_updated":"2026-04-15T14:50:05Z","snapshot_observed_at":"2026-08-11T03:09:18.029513Z","submitted_at":"2026-04-15T14:50:05Z","title":"ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T13:49:59.632467Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.13938"},"observation_digest":"sha256:5da2148a147a4a871cc953e931c6642205e26d3eb70acbba67ab56ed7a7e0024","observation_id":"29eab9d4-3139-40bb-90f7-97473d3f0d70","resolution":{"observed_at":"2026-05-10T14:10:29.281231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.14062","last_updated":"2026-04-15T16:37:36Z","snapshot_observed_at":"2026-08-11T06:28:13.134172Z","submitted_at":"2026-04-15T16:37:36Z","title":"OneHOI: Unifying Human-Object Interaction Generation and Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:30.898080Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.14062"},"observation_digest":"sha256:839f72925f7afcaeadca52ee8285fc2a3e761beb43262abcf49a6e3315dfbff5","observation_id":"64c77953-466f-41b8-b759-dd3fed8388e5","resolution":{"observed_at":"2026-05-10T14:25:29.952027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.15037","last_updated":"2026-05-02T12:33:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T14:06:30Z","title":"From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T11:44:12.373082Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.15037"},"observation_digest":"sha256:6dbcc204df1006df6a78c2e4c67cfed2a32207ef4b22de8fc86e02ba5aaf9b13","observation_id":"15f87b3d-ad47-4405-aa46-31afaf05db28","resolution":{"observed_at":"2026-05-10T11:45:21.042417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.15871","last_updated":"2026-04-17T09:21:48Z","snapshot_observed_at":"2026-08-11T07:04:43.392446Z","submitted_at":"2026-04-17T09:21:48Z","title":"UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T09:05:10.042162Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.15871"},"observation_digest":"sha256:f05f945af7314742daf824deb2cdfbe08a87bcb608b745918b7588f825ffc406","observation_id":"81307ca1-9661-4a25-b07e-3e8dae39c73f","resolution":{"observed_at":"2026-05-10T09:08:25.707755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.17195","last_updated":"2026-07-06T16:02:36Z","snapshot_observed_at":"2026-08-07T00:14:51.271211Z","submitted_at":"2026-04-19T01:51:41Z","title":"DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:45.633310Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.17195"},"observation_digest":"sha256:3b19c468a0fa9b748084c54acc280df198f574be9b44300fc50d69caea9e15d0","observation_id":"bc121b08-a3b3-4fc8-add9-ff73d89f8085","resolution":{"observed_at":"2026-05-10T07:21:55.030962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T06:03:06.920592Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:65ac7585dd922a71d3e011f4435bcb9ac350afec10c44c5670c239ab6441e41a","observation_id":"0987f470-dcea-4053-bc93-9ada02b2f8f1","resolution":{"observed_at":"2026-05-10T06:06:18.938571Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:58.232585Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:c93c43f9e983388b8a2856093e2c87d9b7be9eb9902dcaaf4dae71a55e338c4e","observation_id":"b6ea9339-fa88-4e79-b775-9971c7981965","resolution":{"observed_at":"2026-05-12T07:26:29.650098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-05T16:47:32.853010Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:e9f97722711c6438f315b6c5269bfdb708222b1bbc2f01050fcc0f9e6d4933ac","observation_id":"25b8428d-e5c7-43d6-a6df-2f329507b3be","resolution":{"observed_at":"2026-07-05T16:51:14.205432Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.17850","last_updated":"2026-08-05T08:50:05Z","snapshot_observed_at":"2026-08-08T23:09:27.776142Z","submitted_at":"2026-04-20T05:59:20Z","title":"UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:04.561573Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.17850"},"observation_digest":"sha256:3572218f014dbea562c5f0692704a4cc6296ce147b4310e974bb76fab5e25b8b","observation_id":"d5b66350-6d1b-44ee-9cad-799389f02de2","resolution":{"observed_at":"2026-05-10T09:33:41.731697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.19406","last_updated":"2026-04-21T12:29:50Z","snapshot_observed_at":"2026-07-06T23:06:02.635464Z","submitted_at":"2026-04-21T12:29:50Z","title":"HP-Edit: A Human-Preference Post-Training Framework for Image Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T03:26:15.525307Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.19406"},"observation_digest":"sha256:30e0d400de101a0e0a034a473cdc642c32bfb67f948ad0b4a2050cf257de632e","observation_id":"29da7627-6712-49aa-9997-060008403a77","resolution":{"observed_at":"2026-05-10T03:29:21.957141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.19587","last_updated":"2026-04-21T15:38:49Z","snapshot_observed_at":"2026-08-03T01:32:14.204319Z","submitted_at":"2026-04-21T15:38:49Z","title":"SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:12.484462Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.19587"},"observation_digest":"sha256:200aa686b161c8f5c9f613a7e51c0568c225bf5a25c7d18e4621a2f89d34d543","observation_id":"f412204a-5539-4ddf-a03f-eb4d327c7cea","resolution":{"observed_at":"2026-05-11T13:16:03.776146Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.19902","last_updated":"2026-04-21T18:25:25Z","snapshot_observed_at":"2026-08-02T14:48:34.514966Z","submitted_at":"2026-04-21T18:25:25Z","title":"MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T03:27:50.144706Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.19902"},"observation_digest":"sha256:077c95001e7ba3b1b3d9f2934b35e75b4a81b7329f7f97fb17bf1b6aa05307cc","observation_id":"25659def-5c34-4524-a3e1-4dbaff10dd67","resolution":{"observed_at":"2026-05-10T03:29:21.663941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.20258","last_updated":"2026-04-22T07:08:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T07:08:01Z","title":"Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T00:39:21.872643Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.20258"},"observation_digest":"sha256:3d09d68dac61be65a6b2362d31bdc39c5ffb5c3917116c53f3c02aab181c566d","observation_id":"0f6e9366-bb90-44f4-b33d-c01b29805084","resolution":{"observed_at":"2026-05-10T00:39:48.404850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-08-11T06:12:30.304597Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:5fe5539348c45d4248a0840514cd1bfb609acae0a26491195ab00353f20e09ec","observation_id":"4bb6c475-8721-4cde-92b0-1ecc64bc29cf","resolution":{"observed_at":"2026-05-10T00:49:48.824893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.23763","last_updated":"2026-04-30T04:05:16Z","snapshot_observed_at":"2026-08-11T09:39:21.336709Z","submitted_at":"2026-04-26T15:28:02Z","title":"Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T06:47:22.451132Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.23763"},"observation_digest":"sha256:07198d2e183deff52de98136fe9cfa0229c984db33968764eac6c94e0b1e4648","observation_id":"b6c6055d-cb62-4252-b193-0b64a05811ef","resolution":{"observed_at":"2026-05-11T21:06:13.737655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:4cef79f4b1bdefb15e7964614ddb976334761db2f83dedf104b63bd989c7bd7c","observation_id":"36dc96e8-3034-440d-9ee5-ea5454ba3ee7","resolution":{"observed_at":"2026-05-11T21:46:12.247983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.25072","last_updated":"2026-04-27T23:57:29Z","snapshot_observed_at":"2026-08-11T02:44:13.981412Z","submitted_at":"2026-04-27T23:57:29Z","title":"Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:08:41.452018Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.25072"},"observation_digest":"sha256:751b790da31eea52f8f24e23e297b80e9b92a86007cd5fbde12ab0a8e66e1b1b","observation_id":"71618ad8-1a68-4fc2-be81-02083c458482","resolution":{"observed_at":"2026-05-11T21:51:17.895654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.25477","last_updated":"2026-04-28T10:30:01Z","snapshot_observed_at":"2026-07-06T23:11:21.433834Z","submitted_at":"2026-04-28T10:30:01Z","title":"DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-07T16:44:23.162726Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.25477"},"observation_digest":"sha256:ed2cd6ce8405eb6e87c80b3fe01619a807a39c26892018bffb2883eb9c05ff07","observation_id":"ee52f3b7-b9ad-4781-99ba-833876aff080","resolution":{"observed_at":"2026-05-11T23:36:15.095575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:a282441180a9ca83a37c129c51b617b36feec66e2e68fe574f13f9e007f7cab1","observation_id":"d6b43f2f-f4f1-4bbf-8eb3-638ab79c0261","resolution":{"observed_at":"2026-05-12T08:46:26.890094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:90a5f3b12bc3322efaf9eee9e191058a8a86c8badc8230b05139104bfcf32137","observation_id":"b22ca79e-6e97-4824-9f5e-b28743a40476","resolution":{"observed_at":"2026-05-09T06:55:43.682065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:da8ac1661dfb47cf573d574146deeff7d62b42fc92549603f2a6ce996146795e","observation_id":"ca22cb71-1ee9-484d-ae73-97c5cd52e08f","resolution":{"observed_at":"2026-05-21T08:19:52.726850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.05646","last_updated":"2026-05-07T03:53:54Z","snapshot_observed_at":"2026-08-03T14:49:05.703728Z","submitted_at":"2026-05-07T03:53:54Z","title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-08T15:04:41.518195Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.05646"},"observation_digest":"sha256:4d921db429e6fb83b128283cffcaad65009ce000de19789f1caa6bc8321d0ca0","observation_id":"7d376e86-6a5e-4d49-9e24-016473c1fe71","resolution":{"observed_at":"2026-05-11T18:36:08.010003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-10T23:01:33.349669Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:1e784a581c91ef271e53ea2a074201fc374caa542051b6b00efb010dc5b72297","observation_id":"eff83de5-2056-4c0d-ad4f-227e41458c57","resolution":{"observed_at":"2026-05-11T18:41:10.245483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.07402","last_updated":"2026-05-08T07:58:03Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:58:03Z","title":"InsHuman: Towards Natural and Identity-Preserving Human Insertion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:20.928777Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.07402"},"observation_digest":"sha256:090e73fc8510a0be06625a0d5a9816f1861dc265a341b194013041fb7a572f8a","observation_id":"71411b96-9953-4996-98b8-e2b3ee92420b","resolution":{"observed_at":"2026-05-11T03:55:55.473389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.07457","last_updated":"2026-05-08T09:05:08Z","snapshot_observed_at":"2026-08-11T07:36:52.241290Z","submitted_at":"2026-05-08T09:05:08Z","title":"EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T02:19:16.677800Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.07457"},"observation_digest":"sha256:1f754e4fb483fed32e6fc7e019bbfc048124f0f92fb5345dcb12587da5cf10ea","observation_id":"192fc214-3048-4529-bc50-b3b36f17304a","resolution":{"observed_at":"2026-05-11T03:45:57.029439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.07477","last_updated":"2026-05-08T09:23:26Z","snapshot_observed_at":"2026-08-11T08:06:01.163269Z","submitted_at":"2026-05-08T09:23:26Z","title":"ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:42.304051Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.07477"},"observation_digest":"sha256:140b23e9460aafda50b9c60fa30a04c38a6f943cbfd25720288559bffcb125b9","observation_id":"c532411a-81bf-42ba-93d7-3a80dde2550b","resolution":{"observed_at":"2026-05-11T04:15:59.691793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.08029","last_updated":"2026-05-08T17:14:43Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:14:43Z","title":"STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:59.644215Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.08029"},"observation_digest":"sha256:84ee749e2deae4a596d70b73f410807ef61941845f32b00dba4a235a080700ce","observation_id":"cc490d0a-6be6-42ef-84aa-6f2a880b22d6","resolution":{"observed_at":"2026-05-11T02:45:57.013592Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.08163","last_updated":"2026-05-04T16:21:25Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-04T16:21:25Z","title":"MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T01:11:35.480399Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.08163"},"observation_digest":"sha256:6ab2a4f75af8a81a667fc6d5e280dcc1d71cb9e75907fca96142ad0287342289","observation_id":"7234789c-dc72-40f9-ad46-ef7ee8317a99","resolution":{"observed_at":"2026-05-12T08:26:23.423944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.08354","last_updated":"2026-05-08T18:05:27Z","snapshot_observed_at":"2026-08-06T15:50:59.788758Z","submitted_at":"2026-05-08T18:05:27Z","title":"Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T00:58:53.626310Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.08354"},"observation_digest":"sha256:571c5e0ae086ba2c7351ac32562948c67b8c4976513e9a9eee9a66fa5931b86e","observation_id":"74ef5eb8-a994-4b05-96d2-987a0ca67840","resolution":{"observed_at":"2026-05-12T08:36:24.337092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.10127","last_updated":"2026-05-13T05:54:11Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:40:03Z","title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T03:56:43.640874Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.10127"},"observation_digest":"sha256:d635c034c0ca526ca5b5f00dd1888e966519553680ff146df02f4ea4bac3dba5","observation_id":"59881774-674f-4618-88c4-c226a47c88a1","resolution":{"observed_at":"2026-05-12T06:51:27.757665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.10127","last_updated":"2026-05-13T05:54:11Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:40:03Z","title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T21:56:10.499014Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.10127"},"observation_digest":"sha256:bef5ec74070bbf2a7e2f60e0f976e0b9b241d78da910d2e9f18fa1e39410ae55","observation_id":"c729739c-b642-4803-9bbc-15de28edd2e2","resolution":{"observed_at":"2026-05-14T21:58:03.393608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.10859","last_updated":"2026-05-11T17:05:52Z","snapshot_observed_at":"2026-08-02T17:39:12.809856Z","submitted_at":"2026-05-11T17:05:52Z","title":"Masked Generative Transformer Is What You Need for Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:52.355925Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.10859"},"observation_digest":"sha256:84057439d8e5e76ce37c9060fc8e0bf2f48af6801a9403973eff5d7c9866133b","observation_id":"b79e1881-614d-4aac-8dda-75c2ab16b2c5","resolution":{"observed_at":"2026-05-12T06:06:26.074159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:e4c947080730ec04818d1013d635d2c6a55bc00bd8b4efe04a45df76773c7926","observation_id":"cdfc8470-3fbd-4dda-8c09-5149de8c4930","resolution":{"observed_at":"2026-05-13T07:32:29.636734Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-08-11T08:38:23.159686Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:9d680c5d8deb39ecafd06c64c07ae388e333eb66989a093c5d048fc96add2dae","observation_id":"f4a40299-e364-4a17-8978-75fd63230e32","resolution":{"observed_at":"2026-05-13T01:47:04.992215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.11818","last_updated":"2026-05-12T09:09:01Z","snapshot_observed_at":"2026-08-02T21:46:06.216835Z","submitted_at":"2026-05-12T09:09:01Z","title":"RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T07:46:50.540528Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.11818"},"observation_digest":"sha256:39079f097282bfa82e14ab3d87e008bbfb3173a821358cc27bc1bffca53e720f","observation_id":"39636689-405e-4099-bc0f-b71c36f99636","resolution":{"observed_at":"2026-05-13T07:47:32.662951Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-08-11T06:33:50.705250Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:53:21.851578Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:4821e7de4f7907cfd28578ab1d29e998d88f5cadcc6396bf04834fd28eb83bcd","observation_id":"16d0b599-25fd-4eda-a5df-3676c5a9686c","resolution":{"observed_at":"2026-05-13T06:02:23.924920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-08-11T06:33:50.705250Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T22:00:01.349754Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:08ea7477ae45421956f0fed93e892b973f3472a0ab1c2cb229403b111821b339","observation_id":"f193d64a-74da-4eac-ae58-191a2e9da181","resolution":{"observed_at":"2026-05-14T22:03:03.399513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-03T01:41:22.691646Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:39.114660Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:152801ac32b0dc3364bedb38169efb9944d954da34c8cf784e028152c613fc14","observation_id":"0b1bfc16-6493-483a-810d-131246f4bee9","resolution":{"observed_at":"2026-05-13T06:07:22.929062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-03T01:41:22.691646Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:55.933311Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:4a553e66965074a209f6b6a5506782e354a860c0b21b4949de577edec6740571","observation_id":"e9c6ffa5-2c1e-4d62-8035-7e5b067cd766","resolution":{"observed_at":"2026-07-01T14:05:46.583707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.12305","last_updated":"2026-05-12T15:54:49Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:54:49Z","title":"Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:48:04.997796Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.12305"},"observation_digest":"sha256:5efb581f479d4cecfa64d8bc9d2cfd1e193b55e46d8fe1faf3a0b746cea9f9ba","observation_id":"4f78e979-c64b-43cb-990a-aa9b56877b56","resolution":{"observed_at":"2026-05-13T05:52:22.735182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:c7b3e9880f29b955ba740cace0002f05449cef2fd976f3fec564dad0f54a9b4d","observation_id":"80bb53d2-99c2-447a-a49d-f0a9bd9b621e","resolution":{"observed_at":"2026-05-13T05:17:18.551051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.13062","last_updated":"2026-05-13T06:33:54Z","snapshot_observed_at":"2026-08-02T05:13:16.597072Z","submitted_at":"2026-05-13T06:33:54Z","title":"Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T20:22:20.464966Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.13062"},"observation_digest":"sha256:8c735665a175cdcd90a734e647d75f8f2ad8a59a3e01e2a86620b5de7d40f158","observation_id":"e01e0ef2-ea63-403a-82d0-c19828723b73","resolution":{"observed_at":"2026-05-14T20:22:54.661439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.13122","last_updated":"2026-05-13T07:48:05Z","snapshot_observed_at":"2026-07-06T23:24:42.799888Z","submitted_at":"2026-05-13T07:48:05Z","title":"Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:44:36.511647Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.13122"},"observation_digest":"sha256:0148242ca25dfaa9b16c840fc0a34bebb93ed78700f6bbf70187b6f50e1c24be","observation_id":"4b2c1e66-1d52-489a-9c4b-96e5a9e491a3","resolution":{"observed_at":"2026-05-14T19:47:53.624237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18871/citation-record","integrity":"/paper/2506.18871/integrity","json":"/paper/2506.18871/citation-record.json","paper":"/paper/2506.18871"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:44af0b36b1ac71791fd8b360ff7562d5dfc41a6bb4a77d645a1e9b57eff2c62c","observation_id":"6a2ba722-9dcd-40fe-b431-f5efc73c9469","resolution":{"observed_at":"2026-05-19T07:52:10.741429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sd3-medium","venue":null,"work_id":"0bc5dd9f-f22e-4c4a-8484-04aea2fcad4f","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:7ebf4540a5d9e21bbb82318ecd8027b5d29bfd31e98efc79fc4e10a06a48c56c","observation_id":"ed1dec8e-fa1c-403f-b803-b5bd41cdf07c","resolution":{"observed_at":"2026-05-19T08:23:03.270847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:3a0819899cd1557cb6e116ae4a330e4423c3f33de02f0f8e1bc0723dd5b8c68d","observation_id":"37fba2b1-a5d3-4d9b-a356-2f1065c21f63","resolution":{"observed_at":"2026-05-19T07:52:10.733093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"0e06497a-be4c-4f15-bd2a-d2007dec6596","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:3a07d199e9cf0b7a6cb14e1ef0565ea39d83e06e7b92b58e0aa87474983cc17e","observation_id":"5a316522-0901-470f-ab4c-bfcebb68372e","resolution":{"observed_at":"2026-05-19T08:23:03.274955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"4148a8de-8657-4f01-b507-1d58fd9c3101","year":2021},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:b23a7e782ff5db74ee24b2a9f5436e1f50bcb9e83acc16c3c6d0588cd5388da8","observation_id":"a1e9f146-a17c-4674-acbe-9901027f0658","resolution":{"observed_at":"2026-05-19T08:23:03.278398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Allava: Harnessing gpt4v- synthesized data for a lite vision-language model","venue":null,"work_id":"aa66c0a7-984d-4c62-9f34-c8e8f48a42c3","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:4a7e550f2952deb7c6d89ad77d69079cb6c6cda9787f59fd79218557516cf646","observation_id":"b9574b19-9b7d-4892-8a32-2e3c24f27396","resolution":{"observed_at":"2026-05-19T08:23:03.267330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:f7cbd17b60cf182a19ba0120217c4cad69005d6c688e5c8a78bf3c74bfd4727f","observation_id":"b5c5196d-3cf4-415e-9f1e-1c6775dacd86","resolution":{"observed_at":"2026-05-19T07:52:10.737237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:90ea720371fb425421c6d02f545e3f67501000b19d32387c8a7f9b1fa84e78df","observation_id":"363f5538-7668-43b2-a53a-bfa597dc22ba","resolution":{"observed_at":"2026-05-19T07:52:10.913871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:47cdb4c6235b5383457ee5d10378eb5575d4b54d458157e925e5126bc46d6493","observation_id":"8b7cb861-bde0-41f6-af84-380adb360b9f","resolution":{"observed_at":"2026-05-19T07:52:10.855213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":"ad1ee50d-e446-479f-869c-6b3c0f9c21db","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e8c8e43bd320fd86d802b17789a01e81b3ead45207fec4a5bd787447ac9b9f24","observation_id":"459627b6-565f-4da6-87de-5c23393a4721","resolution":{"observed_at":"2026-05-19T08:23:03.400653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:b94e9a7619653b7935af2221a0c12cc4d438a3759967c351e6d32a680d3750ee","observation_id":"9561aea9-5c12-4061-8594-2ce411eda1b5","resolution":{"observed_at":"2026-05-19T07:52:10.813557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":"544a1f73-b7c4-48ee-8d7a-54ae8e9c3e28","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:1d27bc982aff12b378c04dc8de59a8ebb2c7f6844bad2ea0344032eb72422332","observation_id":"9b6974b9-3ea9-4c9a-a6b3-2ecd153134b4","resolution":{"observed_at":"2026-05-19T08:23:03.315466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T02:56:05.992492Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:0893e8c697e97be5a3cafe7a213acf69d2cc476c5c646cfd4f2903202506a0e8","observation_id":"d5e74ec7-504f-4a6d-93b9-345b4de00768","resolution":{"observed_at":"2026-05-19T07:52:10.862080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e8c3e4da21eb7f6ef25b641ed72fe5326f3d653d3722f060035c7e34a5db7202","observation_id":"fa2b8a6e-77da-4bcc-bbff-be3e0c57eb34","resolution":{"observed_at":"2026-05-19T07:52:10.797784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:1e9e7ef61f9ab8516873b5ec33296f1a8e2e01623e2310f7c0e4ea91bc1808c6","observation_id":"5f17339e-d4e2-4030-8eb1-24b3a1c095a5","resolution":{"observed_at":"2026-05-19T07:52:10.784251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doubao-1.5-pro","venue":null,"work_id":"41de25a7-00f0-447e-9587-d04d2ac5f86e","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e8f902ae3a9e58b6eba1ae138994a12552cf2bb17793cb49f352978d5978af5a","observation_id":"17db3860-bcc6-4b4e-92d0-b9e63ea08c72","resolution":{"observed_at":"2026-05-19T08:23:03.424980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":"530621c9-3fc0-4637-99cd-5fe3f43ec1db","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:9e2094c36fd7ec8ef402644016539031abb301003f3d4407ed565553b8167c8a","observation_id":"73068fbd-b414-4c55-9eed-2adb0db3fbe6","resolution":{"observed_at":"2026-05-19T08:23:03.395847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01414","last_updated":"2025-02-23T13:45:34Z","snapshot_observed_at":"2026-08-10T12:47:03.145033Z","submitted_at":"2024-07-01T16:05:18Z","title":"StyleShot: A Snapshot on Any Style","version":2},"cited_work":{"arxiv_id":"2407.01414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.01414","snapshot_observed_at":"2026-07-01T10:05:41.207339Z","title":"Styleshot: A snapshot on any style","venue":null,"work_id":"ff7bfdf1-5d98-4368-9d30-2c5181a78d20","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2407.01414","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:3f1e61217c28ae59c420a68512ac1b6ff39974d9ae00bff72930e442baeda780","observation_id":"d162f4ea-428f-4dc8-bdf9-4b41940c6023","resolution":{"observed_at":"2026-05-19T07:52:10.849087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-09T23:43:11.596819Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":"2405.04007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-07-03T00:47:29.665670Z","title":"Seed-data-edit technical report: A hybrid dataset for in- structional image editing.arXiv preprint arXiv:2405.04007","venue":null,"work_id":"105b7ef7-4ded-4a79-bc59-ba1b3f7061b8","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:c38bb2e396aef429bbc790243558edc8d79f04ad1552561ffbde425de33f4190","observation_id":"d0872318-8561-4842-8a29-78fd6d1d6352","resolution":{"observed_at":"2026-05-19T07:52:10.777831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"686a1b87-4f87-4e33-a945-717bebf9073a","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:74a666d424141ef07e0527b1f7dcf64f7e5e2acd76c13737fbc9c7955c9e167b","observation_id":"e9f47869-59a3-4b35-b475-99d7b8003557","resolution":{"observed_at":"2026-05-19T08:23:03.394631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"113e56e5-dd1a-4045-8ba5-fcae1141ef20","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:0fe6347bd24cc91350c958203ef6b44f3e04a06fac5aa257defed4c7c2b9c450","observation_id":"be91d027-391b-400a-90ca-59b88100c947","resolution":{"observed_at":"2026-05-19T08:23:03.373080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.0 flash","venue":null,"work_id":"90a0fc14-1b4c-40dc-94ef-9e977cb9f325","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:2404fcad767f3c491c359844776765c088e89a8ec7b6544d0e211144bb597d80","observation_id":"8c9a5eb4-2153-4a3d-a6eb-b5d005aade1f","resolution":{"observed_at":"2026-05-19T08:23:03.378218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:ee781d8ca3e3a052917d33dc9a6b8520b09733641752f02398c497b56126d54f","observation_id":"40cacb13-c58e-4743-8881-55e15c319a66","resolution":{"observed_at":"2026-05-19T07:52:10.752625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T23:05:47.958732Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":"2501.13926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-07-04T16:39:58.175257Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":"42bc4633-5505-4914-a32c-2e3d11cc6e03","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:8e5bf2dad8ae5e74cda77307d7e90df1018d6a6e210efb0a81aabd78c9c475d1","observation_id":"b8fadb8b-3881-4257-9666-e71df3074dc1","resolution":{"observed_at":"2026-05-19T07:52:10.744905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11931","last_updated":"2022-03-22T17:58:31Z","snapshot_observed_at":"2026-08-10T01:41:17.792215Z","submitted_at":"2022-03-22T17:58:31Z","title":"MetaMorph: Learning Universal Controllers with Transformers","version":1},"cited_work":{"arxiv_id":"2203.11931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.11931","snapshot_observed_at":"2026-07-03T20:58:57.532714Z","title":"Gupta, L","venue":null,"work_id":"56d78d99-2efc-4871-95b2-b4c8929d8aa0","year":2022},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2203.11931","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:274ca491fe2e31549be596ad275dab7aee62870b2a06a93fd772be7021b6be42","observation_id":"9b6c0150-7cb3-40cd-bb14-3cf56b179ce2","resolution":{"observed_at":"2026-05-19T07:52:10.748377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e995fae0aaddb357d4dc0848c2945158e00bb92669d6ca3c177c1115be9a9f64","observation_id":"708fe622-ed8f-40d1-ac6c-1e5fb8996cb9","resolution":{"observed_at":"2026-05-19T07:52:10.756178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.07009","doi":"10.48550/arxiv.2408.07009","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen 3","venue":"arXiv (Cornell University)","work_id":"a1dd317f-8300-4a79-a1d0-92ddd93fa983","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:afe67148fd123c86f726c14330c1df7adc8791271e55c90ab9e1e31ac4145954","observation_id":"7ae6e3b1-e8bd-410b-9bfb-824aa8e4a1c2","resolution":{"observed_at":"2026-05-19T07:52:10.767082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:30.169107+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:30.169107+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:f8b97a4b394065e8f0917d5ebb7a91b5e563fc66d9f136badeef446eedff3452","observation_id":"4f53dc03-fe57-48f1-94b1-6ffcf0e6fefa","resolution":{"observed_at":"2026-05-19T07:52:10.852094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d0344155771837bea7da3c7887ea9a12909c3b179ed18f004a4612dec9f68896","observation_id":"8fdf8c54-6038-4419-bf5a-81cc3a9e0dd2","resolution":{"observed_at":"2026-05-19T07:52:10.955016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16418","last_updated":"2025-07-29T01:42:34Z","snapshot_observed_at":"2026-08-07T16:48:21.587377Z","submitted_at":"2025-03-20T17:59:34Z","title":"InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity","version":2},"cited_work":{"arxiv_id":"2503.16418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infiniteyou: Flexible photo recrafting while preserving your identity","venue":null,"work_id":"d5261a7a-f06e-4989-88c2-39e1b116204b","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2503.16418","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:7f28bdeabf0b4f74d1dc95fa9e446e4d4417e16287b8c60a7a4896304c21374e","observation_id":"635951f3-409c-4028-b4db-369ceec4e30b","resolution":{"observed_at":"2026-05-19T07:52:10.885914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d8097dc4dcbefcc5b8255de23d557775f0fe2af07d7c4662c419a2a5513ae440","observation_id":"c848a64a-5d7d-428c-8538-d435197390c0","resolution":{"observed_at":"2026-05-19T07:52:10.889589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":"415dbe71-2257-4719-99d1-44e0ae5cd78d","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:28474e450833bb61951cc213a4581d2301d19e6424233c2b5904e71392c51886","observation_id":"2e448e0a-1e42-49bf-9100-bb0aaddfd337","resolution":{"observed_at":"2026-05-19T08:23:03.355036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"381c3c78-5d61-47f8-862a-3b2b74658e77","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:a591dfa28e8aeec4d7f6eb295e1993e9087c68c3bc5de95db27ae9df5dd3dc53","observation_id":"c1dd45a5-f2ae-431e-9496-c7588126cbb0","resolution":{"observed_at":"2026-05-19T08:23:03.375056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space","venue":null,"work_id":"b62766b4-7d7c-47c7-8c7b-f8a7334baad5","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:5ae0e34472173dda75f99e0fb063d458333894e6d4e1307cd01746198da37189","observation_id":"8ba481ab-2481-49ce-a696-8e57b8280e46","resolution":{"observed_at":"2026-05-19T08:23:03.371597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:2764f4a7d3f259a8903fe2832236453e6cc39cec4bf1dcebdba18258ae637064","observation_id":"ff7cdb58-8803-421f-890f-df53b2a837c3","resolution":{"observed_at":"2026-05-19T07:52:10.882399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2402.17245","doi":"10.48550/arxiv.2402.17245","metadata_source":"pith","pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","venue":"cs.CV","work_id":"53c64fda-8566-434d-bc10-2fdfbc6a55ad","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:71141ad309368503c2a6fc0eb6e529ab87787c2684e42fb1ff4beec80fe8ce51","observation_id":"2447e8fb-e23b-4880-adf1-7cbd280a3a10","resolution":{"observed_at":"2026-05-19T07:52:10.875408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":"2406.08478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-07-04T13:39:50.777451Z","title":"What if we recaption billions of web images with llama-3?","venue":null,"work_id":"54e09996-e9d1-443c-8378-ac0c34f2f4e9","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:14739218d2654b4e46b21fc075e1209c6d1991bf2a7d9079e08a43f89f4d60ff","observation_id":"8f9c9d56-a50f-40e0-886d-c723d7ea8aed","resolution":{"observed_at":"2026-05-19T07:52:10.869347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08303","last_updated":"2024-11-24T13:14:47Z","snapshot_observed_at":"2026-08-09T13:25:19.616883Z","submitted_at":"2024-07-11T08:48:06Z","title":"DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception","version":2},"cited_work":{"arxiv_id":"2407.08303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08303","snapshot_observed_at":"2026-07-03T00:17:29.025254Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception","venue":null,"work_id":"27b98cfa-a31f-4a87-ad74-00d4b025c8b0","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2407.08303","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:21bdf4f6ff0135edf3f1da213ba4d354ba67b6b7564bf2a99242836fedfb54b6","observation_id":"ea64e559-00bb-49fa-9315-8e5b1445afbb","resolution":{"observed_at":"2026-05-19T07:52:10.872328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:b5c514c3fc02de4530e3f21dd9edeb0768ef3f0955d2f0e2d365bd80452c7484","observation_id":"c9305dfa-6c32-4c91-ab1e-c02c83693a8d","resolution":{"observed_at":"2026-05-19T07:52:10.879158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":"2505.05472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-07-10T07:36:57.986858Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","venue":"cs.CV","work_id":"f2badd0e-c06a-45f9-9d9e-7ceda62176b8","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:ae9092f13b8bd9af327c2119568470cb87d7b43cdfc7b6b68c5717771fa0119c","observation_id":"4e27def9-40d1-425c-9ce7-8b8a0ccec063","resolution":{"observed_at":"2026-05-19T07:52:10.893022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:84a0469ec411528b5c3cfce76a6abc38430b14630b6edeb6ddfc3a27aa4f5bc6","observation_id":"86a9cfa2-6016-473d-a430-11fa150207ec","resolution":{"observed_at":"2026-05-19T07:52:10.961184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:efaf9b8b249c6b0d24960d63c8c0ff8559587bb1a96c37197cce788666d7d13d","observation_id":"93ec51ed-148c-4c2e-aeaf-d570a1dcdf04","resolution":{"observed_at":"2026-05-19T07:52:10.865617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"7ac4288f-3293-4a0b-929b-71222b3d4562","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:f4072362611cecdf5b83b2dcb7ef1f17a936ff26304ec321ddcb1e035b8e54eb","observation_id":"870aebc2-8f34-46cc-b66c-a74cf12c5759","resolution":{"observed_at":"2026-05-19T08:23:03.426447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36","venue":null,"work_id":"6b8567d5-b75b-45d9-975c-f0d4ac96a3da","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:56d7148360e9d255d1ee386dcf824d921c99d22d47bcca2aba558867b70960a1","observation_id":"d29d5c62-c28d-4adf-86f0-cd93aa7ed8a1","resolution":{"observed_at":"2026-05-19T08:23:03.346569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d5b02e883a4c6993093872612582719e42604333fea7209b0287848cbe036ac1","observation_id":"2662eff5-4533-4949-8b73-f916bcd7ddae","resolution":{"observed_at":"2026-05-19T07:52:10.804042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:8df2e1378d0d0314c5fb678ad16c16a3bacfa14f871b4fd81913872c25fad5d3","observation_id":"124f0a89-e720-4cb2-9bd2-75bd48985349","resolution":{"observed_at":"2026-05-19T07:52:10.845232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.717384Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":"ae198a2d-888a-4f5e-acec-eaad43d6b025","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:c376e9f24569b3535240302107d67359daec11c04a71fa8ecf6d37bd82763325","observation_id":"e121bcf6-50a6-4fa8-b5c6-1a481065528c","resolution":{"observed_at":"2026-05-19T08:23:03.404652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02487","last_updated":"2025-01-15T13:07:56Z","snapshot_observed_at":"2026-08-10T22:09:22.084462Z","submitted_at":"2025-01-05T09:40:58Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling","version":3},"cited_work":{"arxiv_id":"2501.02487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02487","snapshot_observed_at":"2026-07-02T07:36:45.141025Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context- Aware Content Filling","venue":null,"work_id":"10083b73-2d3a-4a03-8741-520fe2e6f71a","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2501.02487","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:1b29f32a297d5b64653ce2891a51238dca51f53b28438cdecea99c04e131bf94","observation_id":"4957671e-69c6-4a63-9541-755157b12c89","resolution":{"observed_at":"2026-05-19T07:52:10.791115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.08453","doi":"10.48550/arxiv.2302.08453","metadata_source":"pith","pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"2337b26e-9ca1-4157-be2a-438971c5fef3","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e309fe7fd141af07c8d7b6ab34e308e3ebb9062ec26650110d64cf97610dff22","observation_id":"65d6bae9-8c2e-4b4f-91b2-dc18d2390135","resolution":{"observed_at":"2026-05-19T07:52:10.800768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":"2404.19753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-06-29T18:23:50.307986Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"56da108a-173f-4538-a1e1-d9850e7ff243","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e3ccd1edf844d5aaf960f9962a93005f4ad6a7c9fb25283ed4d2b44a73f1a7b3","observation_id":"c076fba8-d99e-4b99-a298-f412ffb53052","resolution":{"observed_at":"2026-05-19T07:52:10.787801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dall·e 3","venue":null,"work_id":"ab949fe0-a90c-4d7f-b4d9-8e8b44bf3f3a","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d65b1ca99dcd924d538d4480f0b273611e99e8a7f323d91f7766e3a188b49e0c","observation_id":"1c844a54-bd19-492e-91f6-0cc3cb9a68b5","resolution":{"observed_at":"2026-05-19T08:23:03.334121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a866f8e1-bc1e-41c4-beb8-a13aeb2f88a5","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:ebdaffc6f92215eed7624ac27d59ecb97352c702bc9e453ed11618542f6d77b9","observation_id":"ab9af409-c620-4a1d-8ca1-151328f48f6a","resolution":{"observed_at":"2026-05-19T08:23:03.367588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"80eb1222-ad3f-457b-8ace-3136b33739db","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:177c2939df0e0617435f899ea1b933db54b55facbb5d67a235b8ce0946e37c32","observation_id":"bf2497c1-0f7a-43a7-b7ba-57d01c73db30","resolution":{"observed_at":"2026-05-19T08:23:03.359229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:51395ed343fbedd2a30183255a02f38837c03fcf7381cc7e365bdd13d5b5d3ae","observation_id":"78d241c5-bccb-4740-99ee-1162d93747af","resolution":{"observed_at":"2026-05-19T07:52:10.794403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:423ee709c768886d99b3bd75f62a90a51852792c1acbc202a4e70a99dd642d79","observation_id":"fe261762-9aac-4b65-a482-88f113dac9da","resolution":{"observed_at":"2026-05-19T07:52:10.770923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:99651daff291168cccc44ea0061538a4721fa1b7c15acfb959df2bf8eb927f1d","observation_id":"346999b8-e40c-4e58-a75e-11e9d2767bf5","resolution":{"observed_at":"2026-05-19T07:52:10.780905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-07T16:59:27.482089Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":"2503.21758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-07-03T17:18:43.730046Z","title":"Lumina-image 2.0: A unified and efficient image generative framework","venue":null,"work_id":"4336fecf-1790-4c0a-ad5d-b2bde933d2b6","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:1c4093d1ebf6e344fa52b91c92bd3fbfa206636b71c0109b5a34297cf6c0dbed","observation_id":"61d4ba0d-15e2-42f5-8447-be27274c680b","resolution":{"observed_at":"2026-05-19T07:52:10.760173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":"a2fec065-c386-43ef-8ae9-8af852955aac","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:2a7374d61cf20025367bb1354d2941334552e47fa4851521e6ab598bfeeff30f","observation_id":"e14af303-202d-4ade-a62e-baaa88f27e73","resolution":{"observed_at":"2026-05-19T08:23:03.415719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.601106Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b3ebbc98-2134-4751-aee5-59fd941251d8","year":2021},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:895aa3b25fda55c29232e29ca231f273e8230ea3818f8206e093410e65c9ee57","observation_id":"eb303210-aa34-4c7e-9d37-c9c9a9640560","resolution":{"observed_at":"2026-05-19T08:23:03.369061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e10a4fc2572b0b923b30df2428366af4b72a485147c33bcf2f5a688083379820","observation_id":"d592384b-0c7b-4204-acb3-6fec65904c9e","resolution":{"observed_at":"2026-05-19T07:52:10.763365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:23b781021694a7a499f1b6ea9b1a3c2d316fef5057825794c82201be44df11e6","observation_id":"1d456f56-1889-441b-ba6b-3183b8b6d3bf","resolution":{"observed_at":"2026-05-19T07:52:10.774361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:01.022008Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"512e89af-0b17-4696-9249-68c37e6eb68b","year":2022},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:21692fef5e4a535dabc22b8cbc766c0285638aaa821b74583e852769c2d83268","observation_id":"91190551-509c-439d-b59b-fd85a7951d14","resolution":{"observed_at":"2026-05-19T08:23:03.363615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"d947cd8f-2f98-4581-87f2-e41f04857da7","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:8789f3ee728fce7d9da2d2e94704506448c2bb52ccabfa905dc80f565b984ff2","observation_id":"8b33ffe8-3d3b-4a81-b14e-f01854e1f3e0","resolution":{"observed_at":"2026-05-19T08:23:03.398728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"1610c6cf-627f-4ec3-bdff-03cff70bae27","year":2022},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:4bb7a9f8aeecbf04b16922a36535568d03edec61ffc8802d7f910e0f803c1fb9","observation_id":"5a859f6b-dc4e-4519-90e8-67c07c6d8e2e","resolution":{"observed_at":"2026-05-19T08:23:03.402499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":"5a7bc6ff-a3da-4fca-bed0-93a2cc3657e6","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d858914eec978733d86cd67ff5ab5fd352b6fd2762c00fcb37890933e832d3ad","observation_id":"0cb7f001-34d7-467a-91e1-8031047eb52f","resolution":{"observed_at":"2026-05-19T08:23:03.330131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-10T18:05:33.743501Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d5e6873bca87aa5ca25c10878f193619331d1815fa8f752aa1b8ecf5c9127b94","observation_id":"301bff5f-135a-4629-bd06-220f1bcd1fea","resolution":{"observed_at":"2026-05-19T07:52:10.858881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"475ed389-b9d3-4059-b7fe-a417c946ea14","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:6d27ceb9f37998519a881aa0e317db616e259a3099e18fbdb586a730b15dde46","observation_id":"8d17d2e5-31b4-407b-b35b-1856094b0138","resolution":{"observed_at":"2026-05-19T08:23:03.382048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.752651Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"9442e74c-58ee-4121-8312-6a98de20d462","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:14a6980a9a33e3c3f103b5f3ce8cbeb353118cedb3d439da08850a2a3f3a01fb","observation_id":"6d0613b1-39d0-4197-bcba-1f0903ca05ee","resolution":{"observed_at":"2026-05-19T08:23:03.421781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-09T00:44:58.573039Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":"2411.15098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-07-04T16:49:57.596854Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","venue":null,"work_id":"b17213d7-e829-487b-9268-7f440614c456","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:7fe1ab59dee2df9b1649ffdc9a55e691b84aeede0a5a3cf625b9bba615e2316e","observation_id":"093b651b-a71c-4722-8a66-5191e621d724","resolution":{"observed_at":"2026-05-19T07:52:10.949091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:07e8366d66feeb9b15b007d36332977e7a0436328cc1c621e6c7ea7135819d7d","observation_id":"f34466e1-4977-4e60-b676-d991eeaa3200","resolution":{"observed_at":"2026-05-19T07:52:10.951916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21291","last_updated":"2025-07-27T05:54:21Z","snapshot_observed_at":"2026-08-09T08:06:22.574714Z","submitted_at":"2025-02-28T18:21:08Z","title":"MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing","version":4},"cited_work":{"arxiv_id":"2502.21291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.21291","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mige: A unified framework for multimodal instruction-based image generation and editing","venue":null,"work_id":"badde7b0-e628-4c55-8334-f5be331eecb5","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2502.21291","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:284db5b46a14507d578c8c3abe73e65aab546bd3a7e6d41fc6591ead1f374c28","observation_id":"42930488-b5c8-4285-9f6d-7ae72bf657f4","resolution":{"observed_at":"2026-05-19T07:52:10.958146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:550d40007ba85d258a7ecfe59f5d93e6ac493fc48610a11d4a53085a80cdb3ff","observation_id":"e5ba5c38-9473-4601-832d-f72cf168f5e3","resolution":{"observed_at":"2026-05-19T07:52:10.937303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:e7be7d03ad213884045f986680c6e21b3b1ef6dd635bec6740f08508684624ac","observation_id":"77c7b205-9491-40d8-b778-e66da0da3f59","resolution":{"observed_at":"2026-05-19T07:52:10.945573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:b007de8d71825110f8443096572968fac215c7d7669491be2dc3e27b4b035489","observation_id":"c858461c-f18c-48d2-8d98-eae8801f644e","resolution":{"observed_at":"2026-05-19T07:52:10.941892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":"6f38e321-22d8-4564-af00-2b45d920ee3f","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:77541c507c9458320df26d33ca44ec7ddb86b30114c89e117230d1353144ec1c","observation_id":"140f44c9-653f-4573-926d-dcca532e1a19","resolution":{"observed_at":"2026-05-19T08:23:03.415172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":"8ebc46b0-c57f-47b1-9850-0ad921cd524d","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:9ba7cfbec27f3fb32f569ea96181ca9fe2353227cc5153e8daff8850f4ae8440","observation_id":"e755530c-fa21-4c72-aba5-6dfdb36e33d4","resolution":{"observed_at":"2026-05-19T08:23:03.349755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02160","last_updated":"2025-04-02T22:20:21Z","snapshot_observed_at":"2026-08-07T16:13:24.968703Z","submitted_at":"2025-04-02T22:20:21Z","title":"Less-to-More Generalization: Unlocking More Controllability by In-Context Generation","version":1},"cited_work":{"arxiv_id":"2504.02160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02160","snapshot_observed_at":"2026-07-03T19:08:50.368542Z","title":"Less-to-more generalization: Unlocking more controllability by in-context generation","venue":null,"work_id":"6b8f8775-caa4-4cbe-a072-d62224e57d05","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2504.02160","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:b71ae65826f233268548512d5e2b934ac04441aabe9729b44c0c0745b4119723","observation_id":"ef199316-fc17-48f4-94e0-96ea07d976d4","resolution":{"observed_at":"2026-05-19T07:52:10.924837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.883191Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"9bd3f0a2-4735-491c-a256-4b77e6855701","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:5b56515013eaef3854653e69e1620a971fee67bdcf87933b89aab525f98dd689","observation_id":"bc61e83b-2629-4f0f-869e-418c538adfcd","resolution":{"observed_at":"2026-05-19T08:23:03.419075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:aa1aa14505b5529336f942eab16cd43e36558760b6da066f06e6d30a7141d90d","observation_id":"106f55b8-8ca1-4360-b981-428e9da0ba43","resolution":{"observed_at":"2026-05-19T07:52:10.933723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:4906c7881ed4ccb05ec0940bc8a0163cde5da390f653bcdce73225f4f303c41e","observation_id":"b2798405-bc40-48f6-964c-ef41567dfdaf","resolution":{"observed_at":"2026-05-19T07:52:10.918010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:1ad144bff7d8eba602194538fcbb3c5b7518636736d88ad71f576bd8ecffcb2c","observation_id":"bbaac2e6-aa06-436b-81cb-af82f727f2dd","resolution":{"observed_at":"2026-05-19T07:52:10.921204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":"d52c53e8-fe1a-4dc9-a985-ebc276950d59","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:0ee23722b59879dbee1e07770576b05e0b61cf739d3b2c9c2bb8c23faf4da0ee","observation_id":"c70239cd-dae7-452a-ae2f-665b7d5562eb","resolution":{"observed_at":"2026-05-19T08:23:03.411807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:57e0a1d04732be5bada2bec118d1516e9ab44fc4f990aefa6183ac36e8a45f34","observation_id":"16e7f1ba-261a-4908-a691-8ec2a6e9b962","resolution":{"observed_at":"2026-05-19T07:52:10.910090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16785","last_updated":"2024-10-10T16:09:22Z","snapshot_observed_at":"2026-07-06T18:20:18.770090Z","submitted_at":"2024-05-27T03:13:28Z","title":"PromptFix: You Prompt and We Fix the Photo","version":2},"cited_work":{"arxiv_id":"2405.16785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16785","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Promptfix: You prompt and we fix the photo","venue":null,"work_id":"42d2f398-0317-4f68-acca-7d149105d3b0","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2405.16785","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:91b0989c3a3ed51c28ec9d0e55f4c1b7e6bfa2bfe624287bc774958c6019b409","observation_id":"c5a54885-27f7-4021-b985-ff7c68482c12","resolution":{"observed_at":"2026-05-19T07:52:10.907210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"5cb789f5-9d01-47bb-9061-c1bdfbb7cefc","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:daac7b0a3d248b9949e8d174ceff56009e410600cc9116779cfe2ecbbace97e6","observation_id":"05ae6f34-1b01-423d-9f86-eb0ea44193e1","resolution":{"observed_at":"2026-05-19T08:23:03.429054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":"48db6618-0ebc-4d85-bbdc-23e7582f7e7e","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:a20ab05a24ca40f4f48bddb141062a59ef29b18121b9df680119e9315efae39f","observation_id":"36226127-c661-4c1c-9528-24bf2e23dab3","resolution":{"observed_at":"2026-05-19T08:23:03.405950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"f315ea32-0618-4151-9394-e1e1da25c09c","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:3cd7d08ae5fab2cc45332d13316d7fc2b40fb97c5ebd26721f7b9dba128a9519","observation_id":"28d57a9f-f04c-4bf8-87c7-aa11c44bbb4b","resolution":{"observed_at":"2026-05-19T08:23:03.382325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":"2504.20690","doi":"10.48550/arxiv.2504.20690","metadata_source":"pith","pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","venue":"cs.CV","work_id":"8cafd680-1279-4695-8156-9079db325469","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:a66e0ae5d5b49d10f30ee51b2ded2b51cf55e9518368d4e04a0fecbfcc839bcd","observation_id":"16cd7688-c74e-478d-a161-de57d9098dc7","resolution":{"observed_at":"2026-05-19T07:52:10.903815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"84df20fb-fbc1-434d-bd4c-e22707e9b7a4","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:73e907d9be303801aaeebe6ddc5881176d209fb13f70e64cb5d28f63f33a8877","observation_id":"ae88a07b-442c-4b3d-b86c-e65c9e7d154a","resolution":{"observed_at":"2026-05-19T08:23:03.431466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"a9fba8bb-eeb2-432a-a70f-476966b7994b","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:27a60da7fb22a1b7ab6ec2c2c0a129643be1aee9c2d4e1e43fd67fe7d27b4087","observation_id":"db41be30-8739-422d-9c6b-05007cc19616","resolution":{"observed_at":"2026-05-19T08:23:03.363668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:d72c281e9bd941567ea6e3865da94121cd496010a6d74b0d7dbdc0c425158403","observation_id":"dcfbb708-e06d-40af-b6a7-5c90929349a4","resolution":{"observed_at":"2026-05-19T07:52:10.899955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":null,"work_id":"8d75b1d7-5099-4add-b648-c6dbd1f72630","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:09a87d44169ffd3078fcdd32c0397545304cc0fe80e5cd0c65e0aeae3e06349b","observation_id":"71813034-7ca3-40fa-bc61-c7a1bcc69681","resolution":{"observed_at":"2026-05-19T08:23:03.378510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16080","last_updated":"2025-04-22T17:58:07Z","snapshot_observed_at":"2026-08-07T16:00:10.854906Z","submitted_at":"2025-04-22T17:58:07Z","title":"From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning","version":1},"cited_work":{"arxiv_id":"2504.16080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16080","snapshot_observed_at":"2026-07-03T20:18:57.711113Z","title":"From reflection to perfection: Scaling inference-time optimization for text-to-image diffusion models via reflection tuning","venue":null,"work_id":"c687f1cd-014c-4e96-a929-d24339d454fe","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2504.16080","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:2f6f3694e5f46ea60afca0dbb53f536c34d8b3ef8f07368bae8a8c9e2669ec3f","observation_id":"eacc22c5-403a-4eda-8951-f1671aaa3d80","resolution":{"observed_at":"2026-05-19T07:52:10.896518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":3,"verified_exact":53,"verified_fuzzy":35},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 100 inbound Pith citation observations for arXiv:2506.18871."}