{"as_of":"2026-08-19T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fadc1a2eac5f6da9f5d3d8c93a4f2743b47138b459589f4b845d270cc95c7671","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:28:09.873139Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:05:39.665891Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-06T13:05:39.665891Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation.arXiv preprint arXiv:2506.18095,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-12T23:50:24.433472Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T13:05:39.665891Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2507.21033"},"observation_digest":"sha256:1b1c13208827dfb4e1441d383e7bf7b6a300e57cf44e0b273153711cc619f56b","observation_id":"309f22f9-9241-4f0d-b7d2-f8eccc15f32e","resolution":{"observed_at":"2026-08-06T13:05:39.665891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T20:44:11.031053Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-19T14:17:56.717714Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.031053Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:62a4c356eb54bf89da8b2b4b702f79eaecee4aeb9ef826fe28023043cdb5c5c3","observation_id":"97a4601e-976b-4aee-a89a-3b446283c17c","resolution":{"observed_at":"2026-08-05T20:44:11.031053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2509.01986","last_updated":"2026-04-08T07:45:08Z","snapshot_observed_at":"2026-08-15T20:15:57.007856Z","submitted_at":"2025-09-02T06:06:52Z","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T20:04:00.773443Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2509.01986"},"observation_digest":"sha256:d7c691aad57589ddd3b9e231f25c568e03587692903f08e703e8363a1eef7dc4","observation_id":"5975655a-e5c2-4bd4-8859-fb51ab03caff","resolution":{"observed_at":"2026-05-18T20:06:50.141079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-04T22:36:07.886211Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-14T21:31:53.057652Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:07.886211Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:41fc776bd576c68b5de505f6a90e6ec29a84bea247833beaf8ad0e72a4ce24ca","observation_id":"9761af27-5252-44df-9dd5-1a00c12bafb7","resolution":{"observed_at":"2026-08-04T22:36:07.886211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-04T15:39:34.264959Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-13T18:55:13.828466Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:34.264959Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:8cdefd86229ef44d7d9f872dd62d1632f69e9dbd511fcc0d8032e23c6fd7c34d","observation_id":"fc41ad36-ad34-4c40-83e6-3745a1c768ae","resolution":{"observed_at":"2026-08-04T15:39:34.264959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:13039e8a8e2fc84fcbe36ea08c97f8b8d00a5cdd472d0b4252db222f6305a3ab","observation_id":"5aa384f7-4c39-4008-bbee-35e3365c1c77","resolution":{"observed_at":"2026-05-18T01:12:13.530814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-03T21:47:19.795407Z","title":"Sharegpt-4o-image: Aligning multimodal mod- els with gpt-4o-level image generation.arXiv preprint arXiv:2506.18095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13649","last_updated":"2026-07-03T19:09:38Z","snapshot_observed_at":"2026-08-16T18:41:17.237259Z","submitted_at":"2025-11-17T17:59:54Z","title":"Distribution Matching Distillation Meets Reinforcement Learning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:47:19.795407Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2511.13649"},"observation_digest":"sha256:c42d8fd7cd931dcb872a4128379b970cbbf9fcfd3c3167a61665d4d236eab9c4","observation_id":"8a09de47-3500-4297-b64b-a42980b220fa","resolution":{"observed_at":"2026-08-03T21:47:19.795407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-08-12T13:36:20.792686Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T04:17:07.534291Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2511.22663"},"observation_digest":"sha256:6514dd0a2ac6c06e9621f5775e8444708bf6788d62f38e6ae73d67b6c65a1900","observation_id":"754a545d-74ad-4438-a302-90c6c1f46be8","resolution":{"observed_at":"2026-05-17T04:19:00.627838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-03T16:21:31.813465Z","title":"Sharegpt-4o-image: Aligning multimodal mod- els with gpt-4o-level image generation.arXiv preprint arXiv:2506.18095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-18T04:16:04.807850Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.813465Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:e0f6b312ff00e2559ed172aff64de37044c1912f930dc9a7c34cd9c2b46fb191","observation_id":"cb519f03-a043-4030-8e65-b652ae1f883a","resolution":{"observed_at":"2026-08-03T16:21:31.813465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2602.06663","last_updated":"2026-04-20T06:42:55Z","snapshot_observed_at":"2026-08-17T21:50:42.058336Z","submitted_at":"2026-02-06T12:47:16Z","title":"PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T07:00:18.807922Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2602.06663"},"observation_digest":"sha256:f79f2c9023b7112507b2ad1bca9a5dd3aa2f20a14c03c7123e7c318bdf18af49","observation_id":"fa3362e7-21a0-402f-b312-f19d70ea8568","resolution":{"observed_at":"2026-05-16T07:00:42.763568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-02T18:25:52.501547Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.501547Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:bd7c854fa1a8cd5e0fabe2b06f06523d4e22180a705be1668c6d11ef505c8fe5","observation_id":"e2391c0d-6086-4f42-b788-8402b6c26b5d","resolution":{"observed_at":"2026-08-02T18:25:52.501547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2604.15332","last_updated":"2026-03-09T16:15:28Z","snapshot_observed_at":"2026-08-16T23:39:52.575937Z","submitted_at":"2026-03-09T16:15:28Z","title":"Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T14:46:41.877762Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2604.15332"},"observation_digest":"sha256:0ad697740996b073c810da933b7f2a7055716fb579dfb02733ddc9f882b714c7","observation_id":"f36e7ec0-3247-4d13-aab6-fb00b16848f4","resolution":{"observed_at":"2026-05-15T14:50:04.432062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2604.17736","last_updated":"2026-04-21T07:54:44Z","snapshot_observed_at":"2026-08-15T20:13:45.592068Z","submitted_at":"2026-04-20T02:49:32Z","title":"IncreFA: Breaking the Static Wall of Generative Model Attribution","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T05:35:46.381465Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2604.17736"},"observation_digest":"sha256:673473a72d1aa9f373564f4fe156e2cd90e0f05442a54e33e04bef6ad7824f75","observation_id":"4837438a-6459-479e-a0b3-ecbd2e941b85","resolution":{"observed_at":"2026-05-10T05:36:01.509277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-08-13T04:52:25.391449Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:fe9bed05216089de419e73caa5d1a67e820c82700224f007b99dad45f3eb48f2","observation_id":"09230663-92aa-4ccf-a58c-26893973f84b","resolution":{"observed_at":"2026-05-10T09:28:39.596721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2604.19009","last_updated":"2026-04-21T02:57:13Z","snapshot_observed_at":"2026-08-15T02:28:06.297914Z","submitted_at":"2026-04-21T02:57:13Z","title":"Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:35.600729Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2604.19009"},"observation_digest":"sha256:5e34287b4d48bd2f9b62b323ae892b21efd2b421fecb05fd0edec8454043e17c","observation_id":"d9d9b23f-5dde-4f85-93ee-e9369d2e2083","resolution":{"observed_at":"2026-05-10T02:48:27.456349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.05646","last_updated":"2026-05-07T03:53:54Z","snapshot_observed_at":"2026-08-03T14:49:05.703728Z","submitted_at":"2026-05-07T03:53:54Z","title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-08T15:04:41.518195Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.05646"},"observation_digest":"sha256:e42ca19b4a99dd95a535a7f4f622bce1d59f8e3538aa665d6aa3beb5aee43d04","observation_id":"036cb635-679c-45df-b969-4de48f914a80","resolution":{"observed_at":"2026-05-11T18:36:08.006096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.08354","last_updated":"2026-05-08T18:05:27Z","snapshot_observed_at":"2026-08-17T20:38:39.987485Z","submitted_at":"2026-05-08T18:05:27Z","title":"Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T00:58:53.626310Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.08354"},"observation_digest":"sha256:afddba12ccfa248a2d331238009a198c18927aae03be04acc92785b74f61baae","observation_id":"bb07873a-e4b5-4054-b07a-f76fb25daa70","resolution":{"observed_at":"2026-05-12T08:36:24.278633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.09430","last_updated":"2026-05-12T03:20:13Z","snapshot_observed_at":"2026-08-12T22:45:19.762221Z","submitted_at":"2026-05-10T09:07:20Z","title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T02:20:25.071428Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.09430"},"observation_digest":"sha256:2353b8a3b7bcdbd48acfc445e557b90e504e338f17da7eca62cde5ddb5aff7cc","observation_id":"316fed8e-229c-45ae-93e4-189f4ff73509","resolution":{"observed_at":"2026-05-12T02:21:16.540851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.09430","last_updated":"2026-05-12T03:20:13Z","snapshot_observed_at":"2026-08-12T22:45:19.762221Z","submitted_at":"2026-05-10T09:07:20Z","title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:54:24.248910Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.09430"},"observation_digest":"sha256:da5e38cb2d7d8afa9c668e8cb49a4be457cae66ca029eed9cae741c7db70fbdd","observation_id":"0c7faca6-810c-47fd-a7bb-81d967daa41a","resolution":{"observed_at":"2026-05-13T06:02:23.630811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.12724","last_updated":"2026-05-12T20:29:26Z","snapshot_observed_at":"2026-08-14T20:33:27.313094Z","submitted_at":"2026-05-12T20:29:26Z","title":"Inline Critic Steers Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:52:10.428866Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.12724"},"observation_digest":"sha256:7dbdce20e20eb15831db55da2b82301b95767d8d4c357ca687233923dd83cb6b","observation_id":"d6a7db49-d335-4b4a-810a-1172fdb05aef","resolution":{"observed_at":"2026-05-14T20:52:57.810329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.21100","last_updated":"2026-05-20T12:28:51Z","snapshot_observed_at":"2026-08-15T15:35:40.421490Z","submitted_at":"2026-05-20T12:28:51Z","title":"NanoCP: Request-Level Dynamic Context Parallelism for Data-Expert Parallel Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T01:51:38.671365Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.21100"},"observation_digest":"sha256:0baa09841bb6d035e0d62587284fa187c152418d71083e5a9d7333cbc1d6dadf","observation_id":"1766dc85-7e6e-424f-9f0d-7b44974e8ed6","resolution":{"observed_at":"2026-05-21T01:53:54.532915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-08-16T15:52:17.416464Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:2533f74f11f8e5ef34ce557485b3cbf7918b1928ba89888074f7634ea90cdbcb","observation_id":"e6560117-548a-4d13-be28-0661929cf818","resolution":{"observed_at":"2026-05-22T06:41:10.556131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2605.26108","last_updated":"2026-06-06T16:11:19Z","snapshot_observed_at":"2026-08-02T21:36:48.643552Z","submitted_at":"2026-05-25T17:59:21Z","title":"Reinforcing Few-step Generators via Reward-Tilted Distribution Matching","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:06.005125Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2605.26108"},"observation_digest":"sha256:8ef2874edd48bac6afcda15a855953e9839ce0ef4ee65346d7829e02d2fe45bf","observation_id":"85c82c7e-a6da-4d5c-8a6c-2801a4224f68","resolution":{"observed_at":"2026-06-29T22:24:00.240761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.04457","last_updated":"2026-06-03T05:01:36Z","snapshot_observed_at":"2026-08-01T16:33:31.835924Z","submitted_at":"2026-06-03T05:01:36Z","title":"Imagine Before You Draw: Visual Prompt Engineering for Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T07:12:24.297839Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.04457"},"observation_digest":"sha256:517ce5531c08034771896a4aefcd9090af6fc30c977c52517a8e2fdcc08bfdbb","observation_id":"b5f23702-f0d4-4c15-b8c3-f3327b84f720","resolution":{"observed_at":"2026-07-02T07:06:43.968385Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-07-12T20:04:25.886330Z","title":"Sharegpt-4o-image: Aligning multimodal mod- els with gpt-4o-level image generation.arXiv preprint arXiv:2506.18095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05172","last_updated":"2026-04-16T08:05:42Z","snapshot_observed_at":"2026-08-14T03:18:56.685775Z","submitted_at":"2026-04-16T08:05:42Z","title":"Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T20:04:25.886330Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.05172"},"observation_digest":"sha256:cfd60275ca0e8eb104e5bc957b3a74c9eaf8ad72a94aae1e43af6b2b7e5d3b63","observation_id":"c6f74ddb-5aa5-4c90-aa36-b29908259095","resolution":{"observed_at":"2026-07-12T20:04:25.886330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.11188","last_updated":"2026-06-09T17:59:28Z","snapshot_observed_at":"2026-08-12T01:49:55.682029Z","submitted_at":"2026-06-09T17:59:28Z","title":"ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T13:29:11.526106Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.11188"},"observation_digest":"sha256:a29d85a182333b7d64fdff63d9f266dae30296f9b792e07db76ede4cda028eae","observation_id":"f0b73f3c-addd-4bdd-8dfc-27ba463084f6","resolution":{"observed_at":"2026-07-03T05:07:38.513361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.18249","last_updated":"2026-06-17T18:39:52Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T17:59:22Z","title":"Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T01:18:03.846908Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.18249"},"observation_digest":"sha256:3c89326a3f1712e31e16fb67e1bb433da57709d0f70f85ebf395d29f5da0775b","observation_id":"ab01bb93-776e-4a24-beeb-28189b032601","resolution":{"observed_at":"2026-07-03T20:28:55.875492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-08-17T03:47:28.436926Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:25.661515Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:87a40b7aaefe55a69e648be6c30f9e5aca889c3f7bd7e91126ccfe1d6afd4f0b","observation_id":"fe67454a-814a-44fd-ae3c-dd1fc17f989f","resolution":{"observed_at":"2026-07-04T10:09:44.712827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-08-17T03:47:28.436926Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:ba2d9e40d7220ac7621b08a2460eb706f32bad6d52564c416921807751a9b729","observation_id":"1de9217b-9bef-4351-9d86-57918e098cee","resolution":{"observed_at":"2026-07-03T23:19:02.551077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-12T23:14:12.939313Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:82419041ff63835a56e1ae742ab63e5f41d17a21056e050ea4ac0b55c0338bd9","observation_id":"641635b8-ad85-4a14-92e2-7750f4291c44","resolution":{"observed_at":"2026-07-04T16:39:58.132069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:7a961164e87e5ae8477b43cd63679b8b9a829035c9b3e3d296d28798ab0c8c44","observation_id":"103e9039-0169-4e0a-ab9d-31bb526dea8c","resolution":{"observed_at":"2026-06-30T08:14:26.639738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-02T09:39:38.579281Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation.arXiv preprint arXiv:2506.18095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:38.579281Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:6a0aceb8aa04ee93d759546a5da85816e44c71e86ed783603e608f2675631e35","observation_id":"ecef6b90-21a0-4183-9f66-858677c0af61","resolution":{"observed_at":"2026-08-02T09:39:38.579281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:9ec7d7ff3027acb4bdc8d9d7211d87bc0fc873bbad465eaf5e830718f6503649","observation_id":"ddcc576d-155f-4567-ac5a-5e08fe62b0e1","resolution":{"observed_at":"2026-07-01T10:05:40.348481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-07-30T18:58:28.492234Z","title":"arXiv preprint arXiv:2506.18095 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26860","last_updated":"2026-07-29T12:44:19Z","snapshot_observed_at":"2026-08-12T23:39:20.547745Z","submitted_at":"2026-07-29T12:44:19Z","title":"Amortized Moment Matching for Visual Generation","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-07-30T18:58:28.492234Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2607.26860"},"observation_digest":"sha256:791cc5189fc60808e03395bce66a8e653878663e94442df3355e638bca0ddaa4","observation_id":"7c2e7998-274a-41b1-a194-d37e832b4a2d","resolution":{"observed_at":"2026-07-30T18:58:28.492234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18095/citation-record","integrity":"/paper/2506.18095/integrity","json":"/paper/2506.18095/citation-record.json","paper":"/paper/2506.18095"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:28:02.069987Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.069987Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:a8265a81eafb263f08aa060709d84dd1044c9c7ee5c401af6b421454ef39d49b","observation_id":"69c5562d-0f13-4a78-8d26-0031208ab9d0","resolution":{"observed_at":"2026-08-06T23:28:02.069987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:28:02.150573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.150573Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:6862cd6c425f38011705a6a4d896a7f5699279cebb4d83a11a64312c7a8023bb","observation_id":"5b691a77-58c4-4ab2-90ab-953e6a7ba643","resolution":{"observed_at":"2026-08-06T23:28:02.150573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:02.300477Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.300477Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:005b77aa193dc2a3edfb52d6c05a2dc1ec3042c2d97275fc3b357de4c4959054","observation_id":"6c933785-3e08-43d6-b7d8-d0b435ead2e0","resolution":{"observed_at":"2026-08-06T23:28:02.300477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.744933Z","title":null,"venue":null,"work_id":"cf92c075-d3c5-4904-9505-2ce34a2f583f","year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.436973Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:e706188c3751633fc9e52ea982dad1eae3c476daeee24a0f7f146d8aaf16033d","observation_id":"70ff78fa-e686-41a1-8739-eadb3ae22e54","resolution":{"observed_at":"2026-08-06T23:28:13.805385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-08-14T05:30:11.702159Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-06T23:28:02.515024Z","title":"Hidream-i1: A high-efficient image generative foundation model with sparse diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.515024Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:07448baa4e0ddca84bdeb81639862886045b50fdecc9232de7028f3617866654","observation_id":"ef533ac3-2a70-43fc-b9e2-bd3923428b92","resolution":{"observed_at":"2026-08-06T23:28:02.515024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:02.647600Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.647600Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:b25b4766f9c68109e90ddbdc730257fa61b675b1616ac511cfa81d31b4741e09","observation_id":"cbff37d4-5075-466a-a5d1-40fc08ab1094","resolution":{"observed_at":"2026-08-06T23:28:02.647600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T23:28:02.771576Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.771576Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:431c73637b225e78313dab7cba1e075c6c79afec528451753c641985797b02ff","observation_id":"eac4d61d-d032-4427-a682-7161337aadda","resolution":{"observed_at":"2026-08-06T23:28:02.771576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.561565Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"ed395c2b-545e-40d6-ac11-e5cd2e44f6fa","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.860703Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:ba575479b3b23e3bd1dcdaca2f16d3b02e61a175ec18cf89fc664c0c1521493a","observation_id":"c30384a4-4ee4-4ed4-a4e7-a5cea2b3ee23","resolution":{"observed_at":"2026-08-06T23:28:13.571786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-06T23:28:02.977351Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:02.977351Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:75cd463a55ffc5fb6b557a556a4cf5758f8d4995109ff524e22f142d19cc490d","observation_id":"a7146d27-7331-49b9-aca6-3cc16e2da07e","resolution":{"observed_at":"2026-08-06T23:28:02.977351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T23:28:03.158995Z","title":"Pixart- alpha : Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.158995Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:6e02e9f650d1cc01cd641d22cf9c61ca3728b5cbb21d401c201986f74af533de","observation_id":"b8da046a-4135-48c8-be05-d26a0e3795d7","resolution":{"observed_at":"2026-08-06T23:28:03.158995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-16T14:11:52.899972Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T23:28:03.229878Z","title":"PixArt-Sigma : Weak-to-strong training of diffusion transformer for 4K text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.229878Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:69464b9604918a5a969d7682825b469132f60606850ee75d5052801302630ecd","observation_id":"85473dbf-336f-4058-a13a-706dc983d539","resolution":{"observed_at":"2026-08-06T23:28:03.229878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.542668Z","title":"Towards injecting medical visual knowledge into multimodal llms at scale","venue":null,"work_id":"1065ee51-bc97-445b-9c7a-681ffc4d2560","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.351626Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:adccebff615805dc0a51a6e824c7d8eced94de07e53259513c7382d3d05d5ef8","observation_id":"2aaaca21-4a0c-4264-82cf-4fb231c583d6","resolution":{"observed_at":"2026-08-06T23:28:13.550252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05979","last_updated":"2025-04-10T18:02:00Z","snapshot_observed_at":"2026-08-16T12:43:02.129478Z","submitted_at":"2025-04-08T12:34:36Z","title":"An Empirical Study of GPT-4o Image Generation Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05979","snapshot_observed_at":"2026-08-06T23:28:03.456631Z","title":"An empirical study of gpt-4o image generation capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.456631Z"},"links":{"cited_paper":"/paper/2504.05979","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:0ad26d9646913e8969221c712aaa157e3acf4a668a3fd96bcca7579a459e6c17","observation_id":"957fd8ea-0870-43da-8c62-b3105c881098","resolution":{"observed_at":"2026-08-06T23:28:03.456631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T23:28:03.554887Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.554887Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:28a8059519f17dda57f9fa7a62c7e44858d972ae50a209ca25510ade300adda7","observation_id":"d08889de-d609-4182-bf83-dc48d97d6027","resolution":{"observed_at":"2026-08-06T23:28:03.554887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.520156Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"2dafcde3-97b0-4e38-be02-79fc0d672027","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.658952Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:9f23ed8ffda78df45340f27957362a1fca6f584e1c2ecdd0377bde2ecf8d487e","observation_id":"15442cd7-75d2-4569-9597-4fe2acd1e963","resolution":{"observed_at":"2026-08-06T23:28:13.528954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.736199Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.736199Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d81a28c4d29ffa9b050a4eeddd8d68118148e2832817888dcbe47495bbf9f8d1","observation_id":"40d29074-f65e-410f-a2d0-d123bed6d857","resolution":{"observed_at":"2026-08-06T23:28:03.736199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.942387Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.942387Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:869378509002dba0789ce38671813dce6e75f963944f66ba00021d6079d9ee92","observation_id":"bb9e5f82-cff9-40ff-96da-a3b628019a21","resolution":{"observed_at":"2026-08-06T23:28:03.942387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T23:28:04.066433Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:04.066433Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:aeb110e121dab6b116fe8ea96d171b9c90360a7ea68ebc2b1db29f4eb6cf571e","observation_id":"e4c5993d-a8bc-4bfc-8321-bf08e951258a","resolution":{"observed_at":"2026-08-06T23:28:04.066433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.383786Z","title":"Vitron: A unified pixel-level vision llm for understanding, generating, segmenting, editing","venue":null,"work_id":"904ad6c2-bc32-427a-8418-2ee2d0701755","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:04.224741Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:fae8be82d825e5c98261094709cbb659ca1ead678d9d85b6c772e3c9e08aaabc","observation_id":"6433a298-c677-49e5-a1fd-37950c61de70","resolution":{"observed_at":"2026-08-06T23:28:13.389494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-16T13:54:49.928296Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-06T23:28:04.382575Z","title":"Seed-data-edit technical report: A hybrid dataset for instructional image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:04.382575Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:19a048bfe51fe26512a95e939ba65d1577bc267bc0d0df1348fe7f4936100e11","observation_id":"87b0722d-66c5-4169-8e41-392d3cf70911","resolution":{"observed_at":"2026-08-06T23:28:04.382575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T23:28:04.533542Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:04.533542Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:30b319d5a4f8709e78daf66074d1a12576e61d4c658e0093a0778bb13a479bb6","observation_id":"6f1804a4-f939-48ba-b28c-95fd060943be","resolution":{"observed_at":"2026-08-06T23:28:04.533542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:04.640332Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:04.640332Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:f5ad6f43c84134d1a0f480ad6305b8f69c443db4c8a7004f0127850bc7704c3d","observation_id":"b44d41eb-f8f1-48f9-9326-50c82c9e473c","resolution":{"observed_at":"2026-08-06T23:28:04.640332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T23:28:04.820031Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:04.820031Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d9e19f3aba1929e4097122d96438fdc9b4585db8fab1f88b4ad999a02804a365","observation_id":"6024e104-6b00-4937-8047-8d428796140e","resolution":{"observed_at":"2026-08-06T23:28:04.820031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T23:28:05.045258Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.045258Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d28b722b3f7dfc29f37ffac7c3e87aa55ee27d72c46aebb1cc7aa2fa8333765a","observation_id":"f246f47c-5b94-48ad-9136-c22984658118","resolution":{"observed_at":"2026-08-06T23:28:05.045258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.174734Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.174734Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:e8ed7def9b5c6455900fc1c6a606225a8b7284e402a381e3cbdf36b33cc7bd68","observation_id":"38cfac70-e405-4248-a732-bbf13ee34dc9","resolution":{"observed_at":"2026-08-06T23:28:05.174734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T23:28:05.319362Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.319362Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:1a1efd8469f0813e61753cf75dac9e626e41e4be956a5590dde7dd561877120d","observation_id":"e4e2ec45-017a-4238-a3ab-4b06efe22c14","resolution":{"observed_at":"2026-08-06T23:28:05.319362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-08-16T14:00:43.952995Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-06T23:28:05.426710Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.426710Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:45e6f001e4f4ed5ab979b3a0f2c09582691196c2878092c0d29e0ac32b892765","observation_id":"06002829-b5c3-45a0-afbb-b23882b30f20","resolution":{"observed_at":"2026-08-06T23:28:05.426710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-06T23:28:05.513912Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.513912Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:77c11a26f124e85feb7fd3c27f085aabfab55ee34562555334bc8a0e8f2f4baf","observation_id":"7b25588c-f228-4a12-ba65-2cef87527286","resolution":{"observed_at":"2026-08-06T23:28:05.513912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T23:28:05.645405Z","title":"Hunyuan-DiT : A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.645405Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:2e930cf01f5d7b11ad3c1db430c5fb55a4434009151204d9921408714d2a7f0d","observation_id":"7ba124ae-8510-4cb4-890d-62a2b53796e0","resolution":{"observed_at":"2026-08-06T23:28:05.645405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.789504Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.789504Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:9d8eaf993aaf457eabaa0fddb7187bf3b85043ff42d4c07a4d6665cbea96a806","observation_id":"e562b3fb-f63d-4cc7-b413-3d1c74b0aa45","resolution":{"observed_at":"2026-08-06T23:28:05.789504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T23:28:05.906884Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.906884Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d5b3c1aa3aabd6451ddd3161bfd0e2478d1f25cd701e4a86ecfb0fcbadfa187d","observation_id":"c300218b-9319-49f5-a65d-ccb32c38d7c8","resolution":{"observed_at":"2026-08-06T23:28:05.906884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.009347Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.009347Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:51c6d025dc944cdea96a30f53ddef09ea4d5bf029f53826cda86331c9e6ba53b","observation_id":"cff1c216-f4b1-4c03-b46f-4de3610ba0e9","resolution":{"observed_at":"2026-08-06T23:28:06.009347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-06T23:28:06.131216Z","title":"Step1x-edit: A practical framework for general image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.131216Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:3cdf42b9006b8a45e9dce76e231c22dd300c2264deac95700087c5c2a13ce06d","observation_id":"fc9bb83e-0a06-4809-bc1f-7394afe78b75","resolution":{"observed_at":"2026-08-06T23:28:06.131216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.175541Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"edef9b49-5c83-4058-b64c-da3dbc00b0cd","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.214740Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:c25155c325d9cf6fbf9234dd3a5406bf9c120aa8ffab10833168e1c63ccfadd0","observation_id":"3c72b30d-b76f-46e3-904b-5b40ce4cc75e","resolution":{"observed_at":"2026-08-06T23:28:13.179146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.146571Z","title":"Introducing 4o image generation","venue":null,"work_id":"d1d4ec3c-9beb-426f-aaae-722acf3a9503","year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.334827Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:0aee4dd1edf8f0692f127bdb3c368e9697f5978a3022ffc7511dfc0246567e0a","observation_id":"274d2a4c-60dc-47e0-afae-701416afd088","resolution":{"observed_at":"2026-08-06T23:28:13.154825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:13.099269Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"5cf50c09-1fcf-49a8-bb5a-48e84dc53a88","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.509959Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:3a1c475c051754eb4b467605eec1886cafb7d9e4bd6409c2c57bdb9dd751359d","observation_id":"cb7f369c-0901-4b24-9a8d-7f61448e8fda","resolution":{"observed_at":"2026-08-06T23:28:13.118415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T23:28:06.646624Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.646624Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:758bd820b4dcf5839c439cf1a60202c8cbf0698fd8ca5c337a931ea8f4eec2b9","observation_id":"1f9c8120-20d2-4887-b0f5-f3a4ccebf895","resolution":{"observed_at":"2026-08-06T23:28:06.646624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.689684Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.689684Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:4176e8f093bf25de70de8a815260f5646a660518018e47f54b87b11641368a8e","observation_id":"833463f7-e50d-4d93-a8f3-1c9cb36c4c79","resolution":{"observed_at":"2026-08-06T23:28:06.689684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T23:28:06.766108Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.766108Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:18b562dd421ecafcd18cd3d476a35cc9c873a69046dee789c73c474be5aba49f","observation_id":"72909ad8-c2ee-4c84-bf18-a35670526051","resolution":{"observed_at":"2026-08-06T23:28:06.766108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.914738Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.914738Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d9a24127c6c64ae6b93b3e2962f5c19eb39fca120c693e0b5915b2b022b05de0","observation_id":"6c462b7d-8688-40c6-a78f-b0e484c67518","resolution":{"observed_at":"2026-08-06T23:28:06.914738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.979295Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:06.979295Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:cc7afb004a3534472ebb81072a17cf7a3400b158cbb2d2ee9231e89dc4704be4","observation_id":"12a8bce6-abcc-4ab9-9525-50ad057c2fc2","resolution":{"observed_at":"2026-08-06T23:28:06.979295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:12.719025Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":"a35c6e8b-e526-4361-a59e-7363d6bd98a2","year":2020},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.083550Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:c8fe5e91b0fcafdd34dc5c6f16cf96057b8a7dafc6958b6ed6de1ac3ce4b29ac","observation_id":"222979f4-59dd-4405-ae40-8aaa9832f1ab","resolution":{"observed_at":"2026-08-06T23:28:12.844257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.165955Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.165955Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:8668f1e78df66e83b15fe9b8eccdbab8b07c0cac4f4c75a3384393d3e0f917d0","observation_id":"51f3cb0c-7788-42fd-addc-18d22233d511","resolution":{"observed_at":"2026-08-06T23:28:07.165955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T23:28:07.246822Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.246822Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d9872d41037e3037b61bbe9733ba15b3615f7dd5eda32d44dfa231b7a817fa54","observation_id":"3edbe10a-0c9e-48bd-8f73-267640380da4","resolution":{"observed_at":"2026-08-06T23:28:07.246822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T23:28:07.325623Z","title":"Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.325623Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:ccbf0da732c74113a57f0eafba883de868bc30b0fd64db14ac72de95fc27540b","observation_id":"f3c691b7-ca7e-43f3-9127-bcf2e679a695","resolution":{"observed_at":"2026-08-06T23:28:07.325623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-08-16T13:00:15.419884Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-06T23:28:07.466483Z","title":"Multimodal latent language modeling with next-token diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.466483Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:6de7dc6fc02809d84c92b4bba5867ca2d1be273f68619fc95221b90e8a6eb005","observation_id":"2dc2524e-c15d-4508-9692-c276ee0a6476","resolution":{"observed_at":"2026-08-06T23:28:07.466483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T23:28:07.564744Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.564744Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:5c1b9c283a6414cbf1ca4023dc148c29f6f9cb7e5c55e79e495c5db518452097","observation_id":"fdd28907-eb26-4f3d-9ab0-5626dd9ad9f3","resolution":{"observed_at":"2026-08-06T23:28:07.564744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:28:07.666376Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.666376Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:2e7901bad54d48debea474423869d7db0e6f5923107661978ab43bc4d795dad5","observation_id":"2c17f4fa-c2bd-4259-9522-c95de7b73cfc","resolution":{"observed_at":"2026-08-06T23:28:07.666376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-16T14:03:52.109479Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T23:28:07.776955Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.776955Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:eb9aca44951fb080d6210a8b9976fd87138789f6eb8421bc504aa7c6ba570e65","observation_id":"6c6b19f1-d144-4ac2-baae-41fc252e9ec4","resolution":{"observed_at":"2026-08-06T23:28:07.776955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-18T18:25:23.717451Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-06T23:28:07.866027Z","title":"Anytext: Multilingual visual text generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.866027Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:58a37692b15bbc35f47ad9879c26430113fe763278ee981293d4ff0fc57423e6","observation_id":"c624ce04-be73-430f-ac7c-a92fdeb31ee0","resolution":{"observed_at":"2026-08-06T23:28:07.866027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.957576Z","title":"Textatlas5m: A large-scale dataset for dense text image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.957576Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:5f84334ab1c178eba70daf9a5d20376d2fb15c283c243f9b958d19529ccbc0e3","observation_id":"50751418-9b2e-4298-80b4-0b39d30c5a8c","resolution":{"observed_at":"2026-08-06T23:28:07.957576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T23:28:08.063683Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.063683Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:42b8f25916fd718b0c80265963ba9b12f86ab573bfce2043c088a22930fce1b1","observation_id":"bf8346c1-e658-4964-a6ab-e8e635871ba8","resolution":{"observed_at":"2026-08-06T23:28:08.063683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:12.510056Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":"16e31f8d-ca14-401a-ac1e-beb6aabe6560","year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.191964Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:d108caa1b5c9f771dabf38f5cdde29eb6fd1bd2c896ca8c97908f3480d696c7a","observation_id":"dfdb897c-4045-4ef7-a3e9-6674083af233","resolution":{"observed_at":"2026-08-06T23:28:12.599256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:12.244931Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"d4318490-799b-4c3a-9d29-22a20e4e0969","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.271954Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:7c0e97495bdc1e5a9cd21931b6c3be50966e96c5ae8efec886ad479ccb6fa58a","observation_id":"495838a0-7edd-4c79-a3d1-63b7286c119d","resolution":{"observed_at":"2026-08-06T23:28:12.344746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T23:28:08.396644Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.396644Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:ebf1d9a78c879b4272e08b852d12e29e8042de739301ea34d9408645deedc3d6","observation_id":"ddc754d1-d7c9-41eb-957b-146175a044f5","resolution":{"observed_at":"2026-08-06T23:28:08.396644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02782","last_updated":"2025-05-02T04:42:06Z","snapshot_observed_at":"2026-08-19T08:04:06.044525Z","submitted_at":"2025-04-03T17:23:16Z","title":"GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02782","snapshot_observed_at":"2026-08-06T23:28:08.514846Z","title":"Gpt-imgeval: A comprehensive benchmark for diagnosing gpt4o in image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.514846Z"},"links":{"cited_paper":"/paper/2504.02782","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:8eb5420579cb1a1436074dfc22d882d2dd65ed101706cc099d996cacec7c45d2","observation_id":"8c02d195-e9af-4ad9-9409-7113542331ad","resolution":{"observed_at":"2026-08-06T23:28:08.514846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-06T23:28:08.633139Z","title":"Imgedit: A unified image editing dataset and benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.633139Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:032ab47813698b3399a0ec3b149f95258fbb5d6630546af71ec9f4bad38a360d","observation_id":"0742d445-1c92-44cc-84ee-7aa31c60195b","resolution":{"observed_at":"2026-08-06T23:28:08.633139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-18T22:18:02.034966Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T23:28:08.742835Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.742835Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:2398d16438ae83b0215fbab1c033aa1c70dc86550af5eba50d003462850c1df7","observation_id":"78361dec-7c30-48e3-bd4c-a52ff3363c04","resolution":{"observed_at":"2026-08-06T23:28:08.742835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15738","last_updated":"2025-03-29T04:08:47Z","snapshot_observed_at":"2026-08-12T13:55:13.088452Z","submitted_at":"2024-11-24T07:02:56Z","title":"AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15738","snapshot_observed_at":"2026-08-06T23:28:08.784667Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.784667Z"},"links":{"cited_paper":"/paper/2411.15738","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:8e44e25025475eb22cf406ca25e6e8ef04b77211e640eb6ff7264b0e89ea81db","observation_id":"5a485763-c51a-4191-a88b-d9b7a0856edf","resolution":{"observed_at":"2026-08-06T23:28:08.784667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-19T05:12:40.917141Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-06T23:28:08.892356Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:08.892356Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:f0e1793f36e880c8e8cc5ff0371520d978d385ecc85d03e28038d88c8098532a","observation_id":"8a224390-44a0-45a7-8793-be16ff421cfa","resolution":{"observed_at":"2026-08-06T23:28:08.892356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21356","last_updated":"2025-07-15T09:23:42Z","snapshot_observed_at":"2026-08-16T11:46:59.313125Z","submitted_at":"2025-04-30T06:30:48Z","title":"Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21356","snapshot_observed_at":"2026-08-06T23:28:09.017945Z","title":"Nexus-gen: A unified model for image understanding, generation, and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.017945Z"},"links":{"cited_paper":"/paper/2504.21356","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:dc900e727abb0607c827c017bbc2c912d0fb6d282421ff0a2345f049df86d077","observation_id":"2d8274e0-8a91-441b-a62f-d36fd59cca34","resolution":{"observed_at":"2026-08-06T23:28:09.017945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.743644Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":"68b20b49-91f2-4814-aaa7-a6fd215bd5da","year":2023},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.124231Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:993133f71571adf246ca1df46198675edcbd5856bada4fb626361ea28ff65df9","observation_id":"1116264d-5982-416e-b4cb-21b2edcf599a","resolution":{"observed_at":"2026-08-06T23:28:11.964652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.467445Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"5891b8d3-ffc6-4a8e-b278-d97c3f4c4c27","year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.246658Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:970c9b0333b5bc342b924ca48c2a536a5b7315f674055a109fccd665b58f2d3e","observation_id":"6a1d66f3-ab3f-4fee-89fb-2bce5ce3dbf8","resolution":{"observed_at":"2026-08-06T23:28:11.572391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T23:28:09.349741Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.349741Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:7cff7ccace785620285ada3c875c476f7537df10ab642d8894bb3d100bc4dab1","observation_id":"bfb47594-c57c-4467-b740-9912eabe5eb3","resolution":{"observed_at":"2026-08-06T23:28:09.349741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-16T13:45:47.270039Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-06T23:28:09.448639Z","title":"Lumina-Next : Making Lumina-T2X stronger and faster with Next-DiT","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.448639Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:08e277ad99a6c6a7c1d4e3108423c152d63e27c3d6fc3b6c8b39306f7dce7703","observation_id":"6e8b3b05-e52d-4294-b1d1-4cad0a13b504","resolution":{"observed_at":"2026-08-06T23:28:09.448639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.580228Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.580228Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:85971b04ab28af26bb67fd2ce9b588797814957f4980f166fa4c5655ae3a3da8","observation_id":"bd4dc842-09ed-4014-b8b8-caa0e77bb21a","resolution":{"observed_at":"2026-08-06T23:28:09.580228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.673093Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.673093Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:87a07edb2f50f91d6cc6d56d466e6d39791d608e0a62d06f8e18577fe8f7f4cc","observation_id":"b1018978-483a-44b2-8dad-4850576be72d","resolution":{"observed_at":"2026-08-06T23:28:09.673093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.791138Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.791138Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:7e5f5782eaad2f3f54c5f292e6db7d5df09682ba31c541f22562818852d52262","observation_id":"e9f828fd-6031-4f3a-8220-d88fd0f0b425","resolution":{"observed_at":"2026-08-06T23:28:09.791138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.115779Z","title":"v6kL8 | c6 +zP? z ۷ 7?Y| -w?iiiEޔCT֐ t1gΜjsss + B M ]UVڡth<3 E NUݺu WM .\\(P& @ס^^^= ;+[i4o ԗ/_FuPg- >ƹs ݴ_4","venue":null,"work_id":"920f2565-abb7-4db0-84a3-f78b182e520b","year":null},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:09.873139Z"},"links":{"citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:1cc879c5d15e79379788f34cfc4b76801df03792187bd4c34cb678b743ba96c5","observation_id":"da56fdde-9320-4ccc-9888-19350a643d65","resolution":{"observed_at":"2026-08-06T23:28:11.254750Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 34 inbound Pith citation observations for arXiv:2506.18095."}