{"as_of":"2026-08-05T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d18750d7a814c8cda0fb45f77821046ef79657abcfd5db1e279a1b4988d79e0f","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T14:48:22.805268Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:56:58.714370Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05781","snapshot_observed_at":"2026-08-01T18:56:58.714370Z","title":"Steer- ing visual generation in unified multimodal models with understanding supervision.arXiv preprint arXiv:2605.05781, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-01T18:56:55.577266Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.714370Z"},"links":{"cited_paper":"/paper/2605.05781","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:3eb02e9ad620e6856a3aa0b957432125bf819ee014dbabc6798c8a0df4e51eee","observation_id":"34c57d94-5c67-40a6-93a0-01c71264e2b1","resolution":{"observed_at":"2026-08-01T18:56:58.714370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.05781/citation-record","integrity":"/paper/2605.05781/integrity","json":"/paper/2605.05781/citation-record.json","paper":"/paper/2605.05781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:3dbf4228f1688edcfdfd96b3c899ba3bfb3636c12cda50b9575e6e334cacae31","observation_id":"10bb8fb6-edeb-4e17-92d7-3e70b39f4d85","resolution":{"observed_at":"2026-05-11T18:41:10.180724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:1cb26ee3d183db39a7dfc035a8f9c22c0f32b6dbb70561556a4a7f72282179f9","observation_id":"5b152c83-e36c-416a-8a01-481ce1336fec","resolution":{"observed_at":"2026-05-11T18:41:10.317678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black forest labs; frontier ai lab","venue":null,"work_id":"4b88dcc9-3e66-47f2-955b-92c7ff71efbd","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d60f1e88dbd8b3695aeaef40e2919d1610d71d921c87fcc0646dc34430e3fee6","observation_id":"6bb45bf8-0403-4638-891c-dae03592dc85","resolution":{"observed_at":"2026-05-26T11:37:37.309576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.546729Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"182396b0-39b5-4e35-adfd-c6dbe856535f","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:cd778cd5b584f1e5d501905b06769924dce6a8281352c8f45d6ba9753bcfe8d8","observation_id":"3eb67d1d-55e6-4c14-a0bf-5f36e1b0df3e","resolution":{"observed_at":"2026-05-26T11:37:37.243160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:c59852c132545fc546a0b3d9945f9e3736d10a2586fb22258d087937600b7898","observation_id":"55547654-a559-4f93-8355-ed0627988905","resolution":{"observed_at":"2026-05-11T18:41:10.302599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d62b9cd42184c8faa6c32d0722bcf761fb9ea4fe6b276a728c640ed4068ffd19","observation_id":"dd41f6e7-56e7-4d1a-9d75-6a982f0a017b","resolution":{"observed_at":"2026-05-11T18:41:10.290503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-04T09:56:28.937130Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"cited_work":{"arxiv_id":"2505.22525","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22525","snapshot_observed_at":"2026-07-04T19:20:06.640927Z","title":"Thinking with gen- erated images","venue":null,"work_id":"811d793e-4a3b-46c0-9524-93240379a671","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.22525","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:01254de290f49324920dbe2c45d46219cf54729c4ef924ae755fe96dd2c833ca","observation_id":"b031ab72-d0c4-4ddd-93a2-57750730bffb","resolution":{"observed_at":"2026-05-11T18:41:10.130970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.11715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T14:13:30.307458Z","title":"EditMGT: Unleashing potentials of masked generative transformers in image editing","venue":null,"work_id":"2c3c9b44-dec4-4ddf-9e3c-729cd5686767","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:a9568375c68d6edade615d4de511048339ba412273ddf551a9bb990df1503d0a","observation_id":"345cb79b-2f2b-487b-b7da-6d8d70ce0dda","resolution":{"observed_at":"2026-05-11T18:41:10.223010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-10T13:37:06.841769Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:298fb49eba25ccc875425de08244269686e51b6151e11e4fde4bfb495503185e","observation_id":"ac2b1d96-5cd7-4cc1-856d-a176cdc78958","resolution":{"observed_at":"2026-05-11T18:41:10.205130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":"6bb35431-1325-42bd-b15b-61db05a2379e","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:228d51466afc5e363b35f4de2abbdfdbe27285f73f5054d704ae23aab9c4a4b2","observation_id":"25f4e5b8-dd67-4e20-b310-0009e062f9e7","resolution":{"observed_at":"2026-05-26T11:37:37.298640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.779001Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"3561a0ff-7939-4f07-9620-be9f8868052e","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:a77a0cd680aad712ccc0b1e9092dc8ec809438d29e29d41b0eee3661d660b9b8","observation_id":"7c6f48bd-bc1c-47b0-af80-664d9878c89c","resolution":{"observed_at":"2026-05-26T11:37:37.302562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme: A comprehensive evaluation benchmark for multi- modal large language models","venue":null,"work_id":"ace47d78-99b8-4861-9567-8fbea8b5797c","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:66346bd9663a4a01601d6b90be51006a912c82f2add3459504d145bf282a0b97","observation_id":"fe2be6f1-c4be-4b94-bb9e-1d382f0a71f6","resolution":{"observed_at":"2026-05-26T11:37:37.253527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:55d1be657d147be41060381073fae538b60d1154c3aee1cd267ce3092ee7d614","observation_id":"1d2bbd97-d671-4132-98c7-b617d66971a7","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:34:01.608887Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152","venue":null,"work_id":"d52d3151-6a24-42dc-b3a2-75958047958c","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:dd2da0418ca93b46fed8182a5d0ca04fd93fb808e4fe97529a4bb65dd12602f5","observation_id":"4722ece3-867a-4179-ad36-e03911eace4e","resolution":{"observed_at":"2026-05-26T11:37:37.281241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20573","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vq-va world: Towards high-quality visual question-visual answering","venue":null,"work_id":"cdaa65ea-c287-4442-8857-a88edb2ea217","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:a36e1b5b603e1fcb5c5e348b33797f7a1a6db22c12c7dc7e4c233409475dc8d0","observation_id":"db8c475d-c299-4cbd-8777-8a8342d33458","resolution":{"observed_at":"2026-05-11T18:41:10.193962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:2124cea215e8e1e18b30b933b4ada5b038c0a72b6fd255c778fa72166e163ee7","observation_id":"3395922e-dcd6-44ce-b10c-7201a42e719a","resolution":{"observed_at":"2026-05-11T18:41:10.158443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":"1f96ffad-723b-4104-a013-d85a3996daf5","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d27fb3933b949e15f90ef49d8a1f443e9a3c3903f1c6b52c50d5ae45035ddc1b","observation_id":"835d9f7c-2081-4d8e-8261-9ccc71bd7f2a","resolution":{"observed_at":"2026-05-26T11:37:37.312366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d791b194e0d62e8f7843094136c01346ea1f01655333a77662d5772d34dc983f","observation_id":"b5a41f77-f266-4959-815e-7a08135887f0","resolution":{"observed_at":"2026-05-11T19:43:03.755490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anyedit: Edit any knowledge encoded in language models","venue":null,"work_id":"09d28e85-39e0-4809-963e-1828759626d5","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:061c4a1ffd4ac67514fc6c4ec7934d9ab2736bb5d08dc8df68317f371618b162","observation_id":"82b1dd93-f2a6-43dd-bf4b-7decbdbfd8af","resolution":{"observed_at":"2026-05-26T11:37:37.259126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:57.989864Z","title":"yes\" or","venue":null,"work_id":"6816f785-b304-4b2f-9fcc-cb6f8f1ac10c","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d1c01a57f6f17de4558ebbb1f3130bddd703642546456319c011866303781898","observation_id":"6445a212-8b63-4809-8a5b-c1e80775daf9","resolution":{"observed_at":"2026-05-11T18:41:10.240465Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eq-vae: Equivariance regularized latent space for improved generative image modeling","venue":null,"work_id":"c8144c92-cdc0-4f1f-8c0d-c32c148651e1","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:1ecc721ac31c0d92a6a0f1ffe8e5d938755cbc684cb5b25baeec84271b208889","observation_id":"9cbdd6be-e091-44c7-be74-ad6263659532","resolution":{"observed_at":"2026-05-26T11:37:37.249165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nohumansrequired: Autonomous high-quality image editing triplet mining","venue":null,"work_id":"eeea2750-0651-4dc8-8a2a-17d8d7380032","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:c13f6d332dc2fe4a168a9911dbbebf1dd2a32f17a9b92fafccf7be20f792ea01","observation_id":"e1138c00-2eb0-4282-818d-b3b7af650329","resolution":{"observed_at":"2026-05-11T18:41:10.336229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.729325Z","title":null,"venue":null,"work_id":"869eebf2-3d18-4b82-94e9-73563a64db9d","year":1956},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:7371b33fde2c81276c519e70e1515c23ccc694490ad3b3353372f25ac115461b","observation_id":"6b577421-5d82-4740-a92e-a7b9aefadf41","resolution":{"observed_at":"2026-05-26T11:37:37.315049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:11ddab22e622d4261b323dfc3a6712440bf8dbab991f98dcdb7ae492ef34a1e5","observation_id":"dff5991a-b75a-49ce-a82f-60ffae2bc574","resolution":{"observed_at":"2026-05-11T18:41:10.413644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.237292Z","title":"Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers","venue":null,"work_id":"4ad471a0-3426-4e98-818c-cb238de280a9","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:54a33d7d94eb99b5c684dc27fa99feb59caa6e7044338214c6e41aa39b5b647c","observation_id":"4bbdc33e-89b1-425c-b4fb-26ad23fccd9d","resolution":{"observed_at":"2026-05-11T18:41:10.434289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought","venue":null,"work_id":"18aef692-8390-4216-9326-adaa1a82645f","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d392700a6201793fbef44468257b4e45dab17debc41ac2bd56baaa4175850770","observation_id":"af554a6c-01ac-4b7c-be23-96ac06311ceb","resolution":{"observed_at":"2026-05-26T11:37:37.324124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03498","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.074454Z","title":"Onecat: Decoder-only auto-regressive model for unified understanding and generation","venue":null,"work_id":"b201beef-0544-4d04-9644-65dfeacb78bd","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:0860649284724a290d8b5bfafb685f8e4f05c8f1b13c602b3ba5934783d4e077","observation_id":"6c8f061d-d5b0-4af2-8f57-cf1830348974","resolution":{"observed_at":"2026-05-11T18:41:10.310857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:36:03.210751Z","title":"Autoregressive image generation without vector quantization.Advances in Neural Information Processing Systems, 37:56424–56445","venue":null,"work_id":"458db6cf-9727-4af1-870a-3dbea61b38eb","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:feba1e66740fe4672c98fe2bada0bbc68c9f452fbc7a4413d19beaab30a93b10","observation_id":"d851a8fd-8365-4267-9b69-c12289c8e7a4","resolution":{"observed_at":"2026-05-26T11:37:37.278250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":"2411.04996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-07-04T11:59:50.940046Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","venue":"cs.CL","work_id":"82eb1f7e-d598-409b-9fec-8a7e82965d26","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:17bb25f14312842bef8fe19e5f98d333d6346e0c7b1eb54a257f55da5caf1e0d","observation_id":"68ca3073-0111-4815-808a-da44b132fe78","resolution":{"observed_at":"2026-05-18T02:48:45.158778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":"2505.05472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-07-10T07:36:57.986858Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","venue":"cs.CV","work_id":"f2badd0e-c06a-45f9-9d9e-7ceda62176b8","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:c41f4d263d96c484df37bbbcbdbe1a7100e7281c66eb9b197c1ca5adac5918a8","observation_id":"1ce28159-7216-4d13-b655-64a974fce6ee","resolution":{"observed_at":"2026-05-17T07:24:05.047503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:ac92eb6b02544a9db5d752efc7b008847a56c5355e30796266f1f28456811805","observation_id":"8af7907f-c4a4-40a8-a6bf-dac4afd7dcad","resolution":{"observed_at":"2026-05-12T17:34:27.304691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.690179Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"115823a2-8918-4227-8872-3d0a36ff07a9","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:10204c6eaebf115310307f12bdfba42647bdf903787c7bfd522cc2fdb9dfeaed","observation_id":"9f026fb8-6fe4-44af-8459-a06fc3ba381d","resolution":{"observed_at":"2026-05-26T11:37:37.236742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:5cade7624e948920c284484dfb2ec84c9b504c1423830d5d4fbfe2fb831ec4bf","observation_id":"fb46326a-f9fc-45bf-a142-7a6622433d1b","resolution":{"observed_at":"2026-05-11T18:41:10.232334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":"2ad6bc55-df62-45b4-871e-9ba0c06c6e01","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:183f9bbcee9f29bfea892160eb9bf3c8ace8c95d5e74785c68126d06578a5dc2","observation_id":"b29695d1-52a0-4c5f-a2fd-44d032af015e","resolution":{"observed_at":"2026-05-26T11:37:37.262177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2503.07265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-07-04T13:19:50.710913Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","venue":"cs.CV","work_id":"604c1ae0-368d-49bf-8117-d688ac59f305","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:f5ab2892560acabb6e465b1d783b11b64680bd696e3148f0f88aa7a9799c6f5d","observation_id":"56ff0cf1-1875-4963-a979-70fe6d2aa5f9","resolution":{"observed_at":"2026-05-15T16:24:27.819650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:f90216784a73c5c3f8b8f298724465afaf8d0ab5b274faf2b26fb4a783bb1b14","observation_id":"492d389a-2974-4944-a700-9c47885e1172","resolution":{"observed_at":"2026-05-14T22:49:23.311693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.881505Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"a7d9a278-99a4-4909-8368-42b21df3c6fb","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:3fcaf7cab5e09a23887048246e64ff75c439408e15130f43fe5ae4da1ea7072b","observation_id":"87d28391-0fc1-40c1-b029-ab73b9eaf232","resolution":{"observed_at":"2026-05-26T11:37:37.233524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"c9e1cf3d-6f3b-4e17-a1d3-30e1d2da1688","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:a8acbb1c448fee847b8422bca3fd812724186d201fce79280710128fe8bfde75","observation_id":"14407db3-da7a-4ce4-a730-124670d26dc8","resolution":{"observed_at":"2026-05-26T11:37:37.327112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:52.409989Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"5427867b-47ba-4d43-a415-2912684a2d41","year":2022},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:2c0c31a8c536e5716275d76bf59607a096339f0b979d4fdb01b64588bf6b3e34","observation_id":"bde48f28-98ed-4f07-8e5f-03daad8248ee","resolution":{"observed_at":"2026-05-26T11:37:37.240403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294","venue":null,"work_id":"155138fa-d7d1-4b0e-adbd-f47cdcbe7d19","year":2022},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:518e8b7c777b97c5c6304145ee251be164c31d6d05e3fdae02e9046d671ce0b7","observation_id":"2adbbfde-a18c-4541-a393-829bbbfa22a8","resolution":{"observed_at":"2026-05-26T11:37:37.306417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.11749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:39:42.145217Z","title":"SVG- T2I: Scaling up text-to-image latent diffusion model without variational autoencoder","venue":null,"work_id":"4940495c-3a24-4a3a-bef1-ca77f88c7b8e","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:70ae82960f78c8092e9a1758aee3e3dce72ce41cd7c8169b23f60381e266626e","observation_id":"59687e1d-c7e5-448e-aaab-aa817c4483af","resolution":{"observed_at":"2026-05-11T18:41:10.409875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.398527Z","title":"Latent diffusion model without variational autoencoder","venue":null,"work_id":"ab5fd0eb-3300-410d-a690-19e04b2a7770","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:cf9b7d279201e2f534b86595c57f452ed13b8dcec3179aef218c591634bbb1ef","observation_id":"3e4e0ffd-964b-45d5-98c1-968bc43bf482","resolution":{"observed_at":"2026-05-11T18:41:10.373192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding.Advances in neural information processing systems, 36:49659–49678","venue":null,"work_id":"1063c081-f3a3-4c6f-a9e0-aeeb6906d4e3","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:e8decdcf1197a94acf546410f3d10363295254c01a395e617c4062544da74444","observation_id":"463a70e8-fdc5-489d-9f5f-e494804be603","resolution":{"observed_at":"2026-05-26T11:37:37.271897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.832092Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"ad31cb81-ea39-4768-9ec5-097ebb13041b","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:14f38b18188bb5cc1ce8cfd17e4a0c7abb6b06efbb4a5b7f56aa5533adb48424","observation_id":"8f089a44-edc8-48fc-9eea-36595f83fefa","resolution":{"observed_at":"2026-05-26T11:37:37.246165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the deep fusion of large language models and diffusion transformers for text-to-image synthesis","venue":null,"work_id":"3fa85a57-eac8-4c79-8e24-f63e32204e30","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:0434a2268b84e57f9af2770a00795c03132d946d2bca90f27f5168e40e74e2d4","observation_id":"57bc9132-c8bc-4d6a-b52b-d6bed248d7ab","resolution":{"observed_at":"2026-05-26T11:37:37.321254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-10T07:36:58.000502Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:e80e10170784b61f8505f3530f6ea70b7e6690f082fe569b89ca2805d6360527","observation_id":"c11edd16-8839-4ce7-89d2-5ff81514a8c4","resolution":{"observed_at":"2026-05-11T18:41:10.383062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10711","last_updated":"2025-08-18T15:55:23Z","snapshot_observed_at":"2026-07-06T22:13:00.029560Z","submitted_at":"2025-08-14T14:54:22Z","title":"NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale","version":2},"cited_work":{"arxiv_id":"2508.10711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10711","snapshot_observed_at":"2026-07-04T00:39:17.418338Z","title":"Nextstep-1: Toward autoregressive image generation with continuous tokens at scale","venue":null,"work_id":"729ea32c-8dd9-4636-a635-97e1ebb2dcd7","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2508.10711","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:8b6d5c56795da17d028e007a1fa043a420fb77b91a4e577522ce93cd0a8275d9","observation_id":"5cce2100-9b19-4717-9a7d-20fa9edbd5f3","resolution":{"observed_at":"2026-05-11T18:41:10.111591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2412.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-07-04T10:09:44.713840Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","venue":"cs.CV","work_id":"cc1e25c3-90c2-4e87-9268-d28d48c546a1","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:00804fb23dbd54b19f20ebc57e44bd618347ea05ce7eb44b85896c616fc6d8e0","observation_id":"c47e8962-5214-41ae-9763-ef8ba6967329","resolution":{"observed_at":"2026-05-17T07:51:13.882527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:43:53.808402Z","title":"Scaling text-to-image diffusion transformers with representation autoencoders","venue":null,"work_id":"f6b79552-4f2d-4b7a-9874-6ef1938b8a54","year":2026},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:4f0903ac7cce919491838b3455c69339f141e390807f0d937692e430ae4f82f8","observation_id":"a1b3da3c-d7d8-4e20-8b2c-98a41ef3bcab","resolution":{"observed_at":"2026-05-11T18:41:10.199620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:35743e392d4d6ee30c3102cbd1431f6fdfd67d630559a8e620d3c584c7a63f52","observation_id":"76fc4755-77f5-45b3-840c-3c16c7a48942","resolution":{"observed_at":"2026-05-11T18:41:10.117243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:cf94437a0e08c615f7de0726292ec293b49cf99f4bf5a9382fb135469dd290f7","observation_id":"6daf6267-1aa6-4fa7-9662-65bfa5761ca7","resolution":{"observed_at":"2026-05-11T18:41:10.123584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":"d9671585-6857-4b9c-8d3c-e28094b60660","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:c6fc04320570d31b5de54e53e2b24eaee370ef3cedd3b701977869358459b38e","observation_id":"4a52d568-e384-4347-a93f-0a26a61eafd5","resolution":{"observed_at":"2026-05-26T11:37:37.318130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:d72ac0aae6d5ad05d62c4218ef99b86155afcbe2c51056480189def1aedee69a","observation_id":"3a9ca61c-c587-4eac-b716-b84075c2b862","resolution":{"observed_at":"2026-05-11T18:41:10.107136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-10T06:36:52.573462Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:1d701c6385b418fa549bba43ede7d6e61558fb9466692d62ded407cfd3e3d856","observation_id":"0c810bcd-36dd-4c19-acec-0f22177b4540","resolution":{"observed_at":"2026-05-11T18:41:10.260713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T16:17:08.866109Z","title":"Unigenbench++: A unified semantic evaluation benchmark for text-to-image generation","venue":null,"work_id":"78a1f043-fba5-436c-8931-3398320d9ba0","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:1da3f0978237ec4a339d9626ba52e82852cc32dbc80d5b72fe3a881976f903ea","observation_id":"dee93dbd-b567-4bab-9bdd-54cfba94765e","resolution":{"observed_at":"2026-05-11T18:41:10.421059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:31:35.837858Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":"40c8f338-3b31-427c-81e6-5ec1a33726bc","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:09d4577dff32824ebaae1fcf1e3e6380a8f2732104ac0b16a344282e5459bdc8","observation_id":"6ea1ef48-e134-4a2b-852f-f60129561aa1","resolution":{"observed_at":"2026-05-26T11:37:37.268462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:57c892f31b0d0f362d5028b7c938bc050755777f64c80e9e09930216ee085ae0","observation_id":"eff83de5-2056-4c0d-ad4f-227e41458c57","resolution":{"observed_at":"2026-05-11T18:41:10.245483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:38:19.365035Z","title":"Visual generation unlocks human-like reasoning through multimodal world models","venue":null,"work_id":"c93eb550-1241-4a65-ad81-6d0adbd24153","year":2026},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:f8edb78466aeda596e0d3798cd68348bbbcec28766889ba0c87cda469796f1e1","observation_id":"467a9fa6-95b4-4b21-9f6e-c43f35fdd2ca","resolution":{"observed_at":"2026-05-11T18:41:10.363848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liquid: Language models are scalable and unified multi-modal generators","venue":null,"work_id":"a924d646-8f8e-4a7b-afe5-fbd846f61ff3","year":2026},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:c22f8d403855226c622a4b52ac7726cb6ba39db7c27c67c48b36500ad9e80400","observation_id":"07e9c6af-4246-4a18-bc7d-2f2ffbb24926","resolution":{"observed_at":"2026-05-26T11:37:37.292143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:bfa5f9d5929cdc4728085f03092735f5357a1bc2a7b30545302244aa29a530d1","observation_id":"333d691b-d2e0-4bd4-9cd5-d6ba23abcb42","resolution":{"observed_at":"2026-05-11T18:41:10.358702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:b751e7a156fb48b8dde375291834d0a943bd2de59405f60b88110c48d2975694","observation_id":"56957309-bc53-47df-b6f0-59e2b949f452","resolution":{"observed_at":"2026-05-16T00:26:21.484895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kris-bench: Benchmarking next-level intelligent image editing models","venue":null,"work_id":"d5610dd0-c49a-4dfa-b960-784bb0e16862","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:fdb76924efcb045efb2a7ced4a4556d54dc3b77d18301ae8206f6baf6cd2455e","observation_id":"7ce7be28-b763-4aa1-bc5c-c7508364adf8","resolution":{"observed_at":"2026-05-26T11:37:37.288823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.883191Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"9bd3f0a2-4735-491c-a256-4b77e6855701","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:6406e3bc0530055486131b0094fc54c2efa5868117c07c2b3c243d8ca7806799","observation_id":"7e57cca6-0d17-4dc9-8172-6ed1e736f48e","resolution":{"observed_at":"2026-05-26T11:37:37.256416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2509.07295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-07-02T08:16:48.433525Z","title":"\"Your output must be a single JSON object.\\n\\n","venue":"cs.CV","work_id":"49fe4943-80e8-4f4e-b253-05cf57244f19","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:b9535888804ee9d3cf17a2e50e4aa76e7bb6baafe7edd713cb697313b3847161","observation_id":"7af36f02-f6a2-47fd-a249-62fed1bf038c","resolution":{"observed_at":"2026-06-26T02:15:36.738364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"ed2f2a92-cf18-4496-bb6d-d24092b31cb3","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:1c8ab25c4ab4332a00b320e3a9f597e86349b45df678f2e43c153456d52937ff","observation_id":"11931339-98f2-4a2f-81ed-6975f2a12951","resolution":{"observed_at":"2026-05-26T11:37:37.295419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-07-10T13:37:06.829021Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:5e2a4532b910e56fce410703e855f0a24bbf8f1723fbe58d48a09a1f3d7f92eb","observation_id":"f198310f-7118-497e-988c-b0a584cf4aa8","resolution":{"observed_at":"2026-05-12T18:51:16.424084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:7858dfa4482db9673291eb9f3aa868a34ba75e9e3b00996f64133899efbe5d97","observation_id":"88694500-2b08-4d55-9292-8d2b4b8d8545","resolution":{"observed_at":"2026-05-11T18:41:10.325345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imgedit: A unified image editing dataset and benchmark","venue":null,"work_id":"73a8f889-7262-438e-a1c8-fd757533cd20","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:18285bb6829584c89fd9018df3cc3365aca04ef03ece77b7b0a7e86ba5afb19f","observation_id":"d49e99d1-c05f-4a1d-bfec-ce135a40c3be","resolution":{"observed_at":"2026-05-26T11:37:37.265623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":"c74cfdb3-2230-4343-b619-fbc7c95c8efb","year":null},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:c9552c7a723609e7801c3e379107bde1ba492162745adab9badbba3e4428c3d8","observation_id":"2814af93-2e61-4341-be89-ab3f56295e66","resolution":{"observed_at":"2026-05-26T11:37:37.285009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.736153Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449","venue":null,"work_id":"f188cfa5-c2f6-46ca-8ccb-13112b85f663","year":2023},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:e0e31fa663bb987a159d6453554c2b455bae3c8ea2c033e91fcd29ead817b501","observation_id":"edd8b983-aa47-4415-a898-928e5a832812","resolution":{"observed_at":"2026-05-26T11:37:37.275381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:e208901c010d13a74c45e3619ef6fa10b7a1bca4166ecb63f6ea1bebf860eccd","observation_id":"ea7ae9cb-6703-4f27-946a-d11d66c078b0","resolution":{"observed_at":"2026-05-11T22:34:18.071377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":39,"verified_fuzzy":29},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 1 inbound Pith citation observation for arXiv:2605.05781."}