{"as_of":"2026-08-07T04:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbd1d8aa46598da648fd46b3c760a7012a005d337af7fd97c2be12414d97f07f","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:41:13.422776Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:55:28.184085Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T09:28:39.568466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"cited_work":{"arxiv_id":"2508.08098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.08098, 2025","venue":null,"work_id":"c28a98ed-9d3a-4c48-a78f-440cd6432d2a","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.08098","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:58126ffa3d4501297977008847b07f3ae2abc4b37322e290f9f592d24937607f","observation_id":"b0403c62-fbe1-4434-ad2a-a777f90716fa","resolution":{"observed_at":"2026-05-10T09:28:39.569797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08098","snapshot_observed_at":"2026-08-06T11:55:28.184085Z","title":"Tbac-uniimage: Unified understanding and generation by ladder-side diffusion tuning.arXiv preprint arXiv:2508.08098, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-07T03:25:21.482309Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.184085Z"},"links":{"cited_paper":"/paper/2508.08098","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:7f1bd69698a4432516f570fe3db99e84cb17b7c52f6f9b167f690358684425e5","observation_id":"bb47a833-caf3-474e-b9d7-fcef7fba09cf","resolution":{"observed_at":"2026-08-06T11:55:28.184085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.08098/citation-record","integrity":"/paper/2508.08098/integrity","json":"/paper/2508.08098/citation-record.json","paper":"/paper/2508.08098"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T21:41:11.600894Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:11.600894Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:73b5386c63c526e78fca3f006210c7ddd7f54d6b45d2cab5ab84e3a95c4dac78","observation_id":"6f8cb8ae-cb30-4ebf-b713-987a08f3c5b9","resolution":{"observed_at":"2026-08-05T21:41:11.600894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-05T21:41:11.885994Z","title":"Making llama see and draw with seed tokenizer.arXiv preprint arXiv:2310.01218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:11.885994Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:7f5cadf05ee6df1f6bc7a9f8dcf1c3794e9809ece2e9170e43d887b24bbc537f","observation_id":"a97b6fa1-1915-4ead-9d96-76dff61ce866","resolution":{"observed_at":"2026-08-05T21:41:11.885994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-06T23:12:29.776991Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-08-05T21:41:11.990825Z","title":"Vision as a dialect: Unifying visual understanding and generation via text-aligned represen- tations.arXiv preprint arXiv:2506.18898, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:11.990825Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:d309e11c855370d847ae5163d97198d604871fa1b5f160977d426b353c165b7d","observation_id":"c3a0dc13-a72d-4be2-8da8-a5714a44191b","resolution":{"observed_at":"2026-08-05T21:41:11.990825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T21:41:12.105945Z","title":"Playground v2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.105945Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:0d97d7610facdf3c8e99ea52e91a873c4be98662910c93c59a8e38b20190c4c5","observation_id":"32466709-35a8-4f22-98a6-1d41ebf783c8","resolution":{"observed_at":"2026-08-05T21:41:12.105945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-05T21:41:12.175559Z","title":"Mogao: An omni foundation model for interleaved multi-modal generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.175559Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:16ff7aec5d48f2ceba866a9f733ed4c735093aa80110e13a7de9ebb8cd31a71a","observation_id":"f53779e2-9a4c-4a37-8299-4b7271e9de62","resolution":{"observed_at":"2026-08-05T21:41:12.175559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-05T21:41:12.247162Z","title":"Uniworld-v1: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.247162Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:7a540a9e488db95f6a20833b3c9d4dc41b7550f749b4bc957cf2793d54be7fba","observation_id":"85c2d62f-3914-42fe-bfe7-20d1216451ec","resolution":{"observed_at":"2026-08-05T21:41:12.247162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T21:41:12.353287Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.353287Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:7faec3486d3ec206cd8c6969e706b6884f928c84e8ca0265f734e35c4a5c8a06","observation_id":"7974b81b-51e1-473f-9dad-6a87e50faf8f","resolution":{"observed_at":"2026-08-05T21:41:12.353287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-05T21:41:12.444125Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.444125Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:40710322396c0695734241a21edb3bef18eee8779c88347b43eeabafbe2ea447","observation_id":"4f18c4c7-d1db-4767-ae17-e0052e1bd904","resolution":{"observed_at":"2026-08-05T21:41:12.444125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-05T21:41:12.580765Z","title":"Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.580765Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:ee8039c7071bbd7caaf15410e08d4bce44967d6c7801d6b6b911139162aa27cb","observation_id":"14f94d1b-c12e-40c2-b03a-d7e7d8f82c54","resolution":{"observed_at":"2026-08-05T21:41:12.580765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-05T11:15:36.366240Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-05T21:41:12.688519Z","title":"Lumina-image 2.0: A unified and efficient image generative framework.arXiv preprint arXiv:2503.21758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.688519Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:de66bc4eca94cb769b07d066d0c60eca8e5a97118636ad93c207cee437600eb6","observation_id":"1334e378-2710-40c6-98bb-fc525c8f27d9","resolution":{"observed_at":"2026-08-05T21:41:12.688519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-05T21:41:12.843670Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.843670Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:bef6493d505ae9d4f7766046cee6f6e1a9220065c1608814347a3513a8fd0626","observation_id":"cda62742-b7b0-4ab0-9d9a-f1283ad0f5f3","resolution":{"observed_at":"2026-08-05T21:41:12.843670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-07-06T21:09:55.394184Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-05T21:41:13.050943Z","title":"Simplear: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl.arXiv preprint arXiv:2504.11455, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:13.050943Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:b597af70610df0a76e8194d60ce692e6f63c02d48edff247ec38b03abed6facc","observation_id":"869b1880-3202-47d3-a1cd-a11f74489187","resolution":{"observed_at":"2026-08-05T21:41:13.050943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-06T13:05:39.141544Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-05T21:41:13.116725Z","title":"Gpt- image-edit-1.5 m: A million-scale, gpt-generated image dataset.arXiv preprint arXiv:2507.21033, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:13.116725Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:bffb05c1ea9617601bb23b29cd0de7aad7e2d5bcf2480944ac17cf3c4a29161d","observation_id":"52408d33-734c-434f-824d-073db230f35b","resolution":{"observed_at":"2026-08-05T21:41:13.116725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T21:41:13.188247Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:13.188247Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:68967b801a6c5680213da9c2c5221358ce9388a030e25aa053ffcf553355a494","observation_id":"dc75e2b7-6b87-4825-b2e4-660c295d5225","resolution":{"observed_at":"2026-08-05T21:41:13.188247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-05T21:41:13.254621Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:13.254621Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:5cb1521062b1dfad3f885354f24acc20afddc82724354305081bb08702cff58c","observation_id":"76a97188-9798-4cc7-9527-a629ae9c39c8","resolution":{"observed_at":"2026-08-05T21:41:13.254621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-05T21:41:13.320472Z","title":"Imgedit: A unified image editing dataset and benchmark.arXiv preprint arXiv:2505.20275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:13.320472Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:ca87d3fc4e4c179a32f66b106fb074db652b5ca1ac7e05effdca9e878bc056a2","observation_id":"1c34f52d-a5ce-4c03-a79b-fe6042c9d4d5","resolution":{"observed_at":"2026-08-05T21:41:13.320472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-05T21:41:13.422776Z","title":"In-context edit: Enabling instructional image editing with in-context generation in large scale diffusion transformer.arXiv preprint arXiv:2504.20690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:13.422776Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:6275cef4b7051e8982079883824b0707c8734b58f4493358f9ea61b5e7969bcb","observation_id":"5b300978-3ee3-4c5e-9716-016c8938213e","resolution":{"observed_at":"2026-08-05T21:41:13.422776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-05T21:41:12.979485Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:12.979485Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:d2ccfe9344890bc9b0e4f085a396d24a5c8276c435153495b57b00bac3798a25","observation_id":"bfed8452-60bd-4678-b1b9-31361fd4d1fc","resolution":{"observed_at":"2026-08-05T21:41:12.979485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-05T21:41:11.649030Z","title":"Hidream-i1: A high-efficient image generative foundation model with sparse diffusion transformer.arXiv preprint arXiv:2505.22705,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:11.649030Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:bf9481a544d5880b8b4d034f3b52aa70190c4d79ec4627710265d9e41c18aa98","observation_id":"07da2973-9505-4eac-af96-364d5294dd10","resolution":{"observed_at":"2026-08-05T21:41:11.649030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-05T21:41:11.835200Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:11.835200Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:3e80c290999798b61e4346c628f44f7d4252698a58abf15b08dcecad0ae6be80","observation_id":"ad6ac12e-c645-4966-a728-f49de3a4e352","resolution":{"observed_at":"2026-08-05T21:41:11.835200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-05T21:41:11.742282Z","title":"Blip3-o: A family of fully open unified multimodal models- architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:41:11.742282Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2508.08098"},"observation_digest":"sha256:219d4566cf8a46bd8b97dc3d9864fafc8a60280aaed3abf1cf940a7a045a1470","observation_id":"b203ce63-b2b4-46c6-86eb-32c1b3bb792e","resolution":{"observed_at":"2026-08-05T21:41:11.742282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2508.08098."}