{"as_of":"2026-08-19T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53a2664e56f7ae0b4ed1d43c03d0b6ca5d847eb3fd720be49de9fc434d9f8af2","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:35:00.082460Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08676/citation-record","integrity":"/paper/2608.08676/integrity","json":"/paper/2608.08676/citation-record.json","paper":"/paper/2608.08676"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-14T04:34:59.973147Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.973147Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:cefc92d78e730c7735722607d981ec3b61b44a77e69f191d07cbd369d8d3b6f5","observation_id":"e621f310-3270-469f-89f5-129f7d825fbf","resolution":{"observed_at":"2026-08-14T04:34:59.973147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-14T04:34:59.985870Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.985870Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:66b7f332ecf6a47e362a1d1ebf1a4d239748de784e3dda5da45a0702c8b0e683","observation_id":"d72c16c2-eb37-42a8-87f1-73260244fc5b","resolution":{"observed_at":"2026-08-14T04:34:59.985870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-14T04:34:59.994218Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.994218Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:85f0050b0d769336f2d2429740c9ff0e70c21565ae65a3a33ae03b75e4ff423f","observation_id":"bd069a96-b81a-43a6-8f97-f25542075de6","resolution":{"observed_at":"2026-08-14T04:34:59.994218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-14T04:35:00.002489Z","title":"Zongjian Li, Zheyuan Liu, Qihui Zhang, Bin Lin, Feize Wu, Shenghai Yuan, Zhiyuan Yan, Yang Ye, Wangbo Yu, Yuwei Niu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.002489Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:c0cae575638fa77b3e29b39542c139e1b4e5798cac01ec93d8b8e6ecb50542c1","observation_id":"53a6db67-010e-423c-9a81-3eb2e55ddbf6","resolution":{"observed_at":"2026-08-14T04:35:00.002489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-14T04:35:00.006708Z","title":"Uniworld-v1: High-resolution semantic encoders for unified visual understanding and genera- tion.arXiv preprint arXiv:2506.03147, 2025a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.006708Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:ba9bab9b94297408d16fd9b309a7dd8c5b4f4552c72e891152bddce997f2fd47","observation_id":"4b5ffe82-787e-4fe4-a740-f8db8b3152b2","resolution":{"observed_at":"2026-08-14T04:35:00.006708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12500","snapshot_observed_at":"2026-08-14T04:35:00.014679Z","title":"Sensenova-u1: Unifying multimodal understanding and generation with neo-unify architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.014679Z"},"links":{"cited_paper":"/paper/2605.12500","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:7e8645f7aae15932629b77ea0b7302b7152ca2743222472909b080e342f1551a","observation_id":"8496c9a4-e396-40e2-aeac-5f7f016a4c8c","resolution":{"observed_at":"2026-08-14T04:35:00.014679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18324","last_updated":"2026-05-18T12:42:34Z","snapshot_observed_at":"2026-08-16T19:43:13.798863Z","submitted_at":"2026-05-18T12:42:34Z","title":"Improved Baselines with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18324","snapshot_observed_at":"2026-08-14T04:35:00.018811Z","title":"Improved baselines with representation autoencoders.arXiv preprint arXiv:2605.18324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.018811Z"},"links":{"cited_paper":"/paper/2605.18324","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:916b263440c283f92dac56fdf5d11b8bcfa7725b992b276bf50acece1becc8a6","observation_id":"add6a57d-7e87-4fbf-9cd8-d308a1d22fa1","resolution":{"observed_at":"2026-08-14T04:35:00.018811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-14T04:35:00.022696Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.022696Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:702ec41a8eff064852fb29a37553fa52b57e4effd74a444d474a13e963977913","observation_id":"381f21c1-0d50-4c37-9cca-de69f1eea056","resolution":{"observed_at":"2026-08-14T04:35:00.022696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:00.026740Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing.arXiv preprint arXiv:2507.23278,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.026740Z"},"links":{"citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:56a430f7b0a39c8e6da41a630d289bfb5f97bcb66e082c03121266f9bba66322","observation_id":"2ec9e8b9-182e-4218-a2d5-89e091b772c0","resolution":{"observed_at":"2026-08-14T04:35:00.026740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-08-16T15:04:17.022785Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-14T04:35:00.031628Z","title":"Longcat-image technical report.arXiv preprint arXiv:2512.07584,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.031628Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:a75bab6da7ec0447f445777fa1aa327ae97b452e1e931dffa5bf6f05567158a5","observation_id":"aa365a61-c9ca-4868-b640-c32eab5a5bbc","resolution":{"observed_at":"2026-08-14T04:35:00.031628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:00.035768Z","title":"Internvl-u: Democratizing unified multimodal models for understanding, reason- ing, generation and editing.arXiv preprint arXiv:2603.09877,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.035768Z"},"links":{"citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:e97bd85e8528bb6295861f5cb515dbe0bfd56c7b7ea75ab014731ca1da5e4434","observation_id":"456da09c-2e1b-470d-bc74-8214fa49e118","resolution":{"observed_at":"2026-08-14T04:35:00.035768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-14T04:35:00.039219Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.039219Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:1970438621e8b96392f6bdf4602cd05d4164dabe72ae1d8c215df5dd7b68da6a","observation_id":"dbbbce84-ff93-4d0f-882d-d088928faa1e","resolution":{"observed_at":"2026-08-14T04:35:00.039219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-14T04:35:00.042931Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.042931Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:97c562f94ca28c074b0e1e4a92c6f6e56078f8dbda927918ff7bfe06bf6acb02","observation_id":"7a48512a-b97c-49d7-bdb8-14fd04e6e34a","resolution":{"observed_at":"2026-08-14T04:35:00.042931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-14T04:35:00.046640Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.046640Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:60e5fdc7b19dedb8e980d7d3d36b2356c06af51629e9a8942a9cb6571d5241fd","observation_id":"23ad3e4c-6cc5-435c-ad12-8a2e9c55ece3","resolution":{"observed_at":"2026-08-14T04:35:00.046640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-14T04:35:00.050798Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.050798Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:a9f812769d845200c1eb876dfbb3d5934c9a369c61c267abd6878a3fcf219671","observation_id":"3039595b-5f4e-4713-b413-1aba85e15f3c","resolution":{"observed_at":"2026-08-14T04:35:00.050798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-14T04:35:00.054543Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.054543Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:73d5f5fb2d049613d92d0cb4735386eba8c3f1a6a9ee2d17faee0e0f1c54c837","observation_id":"5cae6dc2-f84e-42ad-ac26-b0dcec11157e","resolution":{"observed_at":"2026-08-14T04:35:00.054543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:00.576237Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"fde199c7-4279-4f77-8843-2bec12ed9a56","year":2025},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.058497Z"},"links":{"citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:de4df3ce94ebdc0a81fd7b410671ea697ae2ed21d8e460b8a11ec11a6e2d4f8f","observation_id":"67e3f80d-8d05-48eb-bc73-2e5ef6b31a02","resolution":{"observed_at":"2026-08-14T04:35:00.580074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-14T04:35:00.062047Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.062047Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:6fb046db001f8396d5bc325097e88bd6a44816993cbeb71f1cee14e4d4970122","observation_id":"8be55882-6aff-4a27-94bc-0c52087fc11d","resolution":{"observed_at":"2026-08-14T04:35:00.062047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:00.065208Z","title":"Towards scalable pre-training of visual tokenizers for generation.arXiv preprint arXiv:2512.13687, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.065208Z"},"links":{"citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:88f486778205c874d2b60115578b88740ec5ed8b46fdff6f14af409fe57e53ef","observation_id":"0043ccc4-1615-4a77-b51f-456fe860ed6c","resolution":{"observed_at":"2026-08-14T04:35:00.065208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-14T04:35:00.068270Z","title":"Rep- resentation alignment for generation: Training diffusion transformers is easier than you think.arXiv preprint arXiv:2410.06940,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.068270Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:8d931dc05a8f9ff9844dc670fe9db498202b2057b22acbcc188845e63efb87b7","observation_id":"d49702a4-d7c7-4551-ae81-78e028b02717","resolution":{"observed_at":"2026-08-14T04:35:00.068270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:00.071818Z","title":"Uniflow: A unified pixel flow tokenizer for visual understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.071818Z"},"links":{"citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:ce7912a5805c646f954ab0cda6bdbb8825e82dec62c5d413b6914842cc80fd6c","observation_id":"ec95d48c-a851-4217-b034-c6b8e5d509e4","resolution":{"observed_at":"2026-08-14T04:35:00.071818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-16T14:57:26.851711Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05178","snapshot_observed_at":"2026-08-14T04:35:00.075374Z","title":"Qlip: Text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.075374Z"},"links":{"cited_paper":"/paper/2502.05178","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:ae1b2cc0de9fc62623134fcf1547ffb4f8a8807d15672a2635e7ba4d1d3b7039","observation_id":"d10f0e56-a29e-428a-8be7-940bff895fdf","resolution":{"observed_at":"2026-08-14T04:35:00.075374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-14T04:35:00.079028Z","title":"Diffusion transformers with representation autoen- coders.arXiv preprint arXiv:2510.11690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.079028Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:6b2b0b1abbe7bc20488eb17d50f54957d27a85f9111cb371716d38edad451e07","observation_id":"5eb9ceb8-263f-4320-8ce5-5b32c9aaacfe","resolution":{"observed_at":"2026-08-14T04:35:00.079028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:35:00.562592Z","title":"All variants share the same encoder, decoder, training schedule, and sampling setting, isolating the effect of the semantic–reconstruction balance in the flow-matching objective","venue":null,"work_id":"fd56810f-21e8-41ae-a35e-2af23ca7e3c5","year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.082460Z"},"links":{"citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:32f79c74c00b8afc3f8dfd663b84245b4d55d31bf4348a905678691707872a7b","observation_id":"5f755917-476c-4da8-8b5f-18dd6f89baac","resolution":{"observed_at":"2026-08-14T04:35:00.568663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-16T19:31:18.122184Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07977","snapshot_observed_at":"2026-08-14T04:34:59.981913Z","title":"Oneig-bench: Omni-dimensional nuanced evaluation for image generation.arXiv preprint arXiv:2506.07977,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.981913Z"},"links":{"cited_paper":"/paper/2506.07977","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:9910c3203dad2c5706075610346efb33590c3d73c2179b6fa48437b54ee646b0","observation_id":"5cf963ea-b8d0-4ac6-86bd-d6810d7a49e3","resolution":{"observed_at":"2026-08-14T04:34:59.981913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-14T04:34:59.998626Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.998626Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:002863180e8238470aabcb4d1e4760d578b0f979bc7c62e2fa0ca7adb11801cd","observation_id":"487af554-5389-45fc-8fb4-da075f47c1b3","resolution":{"observed_at":"2026-08-14T04:34:59.998626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-14T04:34:59.990040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.990040Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:cb5d72cea149bf2454ef2327c0c31b5b4b5d2a9b72f089807c8bf6331648c682","observation_id":"d8a3a56c-eb6e-4729-a48a-1510864321de","resolution":{"observed_at":"2026-08-14T04:34:59.990040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-16T18:20:01.123890Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-14T04:34:59.977929Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion trans- former.arXiv preprint arXiv:2511.22699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.977929Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:9558fba270f0fc348be231583c3c10876760ed630d8e47000dfed4630d0a40d9","observation_id":"efdd9383-919a-4126-aadf-0fd5219db74e","resolution":{"observed_at":"2026-08-14T04:34:59.977929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-14T04:35:00.010792Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.010792Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:54dc7d0b97ec37d7a745a016fcdac123ea84d558a52a2bf36fadbe66347592b8","observation_id":"a0e391c7-a656-417e-a3c7-b90697520443","resolution":{"observed_at":"2026-08-14T04:35:00.010792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T23:13:29.086812Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2608.08676."}