{"as_of":"2026-08-09T13:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bf32edb5ecb42becb6ea321cbc2c9fa4c7747e59d15b48bec407d556b72ee40","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:18.590800Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:37:16.161813Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.237442Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:7aa1c69ee0ee7adde3899e301db2bfb8bda50ef4284560dbedbd0acb6a1f5731","observation_id":"6b93d0b8-5e55-41ec-8c49-81e8ff292d4f","resolution":{"observed_at":"2026-05-15T16:24:27.498867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-06T04:37:16.161813Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03320","last_updated":"2025-08-05T10:59:01Z","snapshot_observed_at":"2026-08-09T00:35:31.197661Z","submitted_at":"2025-08-05T10:59:01Z","title":"Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:37:16.161813Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2508.03320"},"observation_digest":"sha256:1a72ae63e4ce74113429e75bfec29c534de23b684127032a7ef295a25755364a","observation_id":"2440898c-8e79-4572-8e74-09e812db5517","resolution":{"observed_at":"2026-08-06T04:37:16.161813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2509.01986","last_updated":"2026-04-08T07:45:08Z","snapshot_observed_at":"2026-07-06T22:22:03.439592Z","submitted_at":"2025-09-02T06:06:52Z","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T20:04:00.773443Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2509.01986"},"observation_digest":"sha256:3dbc80525bf0c5a98c2f603839ded9fe7806632ef2aa088d663d2b1b3d0e819a","observation_id":"e6e71b26-80af-437d-8272-7790425ea856","resolution":{"observed_at":"2026-05-18T20:06:50.057017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-04T22:36:08.243005Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.243005Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:a0ba4b6e2ade8f86c2523b2e2ce633731a9b81e838922685b1de863a65de22ca","observation_id":"2dd93c32-9928-4ffc-a9d7-b37b27e91874","resolution":{"observed_at":"2026-08-04T22:36:08.243005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-03T07:03:14.264753Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T07:03:14.264753Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2601.21406"},"observation_digest":"sha256:7c0e6ec7f7cc66864cce5b3225a1341b8a89b14075cad32df24afec283426b59","observation_id":"1120e7a6-8acc-4195-9c58-944c4448e8fa","resolution":{"observed_at":"2026-08-03T07:03:14.264753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-02T23:52:41.711567Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:3a2da6456fea35149f1ed37fa6cf0ed6fac74c61862def21746a71028e9e871d","observation_id":"21aa7041-6a31-430c-b826-375928f15e2f","resolution":{"observed_at":"2026-05-16T08:10:45.393690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:52015465d1dd6aeaf2e788893ef4ebe51ec887361358180bf939dd4191bcaa39","observation_id":"c3b208eb-af74-4035-9ed4-2c9adbb461d9","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.551829Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:22d50da3fe7b05d92cd98ac524de41104a9774b4f027ceeaa498b55edb8e46a3","observation_id":"85e93ea3-9f3f-415a-aa55-0158c10054e5","resolution":{"observed_at":"2026-05-11T10:21:03.172221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T08:59:10.877437Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:35a40b8c8699d95565ade74dd16035f6d1f058e2840305f8ff77417d5f00f005","observation_id":"5b0f89c4-257c-4a73-a01f-98ebefdd4451","resolution":{"observed_at":"2026-05-21T08:59:55.268707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:4b632206bdd92be434bfe5264d916c3a68750886a6e49528c297367f11c96967","observation_id":"c96aa05d-13c8-4ef0-88af-bcbcf5319edf","resolution":{"observed_at":"2026-05-10T09:28:39.580506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.19954","last_updated":"2026-04-21T20:01:38Z","snapshot_observed_at":"2026-08-08T21:35:14.408066Z","submitted_at":"2026-04-21T20:01:38Z","title":"Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:58:03.974053Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.19954"},"observation_digest":"sha256:67c0a4150f827c0d6dde802ebf49ae7202d5f3a4a5cce6c7e6221f1c1647af17","observation_id":"d8b082f0-af4d-4067-a289-d77dd57f1849","resolution":{"observed_at":"2026-05-11T12:46:24.805355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:1d3678388ccbe21249a165b68a5b93062792cd11586ec2654f3528b8fb2fd2ef","observation_id":"519af2ee-a3a0-4291-83e1-c444c03131fb","resolution":{"observed_at":"2026-05-11T21:41:19.050035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:0167703255bd2a1ffd517159f168a2640b64ed120ccf3967a7792f2db42a8bcc","observation_id":"921dab5b-a36c-4778-adfb-20bfbf7fbcb0","resolution":{"observed_at":"2026-05-20T23:43:51.195508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.05646","last_updated":"2026-05-07T03:53:54Z","snapshot_observed_at":"2026-08-03T14:49:05.703728Z","submitted_at":"2026-05-07T03:53:54Z","title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-08T15:04:41.518195Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.05646"},"observation_digest":"sha256:e7886f7f848eed41b11bfea04e2831506b5623ac7c6fc854dd418015f3d6667e","observation_id":"ac2fb108-0f9b-431b-8e5c-909ddd734640","resolution":{"observed_at":"2026-05-11T18:36:07.974566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-04T01:36:20.420094Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:bdf74f77c3e66bd25778714762a49da0caf8bd81b5a99cffebfd756c3903f091","observation_id":"333d691b-d2e0-4bd4-9cd5-d6ba23abcb42","resolution":{"observed_at":"2026-05-11T18:41:10.358702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:27067ec51a70887034259a1acedcb29714bf03cba19004b3681cff16592878be","observation_id":"008a8304-022a-4fbb-9b37-34e5fbe1fa6f","resolution":{"observed_at":"2026-05-13T01:47:04.898621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-02T02:51:49.314780Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:030413e7c6bad0b41115270f2164f7d2583eedd386de0bbb41684e55b5f6b4ff","observation_id":"4473075d-f5ca-4df6-8206-6ce5471a2566","resolution":{"observed_at":"2026-05-20T12:43:17.389113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:784111051cc53e943c682b41f3368f277ef441f4759730b9fde4614b67ba5d97","observation_id":"6a177bd3-2801-445e-91e8-250c9704f213","resolution":{"observed_at":"2026-05-20T11:33:14.301808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:7d44c8470b0b194d1ed9e0d7ac4a950f865899edd85655e046c25132b40c13ee","observation_id":"a318c7ae-ef0e-480b-9093-0fd3fadac828","resolution":{"observed_at":"2026-06-30T18:35:00.345303Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f33eaa2de3e490fdf6e637746c2d973a9e9a78f37d7a3a3f5117b784c4acf42b","observation_id":"56505dc3-693d-40eb-bc29-692615926173","resolution":{"observed_at":"2026-07-03T14:38:28.896947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:25.661515Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:172bc54dad727ededac7ab3fe99d9b9ae6596ba6e549ad4bc704cb50303e3d73","observation_id":"8243c92a-4a9d-47b3-a384-fee137bb55cc","resolution":{"observed_at":"2026-07-04T10:09:44.697635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:cc0c99b5f0224d5f863f8cd74652db3959507b8a029886f4a9f98ac96c645282","observation_id":"2e827ec3-e9be-4230-b11a-982702ef9b13","resolution":{"observed_at":"2026-07-03T23:19:02.439470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:8deb3689ad4ecdb5867d56101117e1e023e57727d86cf5ace9e2e69bfdfe9d4c","observation_id":"962dcbc7-89cc-4983-8fef-605c13eafe22","resolution":{"observed_at":"2026-07-04T16:39:58.238735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-13T05:11:19.001184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09133","last_updated":"2026-07-27T13:55:46Z","snapshot_observed_at":"2026-08-06T19:20:12.388945Z","submitted_at":"2026-07-10T06:43:43Z","title":"IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T05:11:19.001184Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2607.09133"},"observation_digest":"sha256:7d8c41fced76d8f8046611b7c200ffafcc85bf78835043a0fafbaff12bcefa68","observation_id":"4335c52f-26bc-460c-b559-203232a2b955","resolution":{"observed_at":"2026-07-13T05:11:19.001184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-02T07:44:18.617071Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09133","last_updated":"2026-07-27T13:55:46Z","snapshot_observed_at":"2026-08-06T19:20:12.388945Z","submitted_at":"2026-07-10T06:43:43Z","title":"IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:18.617071Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2607.09133"},"observation_digest":"sha256:8e012fa941c8a63e145d67d7e6869fe93ffedd9dae1fac50d448cb6d1421e2e6","observation_id":"8ae6621d-7e99-4606-8967-b66ff2bf033f","resolution":{"observed_at":"2026-08-02T07:44:18.617071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-08-05T00:46:23.340701Z","title":"arXiv preprint arXiv:2505.23661 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00559","last_updated":"2026-08-01T09:42:45Z","snapshot_observed_at":"2026-08-08T15:42:31.128764Z","submitted_at":"2026-08-01T09:42:45Z","title":"Test-Time Curriculum for Open-Set AIGC Detection","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:23.340701Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2608.00559"},"observation_digest":"sha256:7a5b32437e6116b729db80130dba148172c5b3ed8fb1a6a2145994c84ebcfe5c","observation_id":"5d74a6e2-0343-4150-a5f2-213031a8a0d0","resolution":{"observed_at":"2026-08-05T00:46:23.340701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23661/citation-record","integrity":"/paper/2505.23661/integrity","json":"/paper/2505.23661/citation-record.json","paper":"/paper/2505.23661"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.668718Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.668718Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:445b51ee21179d49f43838045fd5d1b07f3945a45dd9f12f1d8d88a5e3b347d0","observation_id":"6035d8ec-a76e-4ea3-b87f-954d67ad2cc0","resolution":{"observed_at":"2026-08-07T12:44:12.668718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.783250Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.783250Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:0e12c48d35e6646e3e1c1a8427fa99bddb2ab4eed07a050518d077ac8af29860","observation_id":"d4a14748-5626-46a2-b2f0-d7828f34232f","resolution":{"observed_at":"2026-08-07T12:44:12.783250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.894781Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.894781Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3b3fe8db40be879e4a1d84e8a966b980009114c1d0092ad9722af64e536bb339","observation_id":"578b26f6-e097-41ca-9f47-f8e52869ffde","resolution":{"observed_at":"2026-08-07T12:44:12.894781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:44:12.987323Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:12.987323Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b322064179d76739066edbfa6036a9911f5b202869a70fcc5dfcc9b55a1bbc1e","observation_id":"7054ed70-b2e0-4bd7-8a9a-eef25feca87a","resolution":{"observed_at":"2026-08-07T12:44:12.987323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.043657Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.043657Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:6cdd81a1f92b5a7ac515ea8ba5564555026eb5079f4220fae6e630e0c0e963e4","observation_id":"0d1ff2ac-df0c-4395-b94e-d6748d81253f","resolution":{"observed_at":"2026-08-07T12:44:13.043657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:44:13.101067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.101067Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:f7e535d919d757e7b0791e9d3635b6b1f900d9e9d52468ff23a319e09e4f48e9","observation_id":"3bf26c07-2194-4332-bacf-f1af516967b0","resolution":{"observed_at":"2026-08-07T12:44:13.101067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.184621Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.184621Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:2f5ab80ca2c4640143655225f01c2473f6e52a366ce6de84238a404f9f96f9ce","observation_id":"fd256ac3-fec7-4db9-a8f9-e796a66a9bb7","resolution":{"observed_at":"2026-08-07T12:44:13.184621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T12:44:13.275342Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.275342Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:613a6b2104fc4ed87e469f45284d186c7c91c21bf9f148414cc8c4db25050fa6","observation_id":"48873b2e-ed5e-451d-ab14-b7be49289677","resolution":{"observed_at":"2026-08-07T12:44:13.275342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.368913Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.368913Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:f213e555b58e366b52b2878af56fc77b7a4e0d1a6cfe315681e19ddcbae56a69","observation_id":"a7932a8d-5df6-4975-9d6e-a08bf667421e","resolution":{"observed_at":"2026-08-07T12:44:13.368913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.561728Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.561728Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7b65a8172d087b3933e3371cbd032dad95a7446eefd05bbae023c077573de87a","observation_id":"3f3ea260-958c-40a7-ba07-2f6de7deef77","resolution":{"observed_at":"2026-08-07T12:44:13.561728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-07T12:44:13.780066Z","title":"PixArt-Sigma: Weak-to-strong training of diffusion transformer for 4K text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.780066Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:265f23dd1f00b98368bd6898b7076b3e6af83a3bf6e3f6b7dfa3242317bc6f3f","observation_id":"cc33ce15-5a5a-40cb-91cd-f8ffe9b554a6","resolution":{"observed_at":"2026-08-07T12:44:13.780066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:13.915135Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:13.915135Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:f260f1efb973344f2af831352838654cdd760d095bbc7286d515a6dab0f0f9a1","observation_id":"9ee0b66b-1621-422d-baf0-e6c2443cb82b","resolution":{"observed_at":"2026-08-07T12:44:13.915135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T12:44:14.029102Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.029102Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7257e7af1c60e2015b8142b133755301be334ffc3a54caa0f11834032f281091","observation_id":"4ea54124-5ae1-4e4f-a7df-a3851213fbfe","resolution":{"observed_at":"2026-08-07T12:44:14.029102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:14.132584Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.132584Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:36fdc9bb8b4a33da3f25e9c6ae8a40dfe1d75e19b4071d1743bf4b56c57d342a","observation_id":"8f5966fa-82c8-4c95-b511-30fee3c82857","resolution":{"observed_at":"2026-08-07T12:44:14.132584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:14.230577Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.230577Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:e59a292315d26e72c50d19f9905c46f7cc8f3f4afd6042f8a30166fcff83e101","observation_id":"2ed071f9-acf5-477a-852a-ccd165990bc6","resolution":{"observed_at":"2026-08-07T12:44:14.230577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:44:14.337586Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.337586Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:65edde018cf0041d1340d666bd688e08633438f06cf45f0c35988d792d9077ee","observation_id":"c87388e8-1a6a-44c0-a5e4-6a5d94ef3bc6","resolution":{"observed_at":"2026-08-07T12:44:14.337586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T12:44:14.494263Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.494263Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5fdff4be44c7bac1b08bde1257397cbac006c6a9afb0ff9145f722e7b2a6ad55","observation_id":"34ab3c70-925c-4147-91a7-c49f487e21fa","resolution":{"observed_at":"2026-08-07T12:44:14.494263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T12:44:14.606841Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.606841Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:a4eaff374f2afce54a00824503d858e0c87732c0b8fddb5eab215048bf35163d","observation_id":"fc3aa865-95bc-4299-a5b2-ae5b1f852c80","resolution":{"observed_at":"2026-08-07T12:44:14.606841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T12:44:14.742428Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.742428Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:cc8b43ab89f50e11bdb0fd03d4dd9ba121329466e6916b64531aaf0c6140c56a","observation_id":"a4ff7499-3701-4273-bee7-aaf6c91ab774","resolution":{"observed_at":"2026-08-07T12:44:14.742428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T12:44:14.810243Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.810243Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:471a64a28383486741b914a84627708413d7cdf792b1a2da90fce9ecb9c838fc","observation_id":"feee7fbc-8865-4c9e-a27c-61780c8fae68","resolution":{"observed_at":"2026-08-07T12:44:14.810243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:14.891013Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.891013Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:1f6e1b6d0a359769e09e1e2d54d4cc6b379f74308b32894fa8d225d874774c7c","observation_id":"e20cbcff-517f-4cda-a019-6c68bd4f3b08","resolution":{"observed_at":"2026-08-07T12:44:14.891013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-07T12:44:14.957297Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding.arXiv preprint arXiv:2412.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.957297Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:ba6367b0c4dabd4570143e3c4a7bc94371b6d5b7be0b622a842335f3ccb794ee","observation_id":"e06dda0f-75f6-4bd1-8c8d-770a35ed0620","resolution":{"observed_at":"2026-08-07T12:44:14.957297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-07T12:44:15.039181Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.039181Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3df32ad03a71c0e94ee982ee449b038579248d3a332094050e320ab7b1b70dd6","observation_id":"c7590a71-3091-42fb-ac32-7b3bb6302515","resolution":{"observed_at":"2026-08-07T12:44:15.039181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.110694Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.110694Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:73f5a4b00792e345218f673addee5c0dba97335ddd5a7bf1431894980b82af12","observation_id":"e9dea184-515f-4a16-8c6f-2a99ab13ca1e","resolution":{"observed_at":"2026-08-07T12:44:15.110694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-07T12:44:15.148096Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.148096Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:8d6e86be07ffcfdd74e00207c588207901d797845b9fc188e4a271a7f5b82223","observation_id":"5c9ce947-b55b-4545-be2e-997b370492f3","resolution":{"observed_at":"2026-08-07T12:44:15.148096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T12:44:15.179360Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.179360Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c2b47fad9a4ceee971de4542a7bf9287af225ecb80bbd8a3ecc26303e18937a6","observation_id":"189049c2-f882-4d64-b9bb-2f825baa2e5f","resolution":{"observed_at":"2026-08-07T12:44:15.179360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.204122Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.204122Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:ed180e80bd0bfe75dd87c7845c9a737a419f4bd1eeae0ede9c7ca7f8da961bbe","observation_id":"10b76f1f-2460-40a6-a315-cdc7ee7d006d","resolution":{"observed_at":"2026-08-07T12:44:15.204122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21979","last_updated":"2025-04-22T04:26:58Z","snapshot_observed_at":"2026-08-07T16:31:36.925232Z","submitted_at":"2025-03-27T20:50:38Z","title":"Harmonizing Visual Representations for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21979","snapshot_observed_at":"2026-08-07T12:44:15.245982Z","title":"Harmonizing visual representations for unified multimodal understanding and generation.arXiv preprint arXiv:2503.21979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.245982Z"},"links":{"cited_paper":"/paper/2503.21979","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:eeb912082937ec2136bac193624b7af452152192b354fea366461fd341197b43","observation_id":"a5e5cb3f-18c4-41c5-ac11-7305a4af5284","resolution":{"observed_at":"2026-08-07T12:44:15.245982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.589453Z","title":"Transfer between modalities with metaqueries, 2025","venue":null,"work_id":"97af53df-b305-4cd2-97ab-49f473b13922","year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.331127Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:349b627a1ab2b0f92c5f66e6fe115583d1e95eb68c565fdf509e31e9baa275c2","observation_id":"7fcac129-639a-4db5-b51a-66727b97a7e1","resolution":{"observed_at":"2026-08-07T12:44:20.671731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.407565Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.407565Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:d63c5f57016b83f105896c7c201f147d84094eb042b877c04cb98ce4407b0685","observation_id":"1c947697-6a78-4fde-b22c-7779b8e343b1","resolution":{"observed_at":"2026-08-07T12:44:15.407565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.481465Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.481465Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:7d7d12b5ad97eae3bb79068fa1d92a15393d1c5d333e0b4580dbfc2ed225b484","observation_id":"41ef8a11-9e40-44c8-b07d-8ea86291d395","resolution":{"observed_at":"2026-08-07T12:44:15.481465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.558349Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.558349Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:95ef74823027b019f35e20e3c6bf5508de2c0732e75bad64f0351839842c418f","observation_id":"d49b3c90-0a92-413f-a3f3-805b76b068b4","resolution":{"observed_at":"2026-08-07T12:44:15.558349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:44:15.611853Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.611853Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:321af694b7bba4864d176c8a16b249a994e2f456fd2be511b2f4d83e14443951","observation_id":"eaefd3ea-0f7b-4612-aeaa-352193c3059c","resolution":{"observed_at":"2026-08-07T12:44:15.611853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:44:15.658112Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.658112Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:861e8b211c9356620ea80614d088f50bcc5b6e181f5485dce53e4b600b92a390","observation_id":"5573576b-e62c-4c13-8f53-a4148241707c","resolution":{"observed_at":"2026-08-07T12:44:15.658112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.444847Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"5b774e55-b865-47d5-9e9b-854810ccb1b3","year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.707332Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b43cea22af5a32845d76c7eecbc385366ede5b07cdcc3d8f4d190f6ac0af889c","observation_id":"76af517e-7ec2-40fd-977e-99a915ce80c3","resolution":{"observed_at":"2026-08-07T12:44:20.495287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:44:15.737384Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.737384Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:124138dd9d027f133aad54dfe380fa8ea43d7e46a3be6eef72d5574ef7b4b6e1","observation_id":"92061989-3c66-4e66-9699-a0e2baa14917","resolution":{"observed_at":"2026-08-07T12:44:15.737384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T12:44:15.790154Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.790154Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:e4a2d7025fa62c7537d8eb2092a70d785a8a676f47b98b782c8bbd0f34fcdee6","observation_id":"50d89353-e2df-46d1-9085-6e6aed608311","resolution":{"observed_at":"2026-08-07T12:44:15.790154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T12:44:15.884310Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.884310Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:ef25662b2e1ee102429ef094d0c9c625e797a991c3d464330a9c2c97335691c1","observation_id":"39b5e017-0143-4b75-9849-cd0125d4f9fd","resolution":{"observed_at":"2026-08-07T12:44:15.884310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:15.937556Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.937556Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:906ef11b155a34e3333fe2002c8a751231888b56f77050dd2683631d3170fa40","observation_id":"07610958-a4b0-4e79-be63-b8bf11b1e917","resolution":{"observed_at":"2026-08-07T12:44:15.937556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T12:44:16.037523Z","title":"Hunyuan-DiT: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.037523Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:2be85e59f867d6955171a8ce17eb71273a75904592071f6de1efe07b14506bc2","observation_id":"2077f18a-effd-48eb-be04-092b0ee7208c","resolution":{"observed_at":"2026-08-07T12:44:16.037523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.103086Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.103086Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:2380ee43ef3d4e491923354d85154a24cfdcddf111d9234d4237e2dd4a1012ff","observation_id":"ec1f466d-522f-403c-9f96-6012750e4d9b","resolution":{"observed_at":"2026-08-07T12:44:16.103086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.284865Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.284865Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b1ca86917828f3ce77b321275898c035a33df90918230283eef8909718f4745c","observation_id":"9ab9c62b-e79b-4b6b-97f6-a13c8b0f88f7","resolution":{"observed_at":"2026-08-07T12:44:16.284865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.361544Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.361544Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:85bbef48e324a6d00021d6ed1d48378f0f0e9f2c09b77a7afad5b2020c9209fd","observation_id":"c60d4210-7d90-44e4-b06c-ea52c35bfb5e","resolution":{"observed_at":"2026-08-07T12:44:16.361544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.209573Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers, 2024","venue":null,"work_id":"4882fd59-4236-4c1b-9a49-1e00234f3413","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.438696Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:23fa9e1bc2c19b413ec293a8645c29aa1dbc9d47883821afef11e6586acb5cbb","observation_id":"5ea1f9f1-6990-4fd9-b2fa-c90bcf99f027","resolution":{"observed_at":"2026-08-07T12:44:20.273660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.556293Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.556293Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:990f6582d6c23e9514423efeac679dbdecc77b3f94211c9fa664ae505168d308","observation_id":"4dfaf339-61e1-49d1-8b58-eda1097cfc44","resolution":{"observed_at":"2026-08-07T12:44:16.556293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.123493Z","title":"Sit: Exploring flow and diffusion-based generative models wfith scalable interpolant transformers","venue":null,"work_id":"fd26035b-1f4c-4aa5-af41-1f921e72f87d","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.644623Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:8f2dff8e9df14bf43ed4a119b1eadecacba849b5491f0ed67e2837e11ad98a2c","observation_id":"19350a6c-032d-4ce6-8ec1-3fb0e20ebb8e","resolution":{"observed_at":"2026-08-07T12:44:20.150952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-07T12:44:16.743577Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.arXiv preprint arXiv:2406.18583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.743577Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:6cf071d7d7eb51ec82a03f97c3725f4354171c4f7139392e1bc8096bbbeaeeb1","observation_id":"f46da92d-f9b5-4608-99af-db1e4c6520d2","resolution":{"observed_at":"2026-08-07T12:44:16.743577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-07T12:44:16.826082Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.826082Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5aa1d50ae7f252c858558abb8310a682243276405da555156b0d837a1f9bd27c","observation_id":"76282589-2e37-47ca-b250-694a41e03f99","resolution":{"observed_at":"2026-08-07T12:44:16.826082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T12:44:16.907537Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.907537Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:fd3dddef2608845b52b36e23a43a9ec0c8f923eff0c6ed96fabcf0ea6ff3c2c4","observation_id":"38a85164-1543-46b7-b883-2d733592397b","resolution":{"observed_at":"2026-08-07T12:44:16.907537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.012891Z","title":"Efficientvit: Lightweight multi-scale attention for high-resolution dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.012891Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:a80720cd51e57e7a9fbb27537067e2c88b3e0c5811501e3e55eea9b7046bab4a","observation_id":"c8d77a9a-3258-4780-8bc4-d4aadae3a339","resolution":{"observed_at":"2026-08-07T12:44:17.012891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05821","last_updated":"2025-04-11T14:21:24Z","snapshot_observed_at":"2026-07-06T18:27:50.189771Z","submitted_at":"2024-06-09T15:14:26Z","title":"F-LMM: Grounding Frozen Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05821","snapshot_observed_at":"2026-08-07T12:44:17.054823Z","title":"F-lmm: Grounding frozen large multimodal models.arXiv preprint arXiv:2406.05821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.054823Z"},"links":{"cited_paper":"/paper/2406.05821","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:941fe0866d9f756cfc471f7eb0827f86b26c5f53600252643635f0238276a506","observation_id":"e6378ad2-21fc-4c2c-939a-1eaa4ae8a8dd","resolution":{"observed_at":"2026-08-07T12:44:17.054823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:44:17.119373Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.119373Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:18e776f83f5011a9c322e141e4710277a9ce8d72b78e5dca3b0e439c048c808d","observation_id":"4e7650c6-7a75-4f80-a7ee-22d476024b72","resolution":{"observed_at":"2026-08-07T12:44:17.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07951","last_updated":"2025-08-09T17:12:35Z","snapshot_observed_at":"2026-08-07T16:06:45.054589Z","submitted_at":"2025-04-10T17:57:28Z","title":"Scaling Laws for Native Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07951","snapshot_observed_at":"2026-08-07T12:44:17.154880Z","title":"Scaling laws for native multimodal models.arXiv preprint arXiv:2504.07951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.154880Z"},"links":{"cited_paper":"/paper/2504.07951","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:f0ffc0760712565c44b2be0904c85155b873c3e894c47b302a96e6cf7d92325c","observation_id":"3e059d4e-8c73-46df-a29c-1c8a4bb510f2","resolution":{"observed_at":"2026-08-07T12:44:17.154880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:44:17.248177Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.248177Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:abab9151390cd844e666935529242de6fa3149a4e5545693408d46a1e79267ed","observation_id":"13c031c1-c6c1-43ea-8e5c-f94f3a17d559","resolution":{"observed_at":"2026-08-07T12:44:17.248177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T12:44:17.315211Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.315211Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:5b84bcd0b31e03b016cbc1dfd612fddbbda8a72bdd1b481e4b30857185389198","observation_id":"f667d273-2f2e-47ac-892a-b5ff3481590c","resolution":{"observed_at":"2026-08-07T12:44:17.315211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:44:17.387643Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.387643Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:c368784a35dc707e59f85021c9996c5919b4c94fd86cbb18fab37d82d9a259f0","observation_id":"20ea9665-0bbe-4b92-b2dc-81d09ba090cf","resolution":{"observed_at":"2026-08-07T12:44:17.387643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T12:44:17.429682Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.429682Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:27ea9f266cda5afd2d2cc74731d02501f68f59f425af0bacede529e5e81b6ebc","observation_id":"bef601de-0ec9-4569-b8aa-0709d22d821b","resolution":{"observed_at":"2026-08-07T12:44:17.429682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.506293Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.506293Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:156b19c24b2c38239a50e2dfe5657fa7368cf70898582dfdf07b6f33bafa1090","observation_id":"d648e502-14c5-431f-815f-920dd602f54d","resolution":{"observed_at":"2026-08-07T12:44:17.506293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T12:44:17.567850Z","title":"Pixart- alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.567850Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:4e60787638a643b600695a4b5e5393effc2845fd0f6c474902e381b2495ec4dc","observation_id":"0762f47d-604d-422f-92ef-14c98bdbfb6a","resolution":{"observed_at":"2026-08-07T12:44:17.567850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T12:44:17.634220Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.634220Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:15aaedca6e574f00836e715f8d193040581644e73440e65cff7890b0de942ce0","observation_id":"e6d7ba6e-4e7f-484b-8866-57a44e081f07","resolution":{"observed_at":"2026-08-07T12:44:17.634220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.685541Z","title":"Flow-grpo: Training flow matching models via online rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.685541Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:4c2bc2f09ea53e7bd59e6456eb721eccb89c7152a693afd983a4a7375f2a9bed","observation_id":"b128eb78-e9c5-4581-a077-ba2022a1ad64","resolution":{"observed_at":"2026-08-07T12:44:17.685541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T12:44:17.764755Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.764755Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:1b6140028cf08f9bd9a3dc9c0c714edda861b2cf2a219d2732cfa014e7b65a76","observation_id":"cdcc7b72-102b-4a33-a9df-31ce5984a324","resolution":{"observed_at":"2026-08-07T12:44:17.764755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T12:44:17.824218Z","title":"World model on million-length video and language with ringattention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.824218Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b16f7de63e4b6b48e05ffa490a36f62fc54a48fa58811fa1999e9c8a8543cb52","observation_id":"15e45610-e6f7-481a-aac5-478ccd9f27d4","resolution":{"observed_at":"2026-08-07T12:44:17.824218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-08T11:00:06.035456Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-07T12:44:17.919986Z","title":"Simplear: Push- ing the frontier of autoregressive visual generation through pretraining, sft, and rl.arXiv preprint arXiv:2504.11455, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.919986Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:3a95b37da0f48350fd84dde1805cefca1e246a63cd6ac03fd46fd9932dcfa935","observation_id":"62f640ca-edc3-42c1-af76-465ed47dc62d","resolution":{"observed_at":"2026-08-07T12:44:17.919986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.993185Z","title":"text-to-image-2M: A high-quality, diverse text–image training dataset","venue":null,"work_id":"6557fc1f-1afa-4d41-9e32-4a64236b722d","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.986317Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:005b72efb363718fcde10f0566353582fcebc1bb523c4878d7c2f5b3cbcb9430","observation_id":"010c2984-c358-4ce9-b2c1-2177b04ea6d5","resolution":{"observed_at":"2026-08-07T12:44:20.017543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.086468Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.086468Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:378ebca96d60dce440973ac3eeecff0544931546d833a118539aeae35ba43f1b","observation_id":"538e3db9-6637-4525-a4cb-c950e8931524","resolution":{"observed_at":"2026-08-07T12:44:18.086468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.873979Z","title":"Megalith-10M: A dataset of 10 million public-domain photographs","venue":null,"work_id":"6f3fc8b3-ae33-4385-bc64-5e216e29f047","year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.163452Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:0196cb0ac9012b5310f2b3b498ea84e8d1110cd9cb0e78722f359febf84db04c","observation_id":"cb5006ae-20b2-4e04-bedc-c6914bae2c8f","resolution":{"observed_at":"2026-08-07T12:44:19.908808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.777246Z","title":"RedCaps: Web-curated image–text data created by the people, for the people","venue":null,"work_id":"4b599983-a362-44c3-8b45-db71ac635e75","year":2021},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.256979Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:be7488fd3094f719e5a5acf93a23e5fdc12f273754ddd00b748601b5c8f7d3d7","observation_id":"c1e9cfc8-45c1-4728-bf5b-8f6682335c2e","resolution":{"observed_at":"2026-08-07T12:44:19.834909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-07T12:44:18.323666Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation.arXiv preprint arXiv:2402.17245, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.323666Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:1cfb33358e75e39bae7a02246de8dc55e71f52ab54cf0498684317728f11ff91","observation_id":"44765e00-e05b-477d-8811-bd652baf00a5","resolution":{"observed_at":"2026-08-07T12:44:18.323666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.427453Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.427453Z"},"links":{"citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b8b72cccec11858c9a02fd5862037a591acac410359cca1f3c65f2c32ee47ba8","observation_id":"0c6db8f2-4aab-47be-90c5-330ac5c78f80","resolution":{"observed_at":"2026-08-07T12:44:18.427453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T12:44:18.464184Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.464184Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:71a37153659ee756de68c15ab7bf18d6c9e1fadc27ea897f6d200733a573218b","observation_id":"eea42e66-daf8-4d68-9b58-bb75b8c65925","resolution":{"observed_at":"2026-08-07T12:44:18.464184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T12:44:18.542352Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.542352Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b243faac95d8608b0096fe6438a75f1f03bff636b60b8abcb5f6bfdad934a913","observation_id":"47103e9b-bdb7-42c9-94ba-44a69aa07525","resolution":{"observed_at":"2026-08-07T12:44:18.542352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T12:44:18.590800Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:18.590800Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:b8bfeabf18d13e60ac3f98833849a9efd08f4fc79243bd8063c61cf06df4cf6a","observation_id":"29dcb26a-57e5-44e0-8b57-e43c8271223a","resolution":{"observed_at":"2026-08-07T12:44:18.590800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 26 inbound Pith citation observations for arXiv:2505.23661."}