{"as_of":"2026-08-18T16:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ea1daed7903410d7844a01cfb0b3ca1de9f79d30b23b33bb39495f7838d01c2","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:57:00.056228Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17140/citation-record","integrity":"/paper/2607.17140/integrity","json":"/paper/2607.17140/citation-record.json","paper":"/paper/2607.17140"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:56.754103Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence- to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:56.754103Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:e1b2039cbaa599fcd80db0054f11e09ae9f4a0d73f5ee2456cfc71137a546e44","observation_id":"c0b86eb7-43f1-4fe7-b6c4-54b9b751d3e1","resolution":{"observed_at":"2026-08-01T18:56:56.754103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:56.820114Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:56.820114Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:adfcfa2ce82bdcd0adf73c7718f9f3c1bbade15c94e435020905678a27d885f3","observation_id":"0e640c8d-0cf4-4bab-b8ac-d8b3d8042df1","resolution":{"observed_at":"2026-08-01T18:56:56.820114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:56.883157Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:56.883157Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:774f8826a23062206863890e69bdf678d98d5d5670b366bfc9656bb069511e4a","observation_id":"9e8a90fe-cb3f-4083-afd7-176badcdeab0","resolution":{"observed_at":"2026-08-01T18:56:56.883157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-01T18:56:56.938205Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:56.938205Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:950785573bc778e1720ad227f6e1d6248224ab2c6833bfcd08bd4115bc84a8b7","observation_id":"c7cebcb5-1f8c-4e0a-809e-d6295edfff26","resolution":{"observed_at":"2026-08-01T18:56:56.938205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:56.993216Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:56.993216Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:214c9653323b4ec0874f8e649b2dd43a829c4c60cb8c4a92eab72cdca2488e85","observation_id":"b3932ea1-c287-4589-968d-651343eb9b9c","resolution":{"observed_at":"2026-08-01T18:56:56.993216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-01T18:56:57.047720Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.047720Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:d49ff75f27970e724e11a81633f30c8daa4fa146683f426f66d241088b9bade2","observation_id":"e0242232-435b-4e31-bc4d-8e02974cf3fc","resolution":{"observed_at":"2026-08-01T18:56:57.047720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.156094Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.156094Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:e81067540441950220376d16c001096fea42219cd1ffc9e6d4c654d9224234c2","observation_id":"082416f4-7371-4f61-ba75-fb98c2d2345d","resolution":{"observed_at":"2026-08-01T18:56:57.156094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-01T18:56:57.226990Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.226990Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:e3c36c941da7706d3ed15d48e1e7764e7d994e63be359d1ef78170fa308316cf","observation_id":"c4bc1a20-fea9-4de5-96c4-6c9985ed8245","resolution":{"observed_at":"2026-08-01T18:56:57.226990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-01T18:56:57.285851Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.285851Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:d88fc0001d6641a8e1aa6e2f72132202b295d8f41763b39e3f75ff0619493d29","observation_id":"1bb65791-50ff-4de3-bf65-7b61a260f14b","resolution":{"observed_at":"2026-08-01T18:56:57.285851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.336956Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.336956Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:b681a56678b219ac5073e35fa1c446afdb38558dc2193fb0c84e6d23e5c683d8","observation_id":"48aeea2a-6119-460e-846d-af6ef78e4955","resolution":{"observed_at":"2026-08-01T18:56:57.336956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-01T18:56:57.402154Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.402154Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:3015ecc7098b0b62a46127aaa0216f40edb7da0cac44c2ed2f31cd9364b0b270","observation_id":"2796d1c4-7cce-4183-9e50-70fbbd0b02ad","resolution":{"observed_at":"2026-08-01T18:56:57.402154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.457053Z","title":"Internvl-u: Democratizing unified multimodal models for understanding, reasoning, generation and editing.arXiv preprint arXiv:2603.09877, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.457053Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:43e53c9923ffebea4c63d03f09f9a2e5aff692ebea5596c25a2d920542825f35","observation_id":"fe7b03a8-ce7d-440f-a555-f56e96957883","resolution":{"observed_at":"2026-08-01T18:56:57.457053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.513914Z","title":"Tuna: Taming unified visual representations for native unified multimodal models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.513914Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:c6615c52f8911e5b936020405d5a80a4377114a1b7fecd61c2edaf8c74298087","observation_id":"c31cc9a7-9686-428e-853f-444bccabf723","resolution":{"observed_at":"2026-08-01T18:56:57.513914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-08-01T18:56:57.561814Z","title":"Tuna-2: Pixel embeddings beat vision encoders for multimodal understanding and generation.arXiv preprint arXiv:2604.24763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.561814Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:e2b37171112cfa1693566f8a8086cf0be5087d8dcf9f4aa672a87abf7c909614","observation_id":"e72af9cb-8b76-4ba0-9cf0-57fbbfa3ebad","resolution":{"observed_at":"2026-08-01T18:56:57.561814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12500","snapshot_observed_at":"2026-08-01T18:56:57.619206Z","title":"Sensenova-u1: Unifying multimodal understanding and generation with neo-unify architecture.arXiv preprint arXiv:2605.12500, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.619206Z"},"links":{"cited_paper":"/paper/2605.12500","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:7731c09a52ff51f4915db8f370db72b9c90047d0ec47a06add0d6315ced06bcc","observation_id":"37a337e9-960c-47a3-aee4-a1388418953c","resolution":{"observed_at":"2026-08-01T18:56:57.619206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.676565Z","title":"Unified language-vision pretraining in llm with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.676565Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:50a976bda0ce0fda8b40b49f6226d068d1a5d9b0623c28669aa53f4bbd4b109d","observation_id":"dc688b7a-b580-48ab-ad05-fdd95c9a605a","resolution":{"observed_at":"2026-08-01T18:56:57.676565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-16T14:34:38.530682Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-01T18:56:57.735425Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation.arXiv preprint arXiv:2312.09251, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.735425Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:515a5338a7a3589e8b2893511e83708c38209ffe4b95846b1f44afc80e232da2","observation_id":"88709946-dcf2-487f-870a-4537ffaccfc5","resolution":{"observed_at":"2026-08-01T18:56:57.735425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.795533Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.795533Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:a92daad8995e26d4d3ea104c13e2b2f98af9c6d8cc068fa734fce770f44f7d73","observation_id":"7636bf54-aed9-4c91-a203-bbafe8928509","resolution":{"observed_at":"2026-08-01T18:56:57.795533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.849553Z","title":"Show-o2: Improved native unified multimodal models.Advances in Neural Information Processing Systems, 38:47490–47518, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.849553Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:aa64ed164d770a8fc1f3c5c0bfd6861d4b5ccc6ee87e27025756667f6b2568f5","observation_id":"557ef632-529b-4302-b6ce-cca98222538b","resolution":{"observed_at":"2026-08-01T18:56:57.849553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.909523Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.909523Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:22d3659e82c7002e8357e960b5d8a8a57c35f688295fefa6928d68829bfce3f4","observation_id":"916c2745-7f74-4203-bdd6-497728d03727","resolution":{"observed_at":"2026-08-01T18:56:57.909523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:57.966409Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:57.966409Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:e637ef76b134e2205e60b65b1a5bcf18f75ccdd85737b086be22f5ab072bc5e8","observation_id":"8773cc45-8c0b-47ad-92ef-6872fbead13e","resolution":{"observed_at":"2026-08-01T18:56:57.966409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-01T18:56:58.022089Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.022089Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:4d3114502e7dc791bde1ead8878f3599d756657aee0b3579501114067cb5bc03","observation_id":"ac73d63b-6f13-43c0-935a-3b48a7d390b4","resolution":{"observed_at":"2026-08-01T18:56:58.022089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.067777Z","title":"Onecat: Decoder-only auto-regressive model for unified un- derstanding and generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.067777Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:b2f905e4f4723db79ffe59ab5ee6f66233c9596ef3db1cfc86801b70de811863","observation_id":"df3d68b0-15d6-4697-8bbe-9d943f510673","resolution":{"observed_at":"2026-08-01T18:56:58.067777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.129664Z","title":"Unigen: Enhanced training & test-time strategies for unified multimodal understanding and generation.Advances in Neural Information Processing Systems, 38:152386–152415, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.129664Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:2f7f7ee640aa49d4d0b85f5c22560c0c3f252e3ab2686557da5d9bf963fcc118","observation_id":"6f643404-2e2c-4b8c-9a15-12044ab1837d","resolution":{"observed_at":"2026-08-01T18:56:58.129664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-01T18:56:58.185926Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.185926Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:a2eee0c8716b0b91b7916f55dd9b4cf5f8d3c84191563b7eed959244d269e756","observation_id":"a2b02145-2d74-4af7-b2cf-57e6af75cced","resolution":{"observed_at":"2026-08-01T18:56:58.185926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14147","last_updated":"2026-07-07T07:10:51Z","snapshot_observed_at":"2026-08-08T01:21:45.366235Z","submitted_at":"2026-02-15T13:52:45Z","title":"LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.14147","snapshot_observed_at":"2026-08-01T18:56:58.246966Z","title":"Lavida-r1: Advancing reasoning for unified multimodal diffusion language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.246966Z"},"links":{"cited_paper":"/paper/2602.14147","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:d5bb603bb7331d7949b54a39433b9ea8e1e60438eb4585053f960269f5ae1f1e","observation_id":"f8acfc31-515b-42f5-812e-3ef4d24df194","resolution":{"observed_at":"2026-08-01T18:56:58.246966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.307608Z","title":"Towards unified multimodal interleaved generation via group relative policy optimization.Advances in Neural Information Processing Systems, 38:5332–5353, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.307608Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:0a3bb90487a1e2c703512ebe9c6a7513c4235252a1dcb6b2f10b085358729094","observation_id":"0b475d5a-72b9-4920-a703-6281b7369990","resolution":{"observed_at":"2026-08-01T18:56:58.307608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.365146Z","title":"Lvrpo: Language-visual alignment with grpo for multimodal under- standing and generation.arXiv preprint arXiv:2603.27693, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.365146Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:d64f70ac21310e45710e6f27b65b506da677ee5043bc979ae32260d8e8c1283d","observation_id":"aed24d9f-ca30-45ad-93f7-1e994a8233a1","resolution":{"observed_at":"2026-08-01T18:56:58.365146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21406","snapshot_observed_at":"2026-08-01T18:56:58.412871Z","title":"Generation enhances understanding in unified multimodal models via multi-representation generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.412871Z"},"links":{"cited_paper":"/paper/2601.21406","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:5dc481d279abf55b8c2afd40e9124c55c53aa196e38fa58a59c71f4c37fca42e","observation_id":"3338d5c3-8fd9-495b-b2e4-510c87a01a14","resolution":{"observed_at":"2026-08-01T18:56:58.412871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.483489Z","title":"Unified multimodal models as auto-encoders","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.483489Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:00d06ca0d2e021555eda9602096fe548eba01acffa80d5a445c9a3627776dd4f","observation_id":"e29cf26c-52fb-46fd-aefe-7c1e503fd3fa","resolution":{"observed_at":"2026-08-01T18:56:58.483489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-14T21:31:53.057652Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-08-01T18:56:58.587330Z","title":"Reconstruction alignment improves unified multimodal models, 2025a.URL https://arxiv.org/abs/2509.07295, 1:3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.587330Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:e753cf55ed9215f445f5f9aeccbc7ff22098cdaa0a0061ca0ec8cc25701de146","observation_id":"002f0bdf-85c7-4bf2-af29-b94827f52057","resolution":{"observed_at":"2026-08-01T18:56:58.587330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.654007Z","title":"Learning to generate via understanding: Understanding-driven intrinsic rewarding for unified multimodal models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.654007Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:35850c14f47770d21a89a6e01d86bc937be197fc6d6c7486ec9ccd4dcfaddfa3","observation_id":"df5130ca-d6d9-42b0-9e32-21fe1555638e","resolution":{"observed_at":"2026-08-01T18:56:58.654007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-08-13T21:20:38.390505Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05781","snapshot_observed_at":"2026-08-01T18:56:58.714370Z","title":"Steer- ing visual generation in unified multimodal models with understanding supervision.arXiv preprint arXiv:2605.05781, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.714370Z"},"links":{"cited_paper":"/paper/2605.05781","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:fadd9bc5c5916ed2e35e3c304f0571e75787b57ae65c19d442c91285824f146c","observation_id":"34c57d94-5c67-40a6-93a0-01c71264e2b1","resolution":{"observed_at":"2026-08-01T18:56:58.714370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.769990Z","title":"Flow-grpo: Training flow matching models via online rl.Advances in neural information processing systems, 38:40783–40818, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.769990Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:6077d9c80f5553d08e0e42a3f88bd9363e4bd40d69828ff03ff6bb3514ba0dd3","observation_id":"9d07a7b5-ea16-4598-be28-2ebb0316e786","resolution":{"observed_at":"2026-08-01T18:56:58.769990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-15T05:27:54.901099Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-01T18:56:58.829878Z","title":"Mixgrpo: Unlocking flow-based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.829878Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:ef968430bc38e10f3ef0054ac67beb12c6f08cf6d982228b6f877fdf2fc0af9b","observation_id":"9a09be2e-4f18-419a-82e3-e1b14bb4f540","resolution":{"observed_at":"2026-08-01T18:56:58.829878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:58.888826Z","title":"Editreward: A human- aligned reward model for instruction-guided image editing.arXiv preprint arXiv:2509.26346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:58.888826Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:56b76761da5668aa421e362fda642a6178cd3a791804a474435b80704c2a227c","observation_id":"24e643f5-3fe4-4626-9afc-9b1e180fccfa","resolution":{"observed_at":"2026-08-01T18:56:58.888826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.025476Z","title":"Thinkrl-edit: Thinking in reinforcement learning for reasoning-centric image editing.arXiv preprint arXiv:2601.03467, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.025476Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:63b22bbaeed1b063e34b7db5c9cb72313c551f4883829189a839df7f58ce33f3","observation_id":"afaa18da-9a25-48f7-a886-1de74b58cfc0","resolution":{"observed_at":"2026-08-01T18:56:59.025476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.113488Z","title":"Leveraging verifier-based reinforcement learning in image editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.113488Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:aa299a12ed3a5c60371e57ee2ae9bb12f22bbbcef2b07884310b0c1b1bac9e67","observation_id":"8b88c607-9014-439a-bb65-1c40d193fcaf","resolution":{"observed_at":"2026-08-01T18:56:59.113488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.189410Z","title":"Pico-banana-400k: A large-scale dataset for text-guided image editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.189410Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:132681c6232f43c73e3eb594fc5f018712d00a509dc66604c844c5e983e25189","observation_id":"ac0d21e7-1637-40d7-9c6a-1fb5a21f301c","resolution":{"observed_at":"2026-08-01T18:56:59.189410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T18:56:59.252101Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.252101Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:ba3d8a17ae6c5801b00f7953df9c7a87bf790209dc494c9d92395f1e5f03250c","observation_id":"f9217aca-024b-42fa-a3c6-894c4464b699","resolution":{"observed_at":"2026-08-01T18:56:59.252101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.315445Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.315445Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:0495d532b25f395e4d58282e9847738d2b13719c4fa4bb678386d7e1e359913c","observation_id":"3b9daf6c-c2d2-4ee4-8041-debc9c1dd3d7","resolution":{"observed_at":"2026-08-01T18:56:59.315445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.374345Z","title":"Editthinker: Unlocking iterative reasoning for any image editor.arXiv preprint arXiv:2512.05965, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.374345Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:f2ccc409a9aea798eedff656b0c9e6cfc4ea27927215940872f864e339674dfd","observation_id":"86aecf24-41e0-4e8c-8e45-acf9fa3bfe2a","resolution":{"observed_at":"2026-08-01T18:56:59.374345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.435425Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.435425Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:d94f52d2c444845a2edb689e839e7cb5b4e2987d1997c91acb9b1a501dab6b80","observation_id":"f28a57ae-bd12-4180-a370-5a35e94acbc8","resolution":{"observed_at":"2026-08-01T18:56:59.435425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.546062Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.546062Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:efdbcdd0642fde0708af52d5540e33d18309b6fb865a4113e3c5414030f39b19","observation_id":"294bc429-dc3d-434a-977b-fdae81065aa4","resolution":{"observed_at":"2026-08-01T18:56:59.546062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.624256Z","title":"Thinkmorph: Emergent properties in multimodal interleaved chain-of-thought reasoning.arXiv preprint arXiv:2510.27492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.624256Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:38d53b860bf2e93d4e3b5fab7b620e314f2fc464f4de227ee0fcc1d34226a14e","observation_id":"8146b69e-0641-4ca9-8aa3-f5f140f83143","resolution":{"observed_at":"2026-08-01T18:56:59.624256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-01T18:56:59.711456Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.711456Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:23544029b6024c8f1c1f602555356694bc71816a3f6a0bb373d727e13e6ba71e","observation_id":"ccd2384b-0de4-45f1-990f-269c862a6fdd","resolution":{"observed_at":"2026-08-01T18:56:59.711456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.778381Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.778381Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:1bd6a2184d69c731c4bfe04f6780fb6c3ce49f9def8a681db340cf290236e081","observation_id":"ad24bab6-197a-4361-ade8-f905a11b8284","resolution":{"observed_at":"2026-08-01T18:56:59.778381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.831659Z","title":"Oddgridbench: Expos- ing the lack of fine-grained visual discrepancy sensitivity in multimodal large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.831659Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:982a429d6eb68f909868a61bc95294c10479c5a22b286a4281142fc911c03e75","observation_id":"04f19fb9-0956-4f9e-8ce8-d1f21bb21a8e","resolution":{"observed_at":"2026-08-01T18:56:59.831659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-01T18:56:59.905835Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.905835Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:04067174f6da7f7b01d155458bcc26f4186c780a6279eee9037b8bbf7543c6dd","observation_id":"165cffc8-b8eb-4bb3-8abd-938d396c08b9","resolution":{"observed_at":"2026-08-01T18:56:59.905835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:56:59.980892Z","title":"Imgedit: A unified image editing dataset and benchmark.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T18:56:59.980892Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:33ad4912331afe03bb8a949ac2097bc14204efa97335f3401da38608d8be5af2","observation_id":"4c2447dd-3fb7-4a90-8516-749aa5b1e468","resolution":{"observed_at":"2026-08-01T18:56:59.980892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:57:00.056228Z","title":"Envisioning beyond the pixels: Benchmarking reasoning- informed visual editing.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T18:57:00.056228Z"},"links":{"citing_paper":"/paper/2607.17140"},"observation_digest":"sha256:a91529b1908ec40d81a1210f6c8df03425ba0e12076d863b36e16049cdf5f0e4","observation_id":"56e0e08a-42c1-4168-afc6-d4f8ae3d9238","resolution":{"observed_at":"2026-08-01T18:57:00.056228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17140","last_updated":"2026-07-19T08:53:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T06:40:48.493880Z","submitted_at":"2026-07-19T08:53:01Z","title":"STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.17140."}