{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d2fd1e5ae355045aaf741274795cf507aa83d71ac413e2b35cca7ab47188153","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:55.803846Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T15:24:46.407707Z","title":"V ., Zettle- moyer, L., and Yu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06474","last_updated":"2025-02-10T13:52:52Z","snapshot_observed_at":"2026-08-08T15:17:59.067687Z","submitted_at":"2025-02-10T13:52:52Z","title":"UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:24:46.407707Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.06474"},"observation_digest":"sha256:268b95c6b8720430815ad5509087c194219fa70d4af9101a627e644cc9edb8ae","observation_id":"4281b462-436e-40f7-899c-6eae8f1ce502","resolution":{"observed_at":"2026-08-08T15:24:46.407707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T10:24:41.573614Z","title":"V ., Zettle- moyer, L., and Yu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.573614Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:0420e6716eb012bbebb818870a6fca599f8a162ffd46d4071863ddd282aaf1ee","observation_id":"82064ae3-1537-41f5-954b-ed80812f159e","resolution":{"observed_at":"2026-08-08T10:24:41.573614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:1f131454d2db922618dcd7c70562bedb68545eb7d86be7d152a6d3c5a11f774b","observation_id":"df39cbdd-3381-441e-a123-c2e256285cdc","resolution":{"observed_at":"2026-05-15T16:24:27.719941Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T22:49:23.074271Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2504.06256"},"observation_digest":"sha256:223f6c2600d1dc68e06dbbc5c19ff712785a07f60003395b7c61d52cb8c7141e","observation_id":"b00e0bf0-cad8-4fb7-9243-39b51f257aa3","resolution":{"observed_at":"2026-05-14T22:49:23.256298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T23:34:26.878354Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.09568"},"observation_digest":"sha256:a2f5cdc258246e207cc939450f33601d27aa1408b9a271b57bf0ccbc3ce28b45","observation_id":"f1969a78-60b6-4416-b4b6-16c8b833dcbf","resolution":{"observed_at":"2026-05-11T23:34:27.059549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:379210a3689c6c280e9ffaca477ca52bd819f0700cf067c04fa9a5c77e857ac1","observation_id":"51b2df35-9b9c-4a5f-92ae-eaf04c263e21","resolution":{"observed_at":"2026-05-10T16:23:41.942313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:53:25.463377Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-08T10:23:11.173335Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:25.463377Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:233dced5990abb6aac34e05fe211ded96f92517db45a65b89802d9b2427ea342","observation_id":"05dac12b-2ec1-4114-b49e-baa9bdda25cf","resolution":{"observed_at":"2026-08-07T12:53:25.463377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:44:17.119373Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-09T00:35:08.230205Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:17.119373Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:18e776f83f5011a9c322e141e4710277a9ce8d72b78e5dca3b0e439c048c808d","observation_id":"4e7650c6-7a75-4f80-a7ee-22d476024b72","resolution":{"observed_at":"2026-08-07T12:44:17.119373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T12:45:23.846395Z","title":"Xi victoria lin, luke zettle- moyer, and lili yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-07T12:37:05.162590Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:23.846395Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.23705"},"observation_digest":"sha256:65e9b333414d9fe6783ec5bb2e426c1e5faf82a457eebb95ab1bb1c1c92cba28","observation_id":"31f5f6e2-7a61-446a-af72-fef9c92bf846","resolution":{"observed_at":"2026-08-07T12:45:23.846395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:51:42.915375Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06952","last_updated":"2026-06-17T19:53:28Z","snapshot_observed_at":"2026-08-07T05:43:12.232561Z","submitted_at":"2025-06-08T00:15:32Z","title":"LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:42.915375Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.06952"},"observation_digest":"sha256:90c123bd89c6b20bb27d914beab82f1f5dcfbddd4aca8bf9c52cbf1a0abb16a6","observation_id":"a98f8182-ac5b-424c-b2ac-401da3970f5a","resolution":{"observed_at":"2026-08-07T05:51:42.915375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:26:02.245217Z","title":"Zettlemoyer, and Lili Yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T14:14:59.427680Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.245217Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:db8e7e79573c1016b51936429b9cf49fb8dc715a381690ef981c7188fc817fe9","observation_id":"58e5e446-5684-49ed-a9fb-a57566674917","resolution":{"observed_at":"2026-08-07T05:26:02.245217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-07T05:26:16.360980Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08006","last_updated":"2025-06-09T17:59:52Z","snapshot_observed_at":"2026-08-07T20:46:06.872501Z","submitted_at":"2025-06-09T17:59:52Z","title":"Dreamland: Controllable World Creation with Simulator and Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:16.360980Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.08006"},"observation_digest":"sha256:7e9ecbbb06ee40493a5db009ce8e5af0918ac22736f9ceb63b9b83729a29b0ef","observation_id":"4a9b2bc1-764f-4d42-96fb-7ae08c69dbe3","resolution":{"observed_at":"2026-08-07T05:26:16.360980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:aa7f78e89d15ada943dfd790fdf16497bff94e5c3d235bce7ab3564dd0b65310","observation_id":"73a3cffc-4bfb-4dea-88c1-15afa9fa889f","resolution":{"observed_at":"2026-05-12T18:51:15.590013Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:ee1dd7980e8e304e8625be4d1a518904d2a8d11f61933257b6d8cbb647a57e2e","observation_id":"301bff5f-135a-4629-bd06-220f1bcd1fea","resolution":{"observed_at":"2026-05-19T07:52:10.858881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T22:34:16.184346Z","title":"10684–10695","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21276","last_updated":"2025-06-26T14:00:38Z","snapshot_observed_at":"2026-08-06T22:25:28.751546Z","submitted_at":"2025-06-26T14:00:38Z","title":"WordCon: Word-level Typography Control in Scene Text Rendering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:16.184346Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2506.21276"},"observation_digest":"sha256:9c92c450225a3d2312f1cd107ab31b4a0df34b626a8eb7b4cb74b2d9feb04a85","observation_id":"cd09d3a2-d46b-49ef-be2a-5baa8f857fa3","resolution":{"observed_at":"2026-08-06T22:34:16.184346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T20:49:42.028479Z","title":"Llamafu- sion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01756","last_updated":"2025-07-22T02:25:49Z","snapshot_observed_at":"2026-08-08T16:57:37.559490Z","submitted_at":"2025-07-02T14:33:52Z","title":"Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:49:42.028479Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2507.01756"},"observation_digest":"sha256:4d31deac31ca97895605eb34d9aabe8116e1e1966c82431a6c78f96ab2e64466","observation_id":"72d32ee3-09c9-486d-a573-65be95ab85cf","resolution":{"observed_at":"2026-08-06T20:49:42.028479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T20:46:25.122139Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01792","last_updated":"2025-07-02T15:16:59Z","snapshot_observed_at":"2026-08-08T19:57:19.375306Z","submitted_at":"2025-07-02T15:16:59Z","title":"FreeLoRA: Enabling Training-Free LoRA Fusion for Autoregressive Multi-Subject Personalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:25.122139Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2507.01792"},"observation_digest":"sha256:0f4553bf9d1a9abe99f55c6dff362aba90a0d65334512b97e634fe0ecde9901e","observation_id":"d2c473d0-10b9-4e03-938d-35c50e31c5ef","resolution":{"observed_at":"2026-08-06T20:46:25.122139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T12:10:08.289255Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:10:08.289255Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2507.22058"},"observation_digest":"sha256:7d027373705e553360cb7ac23f8aabeabe1de711c865dbcab04338022e07af5b","observation_id":"594a0dbc-5e29-48b0-89c5-62155ea44e51","resolution":{"observed_at":"2026-08-06T12:10:08.289255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T13:31:09.919265Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-06T11:26:06.418969Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.919265Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:d8672a16410b051ddcbee48c39595d867c640d182ccf80cf46047bbfe577dfe2","observation_id":"b17a1063-74ee-4200-8211-e01266c29ff6","resolution":{"observed_at":"2026-08-05T13:31:09.919265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T22:55:44.950531Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-07T20:36:07.154043Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.950531Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:55eb5d2f957701ad6e858ada29948acd71d25f23dc02e3d0d7db43ff8daf015e","observation_id":"93875204-2588-4310-b563-7bab02756f4c","resolution":{"observed_at":"2026-08-04T22:55:44.950531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T22:36:08.140951Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.140951Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:06b7aceef103f766bc469fabb071d5054844b5c49d8d3f0f52b98d6b15160dba","observation_id":"b562f445-e176-474e-9c2d-9b13fbd5371d","resolution":{"observed_at":"2026-08-04T22:36:08.140951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T10:49:49.019944Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.019944Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:8681fe2c40a0b3618665e85ebe09de5cbcdb36ee6da14f8ca346368fc77d7346","observation_id":"ef364fbd-f8fd-4b0c-bf37-103f5d74a52b","resolution":{"observed_at":"2026-08-04T10:49:49.019944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T09:54:26.449060Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.449060Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:02fe8ee15e99a148da7d3331d59c9a3ba478c5a3487ccca8ee753968af4b21c8","observation_id":"527a0908-9afd-40e7-91e4-9cdb4c2ca112","resolution":{"observed_at":"2026-08-04T09:54:26.449060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T15:36:51.177913Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.16483","last_updated":"2026-05-27T09:07:02Z","snapshot_observed_at":"2026-08-03T15:36:47.371078Z","submitted_at":"2025-12-18T12:51:19Z","title":"FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T15:36:51.177913Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2512.16483"},"observation_digest":"sha256:c8681ae52a7daf9957e877abffd4495df2f6ea844ede33841aa8b1236f5f223d","observation_id":"70e91f46-7163-4878-a42c-6e83fdf87912","resolution":{"observed_at":"2026-08-03T15:36:51.177913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:a4a63389e75f2637867a0c8ecd64f01e8bf2a01cc1ec62e6eebb3180c9fa31c5","observation_id":"71837f0d-f365-4e9a-814e-146d94d08b85","resolution":{"observed_at":"2026-05-21T14:50:14.718128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T03:57:32.062558Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-03T03:57:29.747868Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:57:32.062558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2602.06442"},"observation_digest":"sha256:bd66505a7d007f62d3092d9e637fbc476cf35b18e13c5a7615367ddc42c209be","observation_id":"8854c87b-93c1-45fc-926c-f848d8caded8","resolution":{"observed_at":"2026-08-03T03:57:32.062558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-02T07:45:27.779427Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:3bb91b69e2e7ef4163ab8b67dbc214bbcd88043b12d8446254ddf2a578393a7a","observation_id":"c89b769c-3ee7-42e6-8247-0d57e1dcebd4","resolution":{"observed_at":"2026-05-16T05:02:19.618705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2412.15188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:6e1d6f1c87fce881399297f9f2d6b07042795cbb3d5e574ea76d18d5f4443550","observation_id":"aa3453fd-dc74-4795-95b3-f947d0d1f384","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-03T02:33:57.876583Z","title":"arXiv preprint arXiv:2412.15188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:57.876583Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:bfa97083422fcc367e16615d6ff2eefabe3b096dbf81b4a024bb869ed18039f8","observation_id":"8f54f030-7751-43f7-9d1a-645e1db41827","resolution":{"observed_at":"2026-08-03T02:33:57.876583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.08719","last_updated":"2026-04-09T19:13:14Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T19:13:14Z","title":"LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:36:38.627415Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.08719"},"observation_digest":"sha256:17dff4ea77ec944099c14071d0236468e649cf698d17c5b70a169b17405e5cbf","observation_id":"10617339-23d3-4317-89c2-12d670fc9617","resolution":{"observed_at":"2026-05-11T06:31:01.398245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.13540","last_updated":"2026-04-15T06:41:56Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T06:41:56Z","title":"Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:15:02.723774Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.13540"},"observation_digest":"sha256:17ce8db9f282bba85078ac682d3ce5a03090bb4eb991235949fbce5e14bb565e","observation_id":"b0800302-88df-4745-bf7b-dd720fc3f116","resolution":{"observed_at":"2026-05-10T14:15:28.953805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.16552","last_updated":"2026-04-29T14:25:32Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T07:28:04Z","title":"Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T09:22:10.651922Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.16552"},"observation_digest":"sha256:8eb26fcfcbed6665218c8f9bddc26ef5ec574204e31d5d9339225a21b6790f0a","observation_id":"06ef9691-e5ef-45bd-8e01-14279bf16a8f","resolution":{"observed_at":"2026-05-10T09:23:37.044329Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.19902","last_updated":"2026-04-21T18:25:25Z","snapshot_observed_at":"2026-08-02T14:48:34.514966Z","submitted_at":"2026-04-21T18:25:25Z","title":"MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T03:27:50.144706Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.19902"},"observation_digest":"sha256:2e465bec943045f36d0ccedfe302e0123b037540479b48889dcad098e91393ae","observation_id":"c235ae80-05e8-4e10-8822-a65b8dec7d74","resolution":{"observed_at":"2026-05-10T03:29:21.669427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:c52888cfa261db98f935b90a6166d992d13678a78efdba9d9224b6af73c3c4da","observation_id":"66ee8cee-fdc4-41e5-ab3a-66281e56cb1d","resolution":{"observed_at":"2026-05-11T21:46:14.691378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:e5f71729ee626bf4295977aff63cdb402167aa01b4e53d2617dd1d83b9818444","observation_id":"51bd0ddd-055f-465b-a524-64859693240b","resolution":{"observed_at":"2026-05-12T08:46:26.816740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.08029","last_updated":"2026-05-08T17:14:43Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:14:43Z","title":"STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:59.644215Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.08029"},"observation_digest":"sha256:a97ec043053c29a74dc122f1979305c7b0374a4086e022545c9c8606ce8f00ea","observation_id":"73068788-af9b-4a9b-89b8-001858cd0320","resolution":{"observed_at":"2026-05-11T02:45:57.156891Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.15792","last_updated":"2026-05-15T09:48:46Z","snapshot_observed_at":"2026-08-08T03:23:41.035935Z","submitted_at":"2026-05-15T09:48:46Z","title":"Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T18:44:54.835575Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.15792"},"observation_digest":"sha256:ea9d335138aed1c26a533daa45adcff81e1ebc2f252a5f1cf158f9a4c29ddc1f","observation_id":"c63185a6-3916-499f-8a62-05a744587d3b","resolution":{"observed_at":"2026-05-20T18:48:53.450985Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ed976df149291e7086b64a7541e354561de9e5d315cce2253626d2c636481980","observation_id":"8fe1fa5e-1efa-4d0a-a3b9-8971c93eae2c","resolution":{"observed_at":"2026-05-20T11:33:14.202728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:89b8483b3dcf96baaa259c26e2f73ee1c8697d600a297527b277ea131d859645","observation_id":"e554ff05-2944-404f-b193-242c8dc4740e","resolution":{"observed_at":"2026-06-30T18:35:00.282413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2606.00310","last_updated":"2026-05-29T19:34:39Z","snapshot_observed_at":"2026-08-02T19:03:39.307951Z","submitted_at":"2026-05-29T19:34:39Z","title":"Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:38:26.147074Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2606.00310"},"observation_digest":"sha256:72f606979d7ab3a14f7ee55adebb9f8cf18564d22528b77048744a79f2492ef6","observation_id":"86284e46-aff6-4509-b9a9-68049f183b84","resolution":{"observed_at":"2026-06-28T22:42:46.709383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2606.01858","last_updated":"2026-06-01T08:10:25Z","snapshot_observed_at":"2026-07-06T23:42:21.252086Z","submitted_at":"2026-06-01T08:10:25Z","title":"Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-28T15:07:03.439928Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2606.01858"},"observation_digest":"sha256:b1dbfb8b1ace45c15d8a37dcf627287491ac7db15bac6db3060954b4f4f7fc24","observation_id":"a6e04f3e-7839-49c8-b13a-3a891a308702","resolution":{"observed_at":"2026-07-01T22:46:18.726597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2606.31451","last_updated":"2026-06-30T10:25:46Z","snapshot_observed_at":"2026-08-02T09:59:19.263812Z","submitted_at":"2026-06-30T10:25:46Z","title":"UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T05:56:03.597839Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2606.31451"},"observation_digest":"sha256:5a3d427eb444b98fd3fd53674ad1f1d96598352e5dd6170652b26271030479f4","observation_id":"74f42b3d-7ebf-4053-b30b-be90316c1160","resolution":{"observed_at":"2026-07-01T10:05:40.624385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-01T07:02:51.493005Z","title":"arXiv preprint arXiv:2412.15188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21594","last_updated":"2026-07-23T17:59:58Z","snapshot_observed_at":"2026-08-07T01:32:12.278950Z","submitted_at":"2026-07-23T17:59:58Z","title":"Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-08-01T07:02:51.493005Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2607.21594"},"observation_digest":"sha256:9db034ad0972ab369d0aa3321cef89a1a49bad9d542d4ca2ea8c94ad14ef53b7","observation_id":"583ff840-3bba-428a-894e-007a3b67114d","resolution":{"observed_at":"2026-08-01T07:02:51.493005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-06T11:55:28.069606Z","title":"V., Zettlemoyer, L., and Yu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T00:11:55.308216Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.069606Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:39174355027ce77945f9360c91216402fc7f49d4ae94f83ff2d152ac45f9bc48","observation_id":"9c8c05c8-dcfb-46f2-961d-2d9147766e61","resolution":{"observed_at":"2026-08-06T11:55:28.069606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T17:08:55.803846Z","title":"V., Zettlemoyer, L., and Yu, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T00:11:55.308216Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:55.803846Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:87d03874a209beee37cd4b97260b94fdda6cf8a312d7aaeecccb9bafa2e4979a","observation_id":"1b47279d-1775-4e41-80f8-d3ed0ac8850b","resolution":{"observed_at":"2026-08-08T17:08:55.803846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15188/citation-record","integrity":"/paper/2412.15188/integrity","json":"/paper/2412.15188/citation-record.json","paper":"/paper/2412.15188"},"outbound":[],"paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2412.15188."}