{"as_of":"2026-08-21T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:093d42c9c3766ec643f1c2a42eb7984df732b552400ffaca45a343b75aae39a9","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:31:10.578558Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.18714/citation-record","integrity":"/paper/2605.18714/integrity","json":"/paper/2605.18714/citation-record.json","paper":"/paper/2605.18714"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-16T16:01:20.302377Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":"2301.08243","doi":"10.48550/arxiv.2301.08243","metadata_source":"pith","pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Assran et al","venue":"cs.CV","work_id":"ca0a2fcc-b704-4e8a-8977-b8bcba691059","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:074000112fb91f8d963ecb2343b5030b7049f1f2e300a7c9f56e20c2c390a997","observation_id":"5069ae84-35d2-4dff-81c7-641275fd760d","resolution":{"observed_at":"2026-06-30T18:35:00.289874Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.880701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.880701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:cc4892f78d54fb92959f8419f88ff3c2a62dd20c1e7301f448f91e4b1c587cf2","observation_id":"91aa59ca-9b41-4098-a5ba-59ba06ebf9e5","resolution":{"observed_at":"2026-06-30T18:35:00.363633Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.262144Z","title":null,"venue":null,"work_id":"2a65e736-3f37-4ad5-8fe9-aa5aa3e04715","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c807e8f0e806a897afb7957e6d5f64d781bc50d9fd717c5cb630500564030c5b","observation_id":"50058b55-5a95-47c3-a9e7-805a4b9b1cb3","resolution":{"observed_at":"2026-07-08T04:14:30.263200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.293757Z","title":null,"venue":null,"work_id":"5557b07b-8053-460c-b863-68732a5d3019","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c21687a88b6ad7bf0ca42ee974fbd9c7a75102e860cbc4b6a94abd8e46cc9410","observation_id":"9bd1b411-d7b2-4a7b-8cf0-70f8a83cff34","resolution":{"observed_at":"2026-06-30T18:35:00.294989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.257069Z","title":null,"venue":null,"work_id":"12be7759-86e0-4c0e-8217-4ddf53df963b","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:2840e770d788c09a5514fd0e51190c9bb3b1241294128b0be1b75ab688558d3b","observation_id":"6c54261b-985b-4f7d-b622-02a9b1fcc97f","resolution":{"observed_at":"2026-07-08T04:14:30.258471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-21T20:37:42.923128Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:6db903c1a33608369c1c728a975105121e838bf4f8a33386831e42dc8c6ba416","observation_id":"4eef1f10-0a3b-45b9-b84c-133230ebea62","resolution":{"observed_at":"2026-06-30T18:35:00.297856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14404","last_updated":"2024-01-25T18:59:57Z","snapshot_observed_at":"2026-08-21T01:29:25.430869Z","submitted_at":"2024-01-25T18:59:57Z","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":"2401.14404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14404","snapshot_observed_at":"2026-07-04T16:59:58.123921Z","title":"Deconstructing denoising diffusion models for self-supervised learning","venue":null,"work_id":"f0d3150f-39b1-430a-8b69-3ba6cfd2c719","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2401.14404","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ec6b3f37775ce7774cca29279ca419e47d7eda1e5526a0f5c0c083f15ec4da8e","observation_id":"1ef9940f-ad48-4702-9956-cea6d8752e70","resolution":{"observed_at":"2026-06-30T18:35:00.285093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.272197Z","title":"NeurIPS36, 49250–49267 (2023) 2","venue":null,"work_id":"c4804766-65d8-4b61-b16a-6a02e36d8537","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:fb087a6e5ac0849c37db31d02e1610df8237b90c8282e7e9484391aab528e7fc","observation_id":"9fb063e7-fa70-4bb8-9149-d8de6808c76c","resolution":{"observed_at":"2026-07-08T04:14:30.273323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:4cf4d3571572f7675349ce6cb375688b936ebab205617794dd0bac290c35490d","observation_id":"00debac7-6a8f-423c-89fe-07c3077de651","resolution":{"observed_at":"2026-06-30T18:35:00.287454Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.262401Z","title":"In: ICLR (2024),https://openreview.net/forum? id=y01KGvd9Bw2","venue":null,"work_id":"9e9046a9-3747-4582-9b3f-17cbd940dee8","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5145ee1d070a650eae6760916b8618991fe98672e014ad140d54f556f7f44615","observation_id":"50c4e7d4-b29d-4958-ae7a-df2105fd6590","resolution":{"observed_at":"2026-07-08T04:14:30.263481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:37:40.271549Z","title":"arXiv preprint arXiv:2511.23386 (2025) 4, 7, 9","venue":null,"work_id":"39f6030c-4966-4a81-911d-fbd41f4329fa","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:db25b329dd22847889a1720233966cced7dbced9ed2daeaac040c5b9472aaa2f","observation_id":"93a8e812-31d8-42ea-a74e-ea7618f38ad6","resolution":{"observed_at":"2026-06-30T18:35:00.361216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.263715Z","title":"In: ACMMM","venue":null,"work_id":"eda37976-c93f-4dce-97f8-3b008b179114","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:24cbdc52140a90f1925cf3d775a3427960f7859459acc1d7b815c2873433e9b0","observation_id":"fbcbc4b1-fa1a-46cf-b12b-53630a89187c","resolution":{"observed_at":"2026-07-08T04:14:30.264936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.274346Z","title":"In: ICML (2024) 1, 4","venue":null,"work_id":"e81cbc18-1952-4151-b59b-c61f53ef5ef6","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ca8e97a403887551282ac9ac941b4e31ccb4aacf84aa483eebfc8248d5e702f6","observation_id":"1fe06d48-a184-4ccb-a1be-4b42f43d4af2","resolution":{"observed_at":"2026-07-08T04:14:30.275464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:f6987d064736538dabd0af3339c121dfa5747a72232d70a947369b8889c63d5b","observation_id":"aabe6c3f-09a7-4701-9aeb-44f0e2593404","resolution":{"observed_at":"2026-06-30T18:35:00.356370Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.264005Z","title":"In: ECCV","venue":null,"work_id":"7731c27d-b89f-44ca-95f0-1bfe61cbfdf7","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:745f68723ee2a0b98608999b62e9f6df42ddcefb091349422ccd6e14f8008317","observation_id":"c5943552-c23f-4eb4-971b-40db9737fc5e","resolution":{"observed_at":"2026-07-08T04:14:30.265114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-20T02:50:01.167264Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c47c67ec6ef695577a55eada76bc8b33bacefc4a24b6436bb3c9f89a9da7b80e","observation_id":"41f4ffe9-b6b8-4ff8-819f-eb9b5000c5c0","resolution":{"observed_at":"2026-06-30T18:35:00.371150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00783","last_updated":"2024-06-30T17:59:58Z","snapshot_observed_at":"2026-08-16T13:38:21.604699Z","submitted_at":"2024-06-30T17:59:58Z","title":"Diffusion Models and Representation Learning: A Survey","version":1},"cited_work":{"arxiv_id":"2407.00783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00783","snapshot_observed_at":"2026-07-04T16:59:58.150347Z","title":"arXiv:2407.00783 (2024) 4","venue":null,"work_id":"528ddb57-91d2-4d3d-bbd2-6d85351fe3ba","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2407.00783","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5bafa577aa676ec06a8fdad1d2c66d8b6025e6b43f87ce2fa11b980f5f5bba00","observation_id":"6be2cc4f-d226-4388-bd58-8cfb49e136e9","resolution":{"observed_at":"2026-06-30T18:35:00.368536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:1f0c0c29b605643240b27f6836d589ad46b4e84d00e05aac829d56659cdc7e88","observation_id":"0c937d14-e652-4430-8229-1401fa97dec9","resolution":{"observed_at":"2026-06-30T18:35:00.298289Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.301059Z","title":"NeurIPS36, 52132–52152 (2023) 3, 6, 9, 14","venue":null,"work_id":"452d64fa-a358-4e2d-8f68-ce621161e9ea","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:a75f3933026e306bad76993eee647501d25bcc0c4ddad24a16447600ddfcc709","observation_id":"2f9793e8-a9b8-4c72-bee4-7e3e634250c5","resolution":{"observed_at":"2026-07-08T04:14:30.302618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.249494Z","title":"In: CVPR","venue":null,"work_id":"33c869a5-83d5-4ad6-a290-534f97eda1dc","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:3464ddc4bfe6b653b3ebe8db21261edec830ec987e885fd8a6544999e47d2898","observation_id":"e4e1299a-a22d-4efe-b8d6-df67e330df29","resolution":{"observed_at":"2026-07-08T04:14:30.250657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.251553Z","title":"In: CVPR","venue":null,"work_id":"5b28605a-eeda-4b41-b57d-01115ee8c637","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:805f16e3aafd56ae76001a20670df2e8883a6a3f47c5813aa1e4864d8271d123","observation_id":"2655f109-2f6b-46f6-8851-49aede8689ba","resolution":{"observed_at":"2026-07-08T04:14:30.252655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.265505Z","title":"In: CVPR","venue":null,"work_id":"7fbca3fa-4a4a-4ace-8db4-9e0b612076ec","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:f1da1a4c8c8706021cc043fef6e9913f153ad65de0d99fef8c1e694ddcc3ae4a","observation_id":"0b1ee9d5-d44f-4a7d-ae15-25675dfab6fc","resolution":{"observed_at":"2026-07-08T04:14:30.266566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.260505Z","title":"In: CVPR","venue":null,"work_id":"7f22455e-e6bb-455d-b46a-90c0d35dbd74","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:3408b7688ea1c7d21affa439c9fa0360688e09151b46072ca7cd0e0cfdd9782d","observation_id":"fd3e675b-41bc-41f8-ae7e-891f95ba89cd","resolution":{"observed_at":"2026-07-08T04:14:30.261565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.03161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:28:55.560704Z","title":"arXiv:2402.03161 (2024) 2","venue":null,"work_id":"092fa2fd-47cf-4d46-a836-d97eb0c5af19","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c2fce09354b8748dbf921c07b5d5e6dbd9524206329bf73b100ea9a36cd7538f","observation_id":"5654b223-4bc1-4bd7-8e81-9d7232d8ee6b","resolution":{"observed_at":"2026-06-30T18:35:00.300676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2309.04669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.854434Z","title":"Unified language-vision pretraining in llm with dynamic discrete visual tokenization","venue":null,"work_id":"30af28b4-c35b-40c0-acbf-085b0d588bfa","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:d20b2f718b7462caf5182a2f419b29603aaa0bee6084677a34540a52b7b75747","observation_id":"11739eda-40de-472a-8834-49515769321f","resolution":{"observed_at":"2026-06-30T18:35:00.303308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.278325Z","title":"In: ICCV","venue":null,"work_id":"a01904cc-0b54-4128-a697-00d36950c2fd","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:37217cf0ab6df1dccfe10dd0dda593cb4475ced6464fc3d09cf71ed1556f353f","observation_id":"8c6ca92d-2d4c-4982-8055-a94ba4c5d3c2","resolution":{"observed_at":"2026-07-08T04:14:30.279771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:9b8e100bde04733eb8e3ee4c3e44432b5b605970880499ab7e191f11f0d36bec","observation_id":"3d1056ca-2311-4c08-8f49-2f37ead29be4","resolution":{"observed_at":"2026-06-30T18:35:00.292872Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.298693Z","title":"In: EMNLP","venue":null,"work_id":"37a4bf11-1253-45f4-856c-d2abfec90ef3","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:100014a3c3c79551ae687f5ef24c16b121650c43264990ce305d5bec061c2c8a","observation_id":"919769fd-70e1-43cf-b41b-101e1a032f0c","resolution":{"observed_at":"2026-07-08T04:14:30.300286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-08-16T11:51:43.064429Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"cited_work":{"arxiv_id":"2510.16888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16888","snapshot_observed_at":"2026-07-05T16:51:14.250864Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","venue":"cs.CV","work_id":"9687bd6c-c4f6-4f49-ba59-ca7e825f0710","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2510.16888","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ca07d491f4c55c92647c12c93962491ff9c9d51db583013966264f95d29a31c6","observation_id":"c5a50c4c-7201-4940-9b01-6ab492e60428","resolution":{"observed_at":"2026-06-30T18:35:00.303188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.312631Z","title":"arXiv:2512.19680 (2025) 5","venue":null,"work_id":"1ba4d47f-36db-4a3c-b1f7-857c48fb76cb","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:1a035a92099cfd2655315172d0bf0b44017e5198a9d6b758c110fb11a701594d","observation_id":"9b00b86f-3823-48db-91b6-57e305284d78","resolution":{"observed_at":"2026-06-30T18:35:00.314100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ecb23f111ec79f8b4ca44c54407490f330202e3ea4e166a725cc50013cab6a71","observation_id":"2839ba80-d757-4bf9-bea9-83025e038f43","resolution":{"observed_at":"2026-06-30T18:35:00.349052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.282801Z","title":"Transactions of the Association for Computational Linguistics (2023) 6, 9, 17","venue":null,"work_id":"2681571c-3e4e-4694-8a7c-aa444161e757","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:10497f98ec2a086efff56813404c03a19c9a0c90122f365678d5dd5c62ce81d9","observation_id":"eca460a0-1964-4681-968a-b355346cdfb5","resolution":{"observed_at":"2026-07-08T04:14:30.284407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.725582Z","title":"In: NeurIPS (2023) 1","venue":null,"work_id":"3dfca52d-95f7-4f53-a41e-f6a0e454d6db","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:990b115280309b1fc1ca4189add4700d966a65f2a2e740bfad2d5733000ca228","observation_id":"8b85ce76-4af7-42eb-8858-080038a20a40","resolution":{"observed_at":"2026-07-08T04:14:30.281513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c16a2fb31561d131de7423fa76a36958d4739885bf883e3511e79766ac110d54","observation_id":"cfd9a9a7-8c76-495d-8023-99e220f2c01a","resolution":{"observed_at":"2026-06-30T18:35:00.279776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.270675Z","title":null,"venue":null,"work_id":"ed3d3efb-1acf-401e-af67-f6922de06135","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:580ce939c8f8aae34caccd66ebc4e3e7b94b9c23a0f455500bc98fbee0528d9c","observation_id":"91889e4e-ecbe-4b5e-9df0-b70ee26b972a","resolution":{"observed_at":"2026-07-08T04:14:30.271914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.268980Z","title":"Science China Information Sciences67(12), 220102 (2024) 6, 17","venue":null,"work_id":"027ffd9a-1e40-4ac7-93be-fc33a105dbef","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:bb96614c0b407d1f1773a629d42904404240a009e97584594b610db6104333c9","observation_id":"d771c448-949f-449d-bbb7-be3e0adf706f","resolution":{"observed_at":"2026-07-08T04:14:30.270090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-20T06:36:43.390291Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":"2312.17172","doi":"10.48550/arxiv.2312.17172","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":"arXiv (Cornell University)","work_id":"dee0bd36-ce7b-427c-9af3-0ea894c01777","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:0d370dfa2be4cee0a9c417f31c65938b7b0858d857ffa56d66b4eb6388525755","observation_id":"b5181804-620d-4b7b-a402-dd4c8fec86f9","resolution":{"observed_at":"2026-06-30T18:35:00.290588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.278067Z","title":"In: ICLR (2024) 6, 9, 17","venue":null,"work_id":"1d63d84f-26e8-4817-9434-267c7901c9c5","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:654b2f65d13feafe11a04f863d68b25655568b72b38d1338222383e25d24ed17","observation_id":"ba93729d-fc8a-434e-bd9a-28425fa19229","resolution":{"observed_at":"2026-07-08T04:14:30.279430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.276159Z","title":"In: NeurIPS (2022) 6, 17","venue":null,"work_id":"fa1bf85b-f16a-4996-8c5b-0f73aa169adc","year":2022},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:40284de9d245b8944b0f03c2f3893e4dfe660ceebf15636fa9b931940d6258e9","observation_id":"a17107f4-4c18-4c00-b75d-ae39e883c220","resolution":{"observed_at":"2026-07-08T04:14:30.277392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15232","last_updated":"2025-03-08T05:29:51Z","snapshot_observed_at":"2026-08-18T03:58:48.807902Z","submitted_at":"2024-05-24T05:46:04Z","title":"DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception","version":4},"cited_work":{"arxiv_id":"2405.15232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.15232","snapshot_observed_at":"2026-06-30T18:35:00.270516Z","title":"arXiv:2405.15232 (2024) 4","venue":null,"work_id":"1728c725-1416-47aa-a4b2-65e033c94878","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2405.15232","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:73989181a411cabe8125fcf4a4f20089657ce8a18526d8e7047eb4af1b9da6d5","observation_id":"1545c2a8-dd4f-4398-8250-d4b01290cf60","resolution":{"observed_at":"2026-06-30T18:35:00.271961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:82292b71323a7f17945dfee1e6dd2f7f09905093930285a735feb06743bba5bd","observation_id":"ef58fd2b-aa4f-4fb8-9fdb-218fdb60d15e","resolution":{"observed_at":"2026-06-30T18:35:00.274664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.238479Z","title":"In: ICCV","venue":null,"work_id":"2fb6080c-4297-4349-83fc-41a67acb88d0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:8e5c318ea308e6c96685039fe31e7420e9918513dfa1a3a18d4b11a3a9f8a61c","observation_id":"2811b71f-04cf-4dce-903a-486beb3ba0cb","resolution":{"observed_at":"2026-07-08T04:14:30.239596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.267099Z","title":"In: CVPR","venue":null,"work_id":"77e2417c-f52b-4895-8335-6bc546e493bf","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:6e47770a5a694e5448ac848a2b010077b77d960edc73eae6229cdbcbe8a33094","observation_id":"42b56341-4574-4b54-a5ee-59f32cf6cfd0","resolution":{"observed_at":"2026-07-08T04:14:30.268126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.230918Z","title":"In: WACV","venue":null,"work_id":"a38a7b8f-b767-4dfa-82e5-ad197edd71fe","year":2021},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:84cb8810b72ff05a0652233de2347ffe85903c349cecc3917088c4c8e505309b","observation_id":"89db8fce-8641-448d-b60c-d4b3cde6d150","resolution":{"observed_at":"2026-07-08T04:14:30.232102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2503.07265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-07-04T13:19:50.710913Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","venue":"cs.CV","work_id":"604c1ae0-368d-49bf-8117-d688ac59f305","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:b4835fdf86acda9e68efa51e1377f57e161fff0404a24574f7209b8ba45392a0","observation_id":"18951bd3-bbf1-4574-bac6-89c2e71c7feb","resolution":{"observed_at":"2026-06-30T18:35:00.266110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-21T17:21:24.620300Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ec9ac5217b55df76b9032c77b46861fff8a42ef3b9e0ed9f656e486c39793059","observation_id":"30c633d1-3a2e-45fe-b414-7ebcad8ff710","resolution":{"observed_at":"2026-06-30T18:35:00.277120Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.255041Z","title":"In: ECCV","venue":null,"work_id":"32794fbc-5ec0-48b8-aa85-ea97c461309d","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c181661f85d7a1a79c3c628bf5c00160f43d3b6a56fa4080fe75a9a378dd132f","observation_id":"5daf2b32-b558-496c-8b53-bd81d9bdc28e","resolution":{"observed_at":"2026-07-08T04:14:30.256144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.251345Z","title":"In: CVPR (2022) 14","venue":null,"work_id":"8b02f46e-b9d4-4900-a0f5-7aef1bee4c28","year":2022},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:20f155750765ab16a97e22c22bf283df2d28bbba85e02ce1fb6baf6520c6190a","observation_id":"3dcad568-6cbc-45ae-ba83-ae83dd0f460c","resolution":{"observed_at":"2026-07-08T04:14:30.252462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.302281Z","title":"In: CVPR","venue":null,"work_id":"088966bc-dddd-4d46-bbec-d29f73b5892c","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:32f85fb41baf9adf652f96028bc295e60519452fcace9a6ac77996ea6f2f0d68","observation_id":"a64ca134-4288-40a2-9b15-810d901ff791","resolution":{"observed_at":"2026-07-08T04:14:30.303767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-17T03:15:27.866249Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2412.15188","doi":"10.48550/arxiv.2412.15188","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2412.15188","venue":"arXiv (Cornell University)","work_id":"7dc74790-08b8-4917-aa5a-f9da5f5b3edf","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:2c8f2df8f1b4d4f983bdb8985e32672d83a2f5125a6c2b4ca9d9d0c3f5c686e5","observation_id":"e554ff05-2944-404f-b193-242c8dc4740e","resolution":{"observed_at":"2026-06-30T18:35:00.282413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.297891Z","title":"In: CVPR","venue":null,"work_id":"50935987-353c-41fc-8221-ed1f6fc08479","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:7f616733e40b542c33ad37e0d31bd37064a64be85c3c4248f533e764af043120","observation_id":"b5df93c4-7775-4fc3-96df-d1766ddd1863","resolution":{"observed_at":"2026-07-08T04:14:30.299134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-20T22:45:30.683466Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"cited_work":{"arxiv_id":"2601.21406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21406","snapshot_observed_at":"2026-07-02T03:06:29.598538Z","title":"Generation enhances understanding in unified multimodal models via multi-representation generation","venue":"cs.CV","work_id":"4f28bb7c-82b5-411d-960b-062463f42276","year":2026},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2601.21406","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:612fa42f9b4ee5a79a7b5de638ffab2c8b2d3a500a5f555a514f9aa6bde3191a","observation_id":"c307a630-d72c-4e80-84f3-a5d883a7147a","resolution":{"observed_at":"2026-06-30T18:35:00.355652Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:52.528059Z","title":"Unilip: Adapting clip for unified multimodal understanding, generation and editing","venue":null,"work_id":"a1bad6a0-54ce-45f8-8478-3169a4b3c6e8","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:11486977f8288e9031b5ddbb11a7da87984abf8ea27b22fb0a3864d9e76a43bc","observation_id":"0261830c-42d7-494b-90e0-5a0aeca40ffb","resolution":{"observed_at":"2026-06-30T18:35:00.360536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:41e13d6b1d748ce46fba728e058444b38aaa4c4105216d5ae95e56f82172f3c2","observation_id":"9ad11093-71ac-4cc7-9e69-9ec7a9d0c31d","resolution":{"observed_at":"2026-06-30T18:35:00.366165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.284164Z","title":"NeurIPS37, 84839–84865 (2024) 1","venue":null,"work_id":"b98d3c38-9da6-41f5-9e69-0658bc22e73f","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5fe19d976e556c106907d7c3ec5c1dc24bb539b508425ae74e77074725ef07f7","observation_id":"82e477aa-c3f3-4ae1-8705-567a68ddeaa0","resolution":{"observed_at":"2026-07-08T04:14:30.285295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.295076Z","title":"NeurIPS 36, 48382–48402 (2023) 4","venue":null,"work_id":"17ca3c04-9097-4266-bcca-8862f06ee0d2","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5cb154c0375009818ed0b1ea9e8285539055a3545ede6d133fd78d20bdf1f182","observation_id":"5ef342fd-00f5-4d19-91bd-4ac4e6573c01","resolution":{"observed_at":"2026-07-08T04:14:30.296756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.291377Z","title":"NeurIPs37, 87310–87356 (2024) 3, 6, 9, 11, 17","venue":null,"work_id":"6dff9067-f6f2-4855-830a-e1157835d659","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:f91b43c09737e974d1d5b574e337f37eafb7b5abf8fca3ec6637d53c58f6f728","observation_id":"cbfe9079-fe0d-4752-83ae-72b4278ae101","resolution":{"observed_at":"2026-07-08T04:14:30.292504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2412.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-07-04T10:09:44.713840Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","venue":"cs.CV","work_id":"cc1e25c3-90c2-4e87-9268-d28d48c546a1","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:f1082d3b704de2a4dc6b96075e1caff756728b6f0f343d3b05dfdece539be56d","observation_id":"332531c5-633b-4628-936e-42514fec5c9d","resolution":{"observed_at":"2026-06-30T18:35:00.351343Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.289548Z","title":"In: CVPR","venue":null,"work_id":"19a958ff-4e79-4716-ac7f-d7813f17a8fe","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:3f638d0c24a129257fc526784b5ed2693d7821f9e109009fb72e38d73519f5a4","observation_id":"4c3d41c8-b3ec-4d8c-b412-697f22fc8266","resolution":{"observed_at":"2026-07-08T04:14:30.290669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-18T03:58:04.466446Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2410.09575","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-07-03T14:28:32.245115Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":"ea4e6e66-3cd1-40be-924c-5177ca0e0128","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c16c841a0032256574ba07d88da1f4bd487c8889cf70c10f00011ca68287bfcc","observation_id":"fb0388fb-fd3c-4570-b15b-345d8c0f86fc","resolution":{"observed_at":"2026-06-30T18:35:00.342775Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03320","last_updated":"2025-08-05T10:59:01Z","snapshot_observed_at":"2026-08-16T00:34:57.805764Z","submitted_at":"2025-08-05T10:59:01Z","title":"Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2508.03320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.03320","snapshot_observed_at":"2026-06-30T18:35:00.337951Z","title":"arXiv:2508.03320 (2025) 2","venue":null,"work_id":"7f1ecc8a-1a26-4630-80e1-31a91ad72f41","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2508.03320","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:7a5aa7dd497800ac538e34308045524b3d3d4b50f4e43edfec5aafb2c5a1aba0","observation_id":"76a3f3d9-c181-4765-9b82-cd61480e4c65","resolution":{"observed_at":"2026-06-30T18:35:00.339365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20171","last_updated":"2024-08-24T03:55:36Z","snapshot_observed_at":"2026-08-20T12:27:57.697534Z","submitted_at":"2024-07-29T17:00:09Z","title":"Diffusion Feedback Helps CLIP See Better","version":4},"cited_work":{"arxiv_id":"2407.20171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.20171","snapshot_observed_at":"2026-06-30T18:35:00.333248Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":"701de9c9-ca15-407e-b2e2-1911f7c02361","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2407.20171","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:8460236192406f2747031208b5a61c33de33472d85b689c0588b549ce0eb7c67","observation_id":"7a27550d-7865-4f7b-ba42-294aebb97ed5","resolution":{"observed_at":"2026-06-30T18:35:00.334765Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:cc33b9a64038c05bbba6ad68c7eae616db44ca4dcced887de3bb8db959752df8","observation_id":"6db027a5-7b2d-4d44-8a1d-acdb3f2d4181","resolution":{"observed_at":"2026-06-30T18:35:00.341727Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.294275Z","title":"In: ICML","venue":null,"work_id":"2de9fc1d-86d9-4410-becd-1d965d8aabc0","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:a103a3cf8b063175620f50dc75f691e48ae534248f9a4f1e76faada63278b8c0","observation_id":"6e16c4fa-fdc6-40ab-9284-7fb115693fed","resolution":{"observed_at":"2026-07-08T04:14:30.295346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22946","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.342868Z","title":"arXiv:2510.22946 (2025) 3","venue":null,"work_id":"9373ea7b-3f55-41f8-bc09-f286cecd7130","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:9d1f8b40445b2664574cffc118641e5b368d6216e0a6604fd056c8f29a0fd3e6","observation_id":"d1b55d7b-7316-44e3-8f0f-ad044b2949b3","resolution":{"observed_at":"2026-06-30T18:35:00.344146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.299992Z","title":"In: ICCV","venue":null,"work_id":"46b894f7-62ce-4013-9bf9-2a6ef4438ab6","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:06b5fb1ea64d166799cd086a1c251cead39aefc8c9a9f52680f36eeb9c6fbfa7","observation_id":"e38b4d08-ce74-4295-9a42-f782bd6c3086","resolution":{"observed_at":"2026-07-08T04:14:30.301526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.288060Z","title":"In: ECCV","venue":null,"work_id":"5d1adbb8-e312-4b93-8e77-c29fc152a1b7","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:fb9f9dad153aab851cb9deb1715fb10c24ae83d959b0f0323f79948a96e35d77","observation_id":"6996a4a6-69bc-43af-8a25-558fcbb8b5c6","resolution":{"observed_at":"2026-07-08T04:14:30.289230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c1df48c0da271da26d631cdfc803e19e385aa26870fad83c4c4ca806ee85336e","observation_id":"b9f590d8-3066-4f3f-8eb1-2c565f935d8e","resolution":{"observed_at":"2026-06-30T18:35:00.331203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-08-18T21:48:45.801096Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5378e962854ae350b72f28949031a90b8cfa40fd8a4702b39e9f26d7496255dc","observation_id":"1f5fa638-0c5d-423d-9908-11978ccb5b5f","resolution":{"observed_at":"2026-06-30T18:35:00.328081Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.01467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.533300Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think","venue":null,"work_id":"407ce442-cf54-4e53-89b5-f140df8d27eb","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:a9efeccb77e64a25df270b94eaf35c4d3cd3199186f264aeb844fd760ae5d1b5","observation_id":"0a6ca79c-15e4-496a-bd83-0a18458ad585","resolution":{"observed_at":"2026-06-30T18:35:00.322082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.296553Z","title":"IJCV (2025) 3","venue":null,"work_id":"26db7ab2-b4fb-4a1a-ae84-47475f4528aa","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:554084bb897039759cb39184f450cd9dcf8bc625e696a66e27fe98930c8a2b56","observation_id":"6f178c0a-3fa9-4ffb-b464-d98cfe592b52","resolution":{"observed_at":"2026-07-08T04:14:30.298028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:8a48f310fcad1b82673d47d8854cd76295579fe59c0e724b0c1d91143d3695b2","observation_id":"a318c7ae-ef0e-480b-9093-0fd3fadac828","resolution":{"observed_at":"2026-06-30T18:35:00.345303Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.304483Z","title":"In: ICCV","venue":null,"work_id":"741e7986-4fde-4b83-b2ec-4f78646e7d15","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:8d21a38460cc7d6eaf9798ff3381588fc556a75796a162b5009605fb4a2a0e81","observation_id":"905b2310-02e7-442c-a011-1f3afbc44737","resolution":{"observed_at":"2026-07-08T04:14:30.305889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:68bc4e263a29807b92d8ea6e7323f35a1e42d30506a11682e8aaa3a006cb4452","observation_id":"63c989ec-88ac-4c96-a3bc-3557f29a6015","resolution":{"observed_at":"2026-06-30T18:35:00.358106Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.276411Z","title":null,"venue":null,"work_id":"6ee4ad17-4e41-41e2-8354-a98565a3a506","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:b3255e07da93ac8354b788e9f2dceac7f0b99a07490192b4480503edb8b59981","observation_id":"81569916-f0de-4b9e-8010-4a5dfc93a542","resolution":{"observed_at":"2026-07-08T04:14:30.277719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-21T08:23:59.555206Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2509.07295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-07-02T08:16:48.433525Z","title":"\"Your output must be a single JSON object.\\n\\n","venue":"cs.CV","work_id":"49fe4943-80e8-4f4e-b253-05cf57244f19","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:1ba481431071048e73d24c0e2d4f9e946471418d855ae8e23377c549cc924131","observation_id":"11442d7f-904d-45d4-b420-4be021c9bb37","resolution":{"observed_at":"2026-06-30T18:35:00.324906Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:6f385b696002d846ec111491777ac0948aa8ec199b88352e3319f8658ab6b89d","observation_id":"3aba8f9c-2e70-4279-96b9-adf0d88927fe","resolution":{"observed_at":"2026-06-30T18:35:00.334115Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-08-20T01:41:57.728123Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:4e9fa3a5185cfa5462c0418b7677b161ad873a10a81441a34eb7121292a830a7","observation_id":"eace8d0e-30cc-40a4-a234-345f7711d286","resolution":{"observed_at":"2026-06-30T18:35:00.346694Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.282233Z","title":"In: CVPR","venue":null,"work_id":"e0d7d141-c48d-49bc-bcfc-c6122237a480","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:ceaab3af778f358065051ac9ae047922fa2918d9a50f746004fbf8c061a17935","observation_id":"8f267e0c-7643-432f-907c-d37217d57dac","resolution":{"observed_at":"2026-07-08T04:14:30.283453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.267394Z","title":"In: ICCV","venue":null,"work_id":"61f0b6a1-5914-4b86-becb-aed7bce87b9c","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:3b07e9fcb00063e490cb984f1b48abf9d515b03a250c308c3870501986895ae3","observation_id":"4db69def-9e93-4ef9-9ae6-279de0fcc139","resolution":{"observed_at":"2026-07-08T04:14:30.268417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:e9698df07ebd97c8e6e22218d4f6cb9c9cc6cc86381819a7d149c47b509ea21b","observation_id":"64c7a105-3c96-4fc3-87cd-7290e11ba0ff","resolution":{"observed_at":"2026-06-30T18:35:00.353982Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.516795Z","title":"arXiv:2509.18905 (2025) 6, 9, 17","venue":null,"work_id":"c55c3b64-e350-41a8-a984-776566437b05","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:cb412442de3508933de0e12c61bcd1c62f512e0e1aea6600fc843c026dd4f291","observation_id":"bbe24a51-eb74-4d76-8708-9f024ca66c49","resolution":{"observed_at":"2026-06-30T18:35:00.358770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.268694Z","title":"In: CVPR","venue":null,"work_id":"bd83bce1-13bd-43a6-b079-6a498054fbad","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:5b08bb7e80640ad9d821d655e7a883967af7c351f36e2c38109e052f74cd72eb","observation_id":"f7b1ceee-7580-4591-8ed1-ee6e72c5580b","resolution":{"observed_at":"2026-07-08T04:14:30.269781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.306464Z","title":"In: ICCV","venue":null,"work_id":"32110eca-3935-46c2-a138-fdcf985f15ba","year":2023},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:65f47c36b2617c3dff0ddd758cdc9147f5792daa9db0aa509e7fc8a9cbceff5e","observation_id":"141c38d5-11d8-45e6-acf5-626c0776179a","resolution":{"observed_at":"2026-07-08T04:14:30.307437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-20T10:17:06.865924Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:cf4e2e813e075bf3798f467812aa4df6c5b148fe5ba0798d6795abe01def2960","observation_id":"69715a54-940a-4a56-bd7d-4de3a12c796a","resolution":{"observed_at":"2026-06-30T18:35:00.347720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:d16ff02d46bf18a70ce328c2344f3b09e1814657ea72b46fac6e027ad92fc10d","observation_id":"74b39d7d-3100-426d-b216-1338aeb053c0","resolution":{"observed_at":"2026-06-30T18:35:00.365861Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:9988b2fa446b4c0b3167eb264249c99831db94399f21251c72d90ba2706b32cb","observation_id":"061a9d94-8747-45e3-a2a1-d89cc9b3bf21","resolution":{"observed_at":"2026-06-30T18:35:00.311433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":35,"parse_uncertain":0,"unresolved":4,"verified_exact":11,"verified_fuzzy":37},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2605.18714."}