{"as_of":"2026-08-12T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f583c8b6e5f3df2609c4d1354ae60fe7cd09e67aafbb48a255abf4e63547e42","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T08:15:12.947854Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03530/citation-record","integrity":"/paper/2506.03530/integrity","json":"/paper/2506.03530/citation-record.json","paper":"/paper/2506.03530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Incomplete multimodality-diffused emotion recognition","venue":null,"work_id":"ad26d07b-5951-4cba-b691-3180efd21ba7","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:2462e06d3e8a2ce91577bc7ca6616a74fda4f75ddfa477025d4e55ca61009a9d","observation_id":"95d9c0ea-7a99-48a9-9c9a-7f27333dbbcf","resolution":{"observed_at":"2026-05-25T08:15:34.350491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smil: Multimodal learning with severely missing modality","venue":null,"work_id":"2f1d62e4-db2c-4395-9f7f-922ac24f5928","year":2021},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:490ac557131bee18f023b6cde83cb9af7df73fb4f8348894edbcdf49dd0d75f0","observation_id":"81e53b55-8c3e-4c3c-b416-2906b9dfbca7","resolution":{"observed_at":"2026-05-25T08:15:34.347406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are multi- modal transformers robust to missing modality?","venue":null,"work_id":"75592f6a-861a-47a3-8c2d-d338036ee1b3","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f25b7ade111b7ed4ecade0c8f7c3093536b1cb8128351675f0868dcf2fb518b2","observation_id":"f3fcc976-2e50-4d47-9ccd-826cc65c5303","resolution":{"observed_at":"2026-05-25T08:15:34.356540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3care: Learning with missing modalities in multimodal healthcare data","venue":null,"work_id":"ff9d4d78-a8d1-4e35-b7a2-095a55e51119","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:b73633f79108f3db18d7c4b9cca44ae5d956be3812f13225e8103109f7d074da","observation_id":"591521bb-543d-4aaf-93cd-b1ef47aaa961","resolution":{"observed_at":"2026-05-25T08:15:34.359418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:9d4c30e362f8cf699025e603b3e46a8141dc458058ed98a82ddf76a130660b73","observation_id":"3591e894-f0cd-4280-8dc1-cc4a2518090c","resolution":{"observed_at":"2026-05-25T08:15:33.594782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:1351bb9a2779e289a3c87216763ca900f7a27b8050f30fdbb9327fea9193fe38","observation_id":"8aa2407d-110a-40d5-bafe-800413dd2d33","resolution":{"observed_at":"2026-05-25T08:15:33.665515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:a5e25f1b947477129fc0562172441b2077a8e20c99c055e725765c921298e70e","observation_id":"92f9d9f1-1d00-4d5d-97b5-8a65d31f697a","resolution":{"observed_at":"2026-05-25T08:15:33.604957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:39ebba9c40524a5cd1da772c984029d398895e4c06cbb6e07715bbdb217015ef","observation_id":"e35e6e17-188b-4144-bb42-4ec1b804f7d4","resolution":{"observed_at":"2026-05-25T08:15:33.550886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:18fe50e56ba70d43e8d79cfd5581bed8d6363f74a518558a748f3e1baa851b35","observation_id":"f1f84e6f-9410-43e2-b209-f4aca9e639ee","resolution":{"observed_at":"2026-05-25T08:15:33.522975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge bridger: Towards training-free missing multi-modality completion","venue":null,"work_id":"ad235034-1ac0-4e58-9fde-c66e7c5c9c36","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:3de1cc05f9aa2dcc482fe828f651788acc712efe58b440384954eb24cc4309fe","observation_id":"e7634bad-bdd2-4147-a13f-7b1be3b9624e","resolution":{"observed_at":"2026-05-25T08:15:34.270048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"a1e8cd85-50ba-4175-9794-904c9bb56c74","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:388beb75a6a444b2c93f1e37be2ad5023668849960c4a1d2f7ae69b5dd4417b3","observation_id":"562bb69e-53cd-4995-9c54-67d5ce617449","resolution":{"observed_at":"2026-05-25T08:15:34.263553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen- erative adversarial text to image synthesis","venue":null,"work_id":"b1846ed4-e90a-427e-a1fc-531c5a15b1d9","year":2016},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:a072e7f15a78d141b14e301e5017d6ec4c0b5a78b2dfe265eb1bab22fc9fe1ca","observation_id":"17e81f9e-19e0-4059-a506-e41c56fb8682","resolution":{"observed_at":"2026-05-25T08:15:34.328704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:5f5a1bc23adef2b4add0d1f0387cd858358d7d83bbdf41b7ed9f550938ee6132","observation_id":"81165763-dabb-4b4d-83fd-5a059ea595bf","resolution":{"observed_at":"2026-05-25T08:15:33.528489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:d4c4e0fd5ff70611c2da658e33217e686bffa167c05d2b669bb8449ce853bec9","observation_id":"fbe66dd3-b9f1-4061-9032-6aedf59e49c6","resolution":{"observed_at":"2026-05-25T08:15:33.614999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:a6ee8d626f7e840560d487c3552ab7a9112bbf37c4d08767e48c57983a3363f0","observation_id":"833355d6-6bc7-45e7-b768-abac05b45178","resolution":{"observed_at":"2026-05-25T08:15:33.620840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"2765a871-a329-4adb-8a01-64feea47a40f","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:6ab23227d79ea7a9ea49a9660cbceac8726b5a7133459b9ca8c62ab2cd803594","observation_id":"23d4d13f-90ac-4812-8a5d-2f401024cf76","resolution":{"observed_at":"2026-05-25T08:15:34.324136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T23:05:47.958732Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":"2501.13926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-07-04T16:39:58.175257Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":"42bc4633-5505-4914-a32c-2e3d11cc6e03","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f68e07d56470551b97ec20d620da6bd4eb0caa984f7c053ec989e3d5a88dd4ae","observation_id":"f932e840-318a-45e1-9f6f-875b17f5d0a0","resolution":{"observed_at":"2026-05-25T08:15:33.584502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01731","last_updated":"2024-10-02T16:43:24Z","snapshot_observed_at":"2026-08-09T17:32:59.316985Z","submitted_at":"2024-10-02T16:43:24Z","title":"ComfyGen: Prompt-Adaptive Workflows for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2410.01731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01731","snapshot_observed_at":"2026-07-03T14:28:31.261162Z","title":"Comfygen: Prompt-adaptive workflows for text-to-image generation","venue":null,"work_id":"fb86e3b9-8bd3-4016-a26c-f3df819b3a40","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2410.01731","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:9201fdab64d3c1e5a57bc93b8988154b873da53969a5faa6927b12aa45e8bfb7","observation_id":"a8431434-d89a-4f89-a59b-cb58546d02bf","resolution":{"observed_at":"2026-05-25T08:15:33.648556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24320","last_updated":"2025-08-08T17:55:21Z","snapshot_observed_at":"2026-08-07T16:20:09.360188Z","submitted_at":"2025-03-31T17:07:37Z","title":"Can Test-Time Scaling Improve World Foundation Model?","version":2},"cited_work":{"arxiv_id":"2503.24320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.24320","snapshot_observed_at":"2026-07-02T21:37:25.371752Z","title":"Can test-time scaling improve world foundation model?","venue":null,"work_id":"a13d4c17-162e-4977-a813-3d09b2a69e34","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2503.24320","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:e2bb433b49b40230b0e82afe9ed2eb581c0ebd146e612c65d6e853d866999598","observation_id":"27f16c1e-7fa0-443d-966b-2e4399a6cbc5","resolution":{"observed_at":"2026-05-25T08:15:33.660335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training strategies to handle missing modalities for audio-visual expression recognition","venue":null,"work_id":"d1afdcf9-b6dd-43d3-901d-4c38c7cfb06a","year":2020},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:52780c978ca6c7a00824f209ae76e671795c201ddcd4b6abced99fddf81b6d11","observation_id":"f7291bbb-a83d-484b-94ec-91c2c5f66080","resolution":{"observed_at":"2026-05-25T08:15:34.338503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep partial multi-view learning","venue":null,"work_id":"70c37357-ec0e-40ed-a4d9-862593d23661","year":2020},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:69a00c2804393ac627c1ac747f17bc95898f0c78394090190d282fd3a96bc7c4","observation_id":"98f8b18d-b2f3-4f45-9aef-4ecb947d9439","resolution":{"observed_at":"2026-05-25T08:15:34.377044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal learning with missing modality via shared-specific feature modelling","venue":null,"work_id":"ba81a011-2fe7-4f41-8168-e29c7b6e72db","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:8f0687366bda31a94f0e7a8fc0af7bbb07613ee343261a6847438bc77fea57ae","observation_id":"6aac7bab-27d2-41cc-be8f-d7806573f6e7","resolution":{"observed_at":"2026-05-25T08:15:34.282399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gcnet: Graph completion network for incomplete multimodal learning in conversation","venue":null,"work_id":"d70fb081-e10f-4702-9650-3d0ea8e6ff20","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:e47ed65c02d7343005dba75315dd2f9def6108d518db104409d4d43be798ae32","observation_id":"1306f14e-3cf1-4765-9f3f-1fb0693173d1","resolution":{"observed_at":"2026-05-25T08:15:34.369954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Found in translation: Learning robust joint representations by cyclic translations between modalities","venue":null,"work_id":"409697c5-7c84-40bf-8eaf-9be887cd6252","year":2019},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:b5a77952ddd4b3cb53d5256f848251a10c0a84845e430281398651ca7901f942","observation_id":"2ef93831-50f4-415e-85ec-907762700387","resolution":{"observed_at":"2026-05-25T08:15:34.253795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal prompting with missing modalities for visual recognition","venue":null,"work_id":"9bb83426-3c08-46f4-9ad4-7d90ace1bcc9","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:9377eae49d82cbef74bceb480d41ddcd38b0201ec8ffd36b024740ae741d1ebb","observation_id":"e8c84306-a58c-4762-9674-9b57a8f996fd","resolution":{"observed_at":"2026-05-25T08:15:34.279547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal prompt learning with missing modalities for sentiment analysis and emotion recognition","venue":null,"work_id":"90717dcd-9aa9-4c08-90d7-667de80e48fc","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:6c929c029a7195233dffc81dd7af8b8bb822935c0859c58fb25e8d1b5e5cf6dd","observation_id":"add58491-431b-4211-8890-da59ada4d926","resolution":{"observed_at":"2026-05-25T08:15:34.276382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal modality- masked diffusion network for brain mri synthesis with random modality missing","venue":null,"work_id":"0d0e6fec-4c34-4ebf-b6cd-dbcc54cd6710","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:88c381fb940fd69a67923a96b4f5026f55153fc6888416e5df988976a72d9ab2","observation_id":"e2f4b396-b82b-48c6-a569-c625b56b0796","resolution":{"observed_at":"2026-05-25T08:15:34.260754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fgc2f-udiff: Frequency-guided and coarse-to-fine unified diffusion model for multi-modality missing mri synthesis","venue":null,"work_id":"5271eb17-1adf-4165-8b3d-bba5a3be6a23","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:42e27177af1dbae90c82fc46d8dc9daaf23617906fcb0c90eb8c123cf858d3cf","observation_id":"b2101404-ec82-4372-8f1a-70f9e1900ce0","resolution":{"observed_at":"2026-05-25T08:15:34.266966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:6a7ec69c37ba280e3902a55cfba90988633d819834141e96153c5d0c5370a75d","observation_id":"be771c8c-aed5-4680-a4db-49327325439f","resolution":{"observed_at":"2026-05-25T08:15:33.496917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:6eedffdc88acb89a5f50ccd40e4b80155aee3d200f316f023b347c0629f31ee3","observation_id":"1db78713-cf77-4beb-bd20-28d49d14a03a","resolution":{"observed_at":"2026-05-25T08:15:33.504117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"217af806-8020-42d0-8ce2-31e6b8393154","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:280bfac80932a5db35e3c63eae2dd0fa6624dcd631cc018d0ea352906ea9d222","observation_id":"75032a97-bd9b-4ea7-bcdd-07c71ed1b506","resolution":{"observed_at":"2026-05-25T08:15:34.239329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable audio open","venue":null,"work_id":"054697ce-9257-4d33-af9b-7f207ffa44bd","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:153dfd69786911d2d2029aeaeeba829f21f9199fc8eb8cbe8ada4f7f8b33b3f3","observation_id":"a5eeaf16-9350-4e60-8ff0-3ee6c0751137","resolution":{"observed_at":"2026-05-25T08:15:34.243247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":"0608976b-970b-46d8-a3cf-1ea24c30f400","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:da5e7515d77116fa8ae1d704ff763e046c3943c5fa3728a16ac9a8354b07b83b","observation_id":"8697f9f9-c670-42f7-a4ab-c026daef522a","resolution":{"observed_at":"2026-05-25T08:15:34.250134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"c657492a-64d7-4a2a-959a-f02240457720","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:dbbc017e18e1bc33e6d727b844a496621c6c6386d4fab50d79de6c49f96b10b9","observation_id":"dcc7b4c1-f8da-40f1-b550-492ab4deecfc","resolution":{"observed_at":"2026-05-25T08:15:34.246576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial networks","venue":null,"work_id":"5e80516f-445b-4f1b-a2cf-089f106140eb","year":2020},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:0a6e04b9765078e7ce8aa62bca6cd1ce006cc008fd82befac79859023caa73cf","observation_id":"a32b42bb-0b00-453e-8f43-b79ace42a4fc","resolution":{"observed_at":"2026-05-25T08:15:34.257087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-08-12T18:51:00.108451Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":"1411.1784","doi":"10.48550/arxiv.1411.1784","metadata_source":"pith","pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conditional Generative Adversarial Nets","venue":"cs.LG","work_id":"1d3bbf10-6268-4cc1-9702-27df9208c6af","year":2014},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:be11440d389df2fbc8cc35c84fc650b9ae30b4a9634e9861aa182d96938d3b54","observation_id":"1fb165c4-dc5e-4ef8-814c-6a963cfa0674","resolution":{"observed_at":"2026-05-25T08:15:33.556236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":"1809.11096","doi":"10.48550/arxiv.1809.11096","metadata_source":"pith","pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","venue":"cs.LG","work_id":"244e6f06-bad2-4f34-8186-ff370286427f","year":2018},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:fe8fed11efed49891af93464b7dc30d9e9d926aeb513cd28c9d30dc1e2584b80","observation_id":"305dd6a6-685e-4c9b-be12-83fff1068f11","resolution":{"observed_at":"2026-05-25T08:15:33.573334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-02T12:08:12.712369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T12:08:12.712369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:1483567e57b83a4c5917465f944d66e1eed8f1910684d6fdaef629f5c1f23908","observation_id":"c7b0bb86-372f-48cf-9581-89151f26efe8","resolution":{"observed_at":"2026-05-25T08:15:33.589795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12840","last_updated":"2025-01-22T12:29:33Z","snapshot_observed_at":"2026-08-10T16:41:33.222202Z","submitted_at":"2025-01-22T12:29:33Z","title":"AMM-Diff: Adaptive Multi-Modality Diffusion Network for Missing Modality Imputation","version":1},"cited_work":{"arxiv_id":"2501.12840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amm- diff: Adaptive multi-modality diffusion network for missing modality imputation","venue":null,"work_id":"b4a58eb4-2f7b-45cc-b7c1-a436de262a61","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2501.12840","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:2d761aa4221b04ed904f65e5c7e1f5b7374caa95ba6e158cf146a2e608081774","observation_id":"c4843018-e672-42d7-9409-4c395484750c","resolution":{"observed_at":"2026-05-25T08:15:33.534464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00467","last_updated":"2023-07-02T03:49:47Z","snapshot_observed_at":"2026-08-12T08:44:35.803417Z","submitted_at":"2023-07-02T03:49:47Z","title":"MissDiff: Training Diffusion Models on Tabular Data with Missing Values","version":1},"cited_work":{"arxiv_id":"2307.00467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00467","snapshot_observed_at":"2026-07-02T06:56:44.796420Z","title":"Missdiff: Training dif- fusion models on tabular data with missing values","venue":null,"work_id":"283a6adc-60d8-4b48-93ce-3b7190cc6343","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2307.00467","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:426e44105ec448fda840780065fddea2e52f8b62e9f35bc96e98d218f0c2cc83","observation_id":"b5d2ff7b-b71d-42b3-91a3-db5ebee5e88e","resolution":{"observed_at":"2026-05-25T08:15:33.654661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating with fairness: A modality-diffused counterfactual framework for incomplete multimodal recommendations","venue":null,"work_id":"d3d7e2f3-8453-4b21-980c-1ec2a5c1501f","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:7dd6356cf4d4fae1317969464fc9c21ec139fefb01bf10973400088b57f7fecb","observation_id":"b908170d-de34-46b1-ab09-f6274f8d5e66","resolution":{"observed_at":"2026-05-25T08:15:34.366335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-08-12T12:11:22.336410Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"cited_work":{"arxiv_id":"2401.03568","doi":"10.48550/arxiv.2401.03568","metadata_source":"pith","pith_arxiv_id":"2401.03568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","venue":"cs.AI","work_id":"7469e3ce-613c-4298-9d5f-ab2526320c8a","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2401.03568","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:c4d3ac9062a02879f6fbac6d4fdc172d5c0ed2a8d7e7ba6dea0998e9510f5609","observation_id":"11215dfd-8e4d-494a-8f0b-3799655c7a20","resolution":{"observed_at":"2026-05-25T08:15:33.517689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08164","last_updated":"2024-10-10T17:43:51Z","snapshot_observed_at":"2026-08-12T00:09:38.678785Z","submitted_at":"2024-10-10T17:43:51Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","version":1},"cited_work":{"arxiv_id":"2410.08164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08164","snapshot_observed_at":"2026-07-03T16:08:37.200822Z","title":"Agent s: An open agentic framework that uses computers like a human","venue":null,"work_id":"743d8ba1-e742-4bc5-9035-81021a53b57a","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2410.08164","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:7ef362793009ba38c1ee0fdc9aa66b43bda6cd08f0e523db4f5884582662cfda","observation_id":"ade6246f-7ee3-4cc8-be8f-f7db2bcb9ff6","resolution":{"observed_at":"2026-05-25T08:15:33.636785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16150","last_updated":"2026-03-27T07:41:10Z","snapshot_observed_at":"2026-08-02T22:37:46.736145Z","submitted_at":"2025-01-27T15:44:02Z","title":"A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions","version":3},"cited_work":{"arxiv_id":"2501.16150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16150","snapshot_observed_at":"2026-07-04T03:09:28.710220Z","title":"A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions","venue":"cs.AI","work_id":"fcc1bceb-335d-4236-be5f-8ded6c3e1131","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2501.16150","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:53b2cfb1beffcc6076caabb6d050350c09f3f65b5ee9f0ff798d223d6837b808","observation_id":"43924d15-bd65-4640-85e1-d15346248ae5","resolution":{"observed_at":"2026-05-25T08:15:33.561913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16257","last_updated":"2023-12-29T15:36:05Z","snapshot_observed_at":"2026-08-12T08:03:28.227112Z","submitted_at":"2022-10-28T16:47:03Z","title":"Solving Math Word Problems via Cooperative Reasoning induced Language Models","version":5},"cited_work":{"arxiv_id":"2210.16257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.16257","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving math word problems via cooperative reasoning induced language models","venue":null,"work_id":"c9109e86-09ca-4144-9c37-a4f9521fa2f7","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2210.16257","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:a2c5ec722a4742b4c6daa3d8b7026f9b8706b87f8da076e1e9bbb095a2397b55","observation_id":"ff716df3-c2ac-4cf8-b95c-34098fcf9d58","resolution":{"observed_at":"2026-05-25T08:15:33.539621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-01T16:20:31.337598Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":"2305.19118","doi":"10.48550/arxiv.2305.19118","metadata_source":"pith","pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","venue":"cs.CL","work_id":"920bbf2b-e5b9-4d6e-a597-b82621d19ef9","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f400b24a2c626fb82259c9ff2c2e4ade9b8b4495a12913a560159813cc80ef16","observation_id":"ec7f7ddf-16f5-487e-94fa-ebd976594f1a","resolution":{"observed_at":"2026-05-25T08:15:33.545142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":"2312.08935","doi":"10.48550/arxiv.2312.08935","metadata_source":"pith","pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":"cs.AI","work_id":"fb547990-d48e-4ba3-a047-af1e506e8290","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:b70de5b7e6fa50f65c5ab1c2e911bb7cc27d4222726ebf8303abb64659cfe5bf","observation_id":"b8aa8cf8-10d0-488f-929d-34fe3433ce68","resolution":{"observed_at":"2026-05-25T08:15:33.600135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13767","doi":"10.48550/arxiv.2502.13767","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agen- tic ai software engineer: Programming with trust","venue":"ArXiv.org","work_id":"96c6c7a4-a28d-4fdd-ae51-181d7614161c","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:298a545152446b89e74e8b0aeeef55cb2312a3c1adc9d07e64e850f27266b1dc","observation_id":"02427c67-1d3e-47fe-9033-d3a9a90df43a","resolution":{"observed_at":"2026-05-25T08:15:33.610573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01768","last_updated":"2024-08-03T12:35:30Z","snapshot_observed_at":"2026-08-10T10:29:12.802509Z","submitted_at":"2024-08-03T12:35:30Z","title":"Building Living Software Systems with Generative & Agentic AI","version":1},"cited_work":{"arxiv_id":"2408.01768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.01768","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building living software systems with generative & agentic ai","venue":null,"work_id":"ee37fc7f-1bbf-4ff8-88c2-217c73679549","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2408.01768","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:5065eb8d7d223436095f67b026345b7a3c4e04a04b83ea86c18678f0f1629287","observation_id":"6a9032a2-fc2d-42b3-80f4-9d213b3ca745","resolution":{"observed_at":"2026-05-25T08:15:33.672103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"3211959c-3867-4ad1-8048-c0dde16969ec","year":2023},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:394b6d8db58a5ba12efda50e3970e682d837cc0ef49d002124610f79f483ed8e","observation_id":"067affa2-1d29-4a23-964a-b00040c00145","resolution":{"observed_at":"2026-05-25T08:15:34.331945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":"31f60272-0b24-486a-92fc-dc1180caa1f7","year":null},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:c920827fecafd8157391a5a3cb130da39fa544af693f1bb856f2941f67400b9f","observation_id":"4afbdc9a-44cf-48ed-9cd9-0edbd520751f","resolution":{"observed_at":"2026-05-25T08:15:34.321206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Navgpt: Explicit reasoning in vision- and-language navigation with large language models","venue":null,"work_id":"9bc77664-a041-4eb3-b178-f041bc99e415","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f6e7573b7e0db04770997e4928f84ed32b42bdabd6786d05776909ada7481507","observation_id":"dfdc6810-ce1a-4bac-8552-d320aa651c67","resolution":{"observed_at":"2026-05-25T08:15:34.317472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-12T16:21:20.114613Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2411.13451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-07-01T19:36:08.845862Z","title":"Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations","venue":null,"work_id":"8dba372a-b244-4199-a234-d20a9d4e8875","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:1394eedf9ec706b7f7025cbcdf2af566a6112e099546fff09b1c9e1f1c154b79","observation_id":"0ab2517b-68f6-48ab-8557-ccb0ef8e018c","resolution":{"observed_at":"2026-05-25T08:15:33.568089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"d2521a81-5d24-405b-849c-15b0365eb980","year":null},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:eba374e298180484b1a96c4fae2c00467e9bbcd179c0bfb53ba959fa6f9457f5","observation_id":"77770db0-3625-4086-b62b-52bdcb2715db","resolution":{"observed_at":"2026-05-25T08:15:34.306921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as- a-judge with vision-language benchmark","venue":null,"work_id":"82b8de55-d0bf-4a34-83e0-e2c48a70d6cd","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f613ad4aa97bfef36dd5b421c70e7bcadc4a03747d590170d68c68e978043f6e","observation_id":"75e366fe-e82b-49f6-8c59-fead979f0204","resolution":{"observed_at":"2026-05-25T08:15:34.310084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:326de4cc8de8aa7c1805e0e729e4029084e8bae0f187e6deaac70723fe9d7e2f","observation_id":"f7d87118-9734-4b47-8731-438c378ff97d","resolution":{"observed_at":"2026-05-25T08:15:33.631601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vggsound: A large- scale audio-visual dataset","venue":null,"work_id":"ecdc0a7c-9107-4e72-9488-8dc39b1a8b92","year":2020},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:276a4af6213d9e8db6a66f503606912fd3955b1fe01b43909c0f053a9b9df756","observation_id":"1029e453-ebe7-4fbd-8816-ed5d7afdc1e8","resolution":{"observed_at":"2026-05-25T08:15:34.313701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"e3520acf-246c-466f-be1e-8e1e6eb0b6d0","year":2016},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:14c03a450e22da787f5ab16ed093416009b41eea90e409329f129de43480fb1d","observation_id":"f1565391-2e04-4d59-bfa7-93f57bfb3891","resolution":{"observed_at":"2026-05-25T08:15:34.303333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"495e9230-fadc-4557-8477-7a6b6979fc1a","year":2019},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f198efe25ea9dcd80381624b35dcba183015fa1f5e37372cf2c42d92b77f7b0c","observation_id":"35213dd1-9ad4-4139-83f4-d7a39c585e8d","resolution":{"observed_at":"2026-05-25T08:15:34.296622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"7c3b72ae-9b40-42fb-b7fb-0b66e6e68cff","year":2014},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:470f8533ed7276ac6524d1ffd1cbc7cbc6927948941849bc45de070716e1aa23","observation_id":"8910431c-8771-455b-826f-e19084f1d670","resolution":{"observed_at":"2026-05-25T08:15:34.353293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"3ba170d8-2d04-4164-95a0-966466c2a4bf","year":null},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:e8ac2990da39cc2217236bdf8a1995808a07b7dde4118ec155d930bb7da252cc","observation_id":"9ab16854-af37-4199-bba3-7fc35cfd0d89","resolution":{"observed_at":"2026-05-25T08:15:34.286120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"18180eaa-f989-497f-8952-7d77030dadb4","year":2021},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:f09b8dcf944aa23579d346459b0f450b4c3d68e7a3a41b1a5cce7ff5e9222530","observation_id":"aa6201c1-5006-4f59-a19a-3b9d15bd1357","resolution":{"observed_at":"2026-05-25T08:15:34.289728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From wer and ril to mer and wil: improved evaluation measures for connected speech recognition","venue":null,"work_id":"01124c1e-0f54-4d3b-b462-8877e91d29fe","year":2004},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:82fdfb42e1b83cdd0f9108d4e779da98f9e4224e6f695598f95bd1bc6aaa0e39","observation_id":"d19118ca-92d3-48ff-bcc1-dade5239dcd9","resolution":{"observed_at":"2026-05-25T08:15:34.373650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tasnet: time-domain audio separation network for real-time, single-channel speech separation","venue":null,"work_id":"0d54cf6e-83aa-4f63-a13a-f6b75ea8a540","year":2018},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:84f434f29aac743b2613604e4ba6b4dcba4686a2d26b6b5e5c3996267e3375e6","observation_id":"e5dba6e3-7d84-4d71-a510-1bf3c92c8645","resolution":{"observed_at":"2026-05-25T08:15:34.341761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceptual evaluation of speech quality (pesq): An objective method for end-to-end speech quality assessment of narrow- band telephone networks and speech codecs","venue":null,"work_id":"f8a8c55d-ee7c-4ef9-a42f-76be496c634a","year":2001},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:ebb4873d205bf5e4a174b4621931ce0377bf968e0dfc93b2289c6fb604646c63","observation_id":"b4a385fd-9de8-4333-824e-2fc364433eb1","resolution":{"observed_at":"2026-05-25T08:15:34.273499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-08-10T14:37:54.210693Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":"2404.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-01T10:45:42.828782Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"3f19fa45-10d0-4103-80da-d9d6278e0a38","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:6e8cf216432c1076cd9fdc0d2ed67871f74e467a11a85f31262dbe8f9711d1ca","observation_id":"42014936-3b41-4833-9fdf-6179158f65fc","resolution":{"observed_at":"2026-05-25T08:15:33.642335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:db9fd3dd6aff7f4b7c7b5c98e06f7f7759fc30a8bb655f811af22733cd858e1d","observation_id":"a784138f-fbcc-4a56-80a8-9d14f20a69fe","resolution":{"observed_at":"2026-05-25T08:15:33.578871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:9d66e62882d9120a3f9f7e577b95de5fe7c7dc9799f0b9680e64f194d1ac0633","observation_id":"f7dccf6c-b24b-4b1b-b01d-b5acb5812876","resolution":{"observed_at":"2026-05-25T08:15:33.509920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"a7b80e68-2808-45ef-82f1-4787e3d6d18e","year":2022},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:c2e692837b179172427bd420bb8886d929c9a30f5d8038a95cdc55e8053772b9","observation_id":"8b3a0c79-3445-43f2-a813-5c2e0971c014","resolution":{"observed_at":"2026-05-25T08:15:34.344679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:02e4a6e10ace26b358a27c0391e982629c65c1344548ef4b80a3452e6ddf5b6f","observation_id":"c1fd2402-f37d-4ebd-a6aa-821fb6e344ea","resolution":{"observed_at":"2026-05-25T08:15:33.625897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","latest_version":3,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-01T13:49:24.957131Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":32,"verified_fuzzy":37},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2506.03530."}