{"as_of":"2026-08-08T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bd82d8881c8f48ac51b114b4d77b85c21f772bfa02bf32fcbd3170b1623cfc7","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:36:56.237018Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04788/citation-record","integrity":"/paper/2506.04788/integrity","json":"/paper/2506.04788/citation-record.json","paper":"/paper/2506.04788"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:36:56.180523Z","title":"InMachine Learning for Health, ML4H@NeurIPS 2023, 10 December 2023, New Or- leans, Louisiana, USA, volume 225 ofProceedings of Machine Learning Research, pages 353–367","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.180523Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:4d136481e57a83d5ae2aa783d2fde07a9bfe340db6932fe4f1e2b0e350b42cf3","observation_id":"426e823d-bf67-4157-8c7e-5a3c82d199f3","resolution":{"observed_at":"2026-08-07T10:36:56.180523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T10:36:56.191276Z","title":"In2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 13052– 13062, Seattle, W A, USA","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.191276Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:2f0745b8aa9da9471105bf930de25c9db60fda769d2488636074047f2b18dd7c","observation_id":"eded0f9a-9741-4aa3-b944-1b04c6b765ce","resolution":{"observed_at":"2026-08-07T10:36:56.191276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:56.749167Z","title":"InIEEE/CVF Confer- ence on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16-22, 2024, pages 15120–15130","venue":null,"work_id":"f2eb3bb3-9b24-42b0-98cb-8b24e22615e0","year":2024},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.196880Z"},"links":{"citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:bcf074d134f981fffae679c6131ec2e41b1c8dd7852961963636907b4106780a","observation_id":"500868d0-b501-4c3c-965b-4714d8c7625b","resolution":{"observed_at":"2026-08-07T10:36:56.754264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14539","last_updated":"2023-10-10T22:17:17Z","snapshot_observed_at":"2026-07-06T15:59:03.095461Z","submitted_at":"2023-07-26T23:11:15Z","title":"Jailbreak in pieces: Compositional Adversarial Attacks on Multi-Modal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14539","snapshot_observed_at":"2026-08-07T10:36:56.201686Z","title":"Shukang Yin, Chaoyou Fu, Sirui Zhao, Ke Li, Xing Sun, Tong Xu, and Enhong Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.201686Z"},"links":{"cited_paper":"/paper/2307.14539","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:9d810142f0b4d1fd1fcd66136baf42fcebd7d0642c6c4d249dc06f6460657d04","observation_id":"935f29c8-819d-44e0-9ed8-0b5acf5b550a","resolution":{"observed_at":"2026-08-07T10:36:56.201686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:56.212001Z","title":"Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, and Chao Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.212001Z"},"links":{"citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:e8a176efbdc3c452e48b0043b3b6d1eb566e558fe018e08441ea64f866bb5182","observation_id":"7d6180a7-6901-41b0-a5dc-fbc53b65ccf8","resolution":{"observed_at":"2026-08-07T10:36:56.212001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T10:36:56.216528Z","title":"Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean- Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.216528Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:e10dfa411213229b07816bcd598201284cae66c30b57221ff85442264f69a180","observation_id":"0f0e7a96-b62c-437c-9140-88118de914b4","resolution":{"observed_at":"2026-08-07T10:36:56.216528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T10:36:56.221847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.221847Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:3b487395d730e3daf5a738dbb6d9cd6584a6c4b17bf192de676a4ed36de3edd3","observation_id":"3514720f-5be1-4c11-a1c7-5f55dd0e539f","resolution":{"observed_at":"2026-08-07T10:36:56.221847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:56.226890Z","title":"Wenhai Wang, Zhe Chen, Xiaokang Chen, Jiannan Wu, Xizhou Zhu, Gang Zeng, Ping Luo, Tong Lu, Jie Zhou, Yu Qiao, and Jifeng Dai","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.226890Z"},"links":{"citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:5de10edd508145b74e7657771924ec6b95ed591f9ed0f2597ce6a91b6975af9e","observation_id":"21ca545f-01e0-475d-80f4-ac9c32598554","resolution":{"observed_at":"2026-08-07T10:36:56.226890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-07-06T17:20:00.101661Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-07T10:36:56.232186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.232186Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:f2063735e3d995b75e82a5a35083c6e0148582c881f73cd787e6390ac4802328","observation_id":"67d5af40-f86a-4030-a61a-90de85db71b9","resolution":{"observed_at":"2026-08-07T10:36:56.232186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:36:56.732753Z","title":null,"venue":null,"work_id":"fa6ddc26-9976-4343-a0cd-90b9a753680e","year":2023},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.237018Z"},"links":{"citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:1aca321aeb3b68f9065c96fc3c9d89e46b7ceb77c7eb2271f40b719a3e6f78e1","observation_id":"8d7b984d-99c0-441e-ba9a-dbb4663cdf44","resolution":{"observed_at":"2026-08-07T10:36:56.738577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:36:56.173390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.173390Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:7fcd728fc88be06939209f3d9fbaced1285413a6543e3eb30760f5871ebcfed3","observation_id":"48eff9f7-c9bc-4a51-b885-8cc48c7e8ec1","resolution":{"observed_at":"2026-08-07T10:36:56.173390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-07T23:02:57.475253Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-07T10:36:56.185722Z","title":"Artemis Panagopoulou, Le Xue, Ning Yu, Junnan Li, Dongxu Li, Shafiq Joty, Ran Xu, Silvio Savarese, Caiming Xiong, and Juan Carlos Niebles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.185722Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:94cd9ab6e14dc7ce3fe83ba90710e7bc5c1aa4beda54d323f89d87e308d16b59","observation_id":"3e11c5f6-141d-4a64-b401-f753d12fb7db","resolution":{"observed_at":"2026-08-07T10:36:56.185722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-08-07T10:36:56.207237Z","title":"Preprint, arXiv:2311.07594","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.207237Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:d02e89c6cd79920b15821e641f25ffda0656408d3b9931f03948c759220a6ab2","observation_id":"d8a8afa8-b18b-4ba7-93ce-417e3287ed56","resolution":{"observed_at":"2026-08-07T10:36:56.207237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:03:27.148968Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.04788."}