{"as_of":"2026-08-02T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:477e65d036b0861ea12926366b23afe3ae046b8d259ff71061241f2744e696b0","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T22:47:09.500229Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:24:17.633259Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-01T18:16:15.623592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"cited_work":{"arxiv_id":"2503.23733","doi":"10.48550/arxiv.2503.23733","metadata_source":"pith","pith_arxiv_id":"2503.23733","snapshot_observed_at":"2026-08-01T18:16:15.623592Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","venue":"cs.CL","work_id":"887e6dd8-2188-4bb1-a265-cea643bd784b","year":2025},"citing_paper":{"arxiv_id":"2607.18026","last_updated":"2026-07-20T14:58:53Z","snapshot_observed_at":"2026-08-01T16:24:13.385550Z","submitted_at":"2026-07-20T14:58:53Z","title":"Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T16:24:17.633259Z"},"links":{"cited_paper":"/paper/2503.23733","citing_paper":"/paper/2607.18026"},"observation_digest":"sha256:f3c463fbb1b42f0f617646c4b896a2eb7a0a2519e74b4dcceb5e2d16fddc0129","observation_id":"b953f338-90a0-467f-9b43-0ba5adb2c7c0","resolution":{"observed_at":"2026-08-01T16:28:38.980406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.23733/citation-record","integrity":"/paper/2503.23733/integrity","json":"/paper/2503.23733/citation-record.json","paper":"/paper/2503.23733"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model composition for multimodal large language models","venue":null,"work_id":"f6025123-f97a-4327-aa8e-35e5b28ae6d2","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:e2467f2e44cb6e7b3a2bf5e65f23c25f97b7f223e1097298a1d848af73ea910c","observation_id":"82e4d519-b3cd-4177-9bd5-294ff76d67a4","resolution":{"observed_at":"2026-05-22T22:47:13.715269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:a283c84ee01ce1ecf1b038015740dcacb83b97d8b236edbada10d54e845ec86a","observation_id":"7329112e-3775-44ca-9fb1-2e88d6b4ebda","resolution":{"observed_at":"2026-05-22T22:47:12.992624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"314ec2f0-017f-41e7-89a5-6b4df6916c88","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:161b985210ed9f7081379c5d4f64626738ab60a044eee75529d89da565d1f803","observation_id":"c7d65c77-bfd0-477b-832c-baf1a767b69e","resolution":{"observed_at":"2026-05-22T22:47:13.740388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open llm leaderboard v2","venue":null,"work_id":"b0b5aa7b-718d-47f8-aec9-93ff8f9b8c6e","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:29a7a0e7b5263627620a52ff8577e9ea859d9f101d07eb0ec1b019397214751e","observation_id":"a94917f3-a105-4b4a-8666-92e62bd52667","resolution":{"observed_at":"2026-05-22T22:47:13.731162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:c0b8bb2b49b258908a77b25fd441d260f11d0de0085f148faad821470a1a92da","observation_id":"dcc21b0b-6df2-42b4-9700-8a40762306f8","resolution":{"observed_at":"2026-05-22T22:47:13.051119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-02T11:25:49.310871Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":"2403.13257","doi":"10.48550/arxiv.2403.13257","metadata_source":"pith","pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-07-10T08:06:57.506551Z","title":"Arcee’s mergekit: A toolkit for merging large language models","venue":"cs.CL","work_id":"be216e9a-b2e1-4485-ba14-f8bbed2b7aa7","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:5579a71b460c39afffbc76cb5fcaab7f3968abbc250baa551215b84df5df46b7","observation_id":"884112f5-272d-4b8c-b1bb-14c493c604eb","resolution":{"observed_at":"2026-05-22T22:47:13.022569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.882707+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.882707+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"9bcd89bb-8634-4b96-9608-07fe523cfd2a","year":2018},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:8812a4e76881571ca368730b6235014c21f30f635b9a82204f1057f68d17a2ee","observation_id":"c5df0ac0-9014-4138-9d89-0905bc5c14d3","resolution":{"observed_at":"2026-05-22T22:47:13.785828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":"2408.16500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-07-08T05:34:32.402425Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","venue":"cs.CV","work_id":"4cd1db02-57ee-4017-9bf2-b9df24e0f9a9","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:58a110333314994d41b839bb2f135c15917d137817b3ac262a617559bea14290","observation_id":"41cec851-faf3-49cf-b7bf-c6f8af1032d0","resolution":{"observed_at":"2026-05-22T22:47:13.016745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"a5810524-7f95-4b4a-9b7d-f8da482ebc20","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:716b98feb278f5632b4bdeb72f567934d3af00697dbcc68cdded90f55f3110b1","observation_id":"d20748b5-2538-45d9-8b50-325555e13912","resolution":{"observed_at":"2026-05-22T22:47:13.726684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":"2212.04089","doi":"10.48550/arxiv.2212.04089","metadata_source":"pith","pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-07-10T16:57:24.575602Z","title":"Editing Models with Task Arithmetic","venue":"cs.LG","work_id":"28899541-90d9-4f1f-b938-8b0f6410c843","year":2022},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:8628014c962a4d68703ad17dfbed32752560fc1343916c9791e067ab8b39faa9","observation_id":"82640ac1-ffbd-4479-a5da-c8bde8f070f8","resolution":{"observed_at":"2026-05-22T22:47:13.005216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":"57762d23-931b-457c-81a3-4d3beea44293","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:e9f7fee184cce9ef93b7750249b6f4a4ea220112752deb849e61cc6f8ae56db3","observation_id":"13cfe3bf-7d2b-4ebb-89b1-f0d069fede3b","resolution":{"observed_at":"2026-05-22T22:47:13.793889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:5220eb88eb1d772b245423ea12a2ad3e246539f5752d465fbab558178065e917","observation_id":"d137d4cd-56cc-4c3c-b96d-177e51004655","resolution":{"observed_at":"2026-05-22T22:47:13.034098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2408.08632","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-07-04T08:49:41.635040Z","title":"A survey on benchmarks of multimodal large language models","venue":null,"work_id":"207e59ee-baf4-416d-9307-5b7d6daa3239","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:54a0f32e924ea30334ab6a11025505134352a7a5cab5d9aa2609210e78589796","observation_id":"c4541fd2-edff-4e88-8ec7-b424820fe260","resolution":{"observed_at":"2026-05-22T22:47:13.058347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"0af389f8-fee9-49e0-8af6-99e8325eabfe","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:b9f89b51cbfedf9301c717ead1fcd7e4717161f3fec7c4973562d0990c164e30","observation_id":"8a4357ea-8570-498d-b038-5800dfc20fd6","resolution":{"observed_at":"2026-05-22T22:47:13.797697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:4bc361ca0046d9ed2e51956aea03b123168804931d327eefce6ffe35bf76f7c7","observation_id":"cb342305-57b1-4715-8a9b-1a366456e06e","resolution":{"observed_at":"2026-05-22T22:47:13.010209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"6ae463d0-0e57-42cb-b23f-29a66e2a89bc","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:764d1a5aeaa5713f298270bc41426467e51ec9370ea55fb25e0803b1a8a56701","observation_id":"bdb624a3-e15c-4445-b2b1-42649ed6d01a","resolution":{"observed_at":"2026-05-22T22:47:13.722612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"97ade7bc-39b5-4d0f-8ae7-8c64dad24d1a","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:6f6c1fd597c0546afeac5b732709c37164ec863833989158f78cd6428306a7bd","observation_id":"4e5cef5e-c9ee-462d-b030-c441c77872b4","resolution":{"observed_at":"2026-05-22T22:47:13.750210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.844600Z","title":"Towards vqa models that can read","venue":null,"work_id":"33f55abe-fe38-483c-a026-05c983a173d2","year":2019},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:950c30af13c7ee944b51e1dfe5067009b906b57b3ee9291f14a9e12508727f48","observation_id":"639b056f-abdf-4642-8c14-41dbee70ea8d","resolution":{"observed_at":"2026-05-22T22:47:13.745262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14933","last_updated":"2023-10-11T15:08:51Z","snapshot_observed_at":"2026-07-06T15:21:15.939061Z","submitted_at":"2023-04-28T15:43:21Z","title":"An Empirical Study of Multimodal Model Merging","version":2},"cited_work":{"arxiv_id":"2304.14933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14933","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of multimodal model merging","venue":null,"work_id":"2af519ab-625e-4537-bb2c-6bb1b2ea3925","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2304.14933","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:fdd02836ae7354e2be31e978b686929be31ba7e7084830b4294307ff81698a8d","observation_id":"23aea47c-a2ae-4363-9638-2a59da00ecab","resolution":{"observed_at":"2026-05-22T22:47:13.040070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":"1b4b4094-387b-427d-adeb-f747d32e4766","year":null},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:3b06fd5a4af099edaf58dec8a34e1ee8d8b777c055681247a261d401609e8b2c","observation_id":"1d1d72b1-1777-45e9-bf90-cafc92cabbba","resolution":{"observed_at":"2026-05-22T22:47:13.763870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"499581b6-1893-40e3-bb3c-127705051e5d","year":2017},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:b1e2937775a2d21f6ef7374d6b9f2ac6fbd97bbb42e674292ca04e825b4a1533","observation_id":"1cfe4624-dc0c-4770-b73c-65252017603e","resolution":{"observed_at":"2026-05-22T22:47:13.772701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge fusion of large language models","venue":null,"work_id":"78b12601-ad13-46ab-ab94-f2e4385b5d1b","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:e84a139985b95be7d33ed3e7201cf63bdd5463330441facc00430b4a6b377d9c","observation_id":"feac4b98-aa29-417b-bdcc-ad9493c80b13","resolution":{"observed_at":"2026-05-22T22:47:13.776973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge fusion of chat llms: A preliminary technical report","venue":null,"work_id":"27795a6b-c36a-466b-8f98-dcb7c2469fe7","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:5f669f18935b3dfc94cdf6287843b96b63562d82c368e99463adb46227e50374","observation_id":"87ebef6d-0948-4c8b-b146-0fcb5f3a8c6a","resolution":{"observed_at":"2026-05-22T22:47:13.759292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:c247677da064f26cbc9cf8f27a8734bf0e5006cc48b852d7634e38fb6399440a","observation_id":"1b9df78e-03da-496a-9040-1165a22a67c3","resolution":{"observed_at":"2026-05-22T22:47:12.999223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:a2017c3da1a71b6cb4f84418952ea7677410d4b7ca0e77b142e325cc5e120bae","observation_id":"c078eb9a-f62e-4e13-9c20-2097f5044aab","resolution":{"observed_at":"2026-05-22T22:47:13.045306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TIES-Merging: Resolving interfer- ence when merging models","venue":null,"work_id":"0e018c53-1de5-451f-b3cf-03873be58567","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:1cbdb8c6f98c3f831d9f4b561147bf1cc00b1c8c6b6f44efb0809a1eec7f5a46","observation_id":"b0c7f121-436d-4b55-a9f6-79add888a4af","resolution":{"observed_at":"2026-05-22T22:47:13.789663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2 technical report","venue":null,"work_id":"526da1b2-4884-4ada-b2f1-2c8635a803e3","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:64267329b52b6e4d2207b891f9bceab0dc8b97742dc705a60b5e2c86f1622e33","observation_id":"fa4e1a20-fc46-42d9-a7d9-5ef92fd5ca88","resolution":{"observed_at":"2026-05-22T22:47:13.718835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug- owi2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"3dfd22c4-90ca-4346-ad68-6f758e13572c","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:29b4c8dca22120373876aa5aafb1c0a0ed3ceb7e33ae9c3c3697f466a717c209","observation_id":"129400fc-d295-4990-ab27-19d67d031d2a","resolution":{"observed_at":"2026-05-22T22:47:13.736134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"b6aecd9c-e125-45e8-93ed-c1c5c52e9db3","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:328cb7f694c4e1203eff39c4a19ab715e11679b25fa6b727e9f8f4d74b5f686e","observation_id":"4397b508-5be1-4c81-969a-c27683e33dbf","resolution":{"observed_at":"2026-05-22T22:47:13.802378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"db65793b-689c-4839-afe3-909032b5ccd8","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:22709e55e11f728a8d584dcd04653384c5db480c2fb0ddb2e161640a4ded8e2e","observation_id":"51a6a79a-ee0e-4468-b69c-1d80b82e1068","resolution":{"observed_at":"2026-05-22T22:47:13.754647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":"ca0ea78a-ab6a-4308-9525-3a1abf484ccc","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:7c2fdc27b7e00da01750c5e6572ec8727f65b4a64bbe6099a3bb17080a080b15","observation_id":"88f81d22-ffae-48c0-8737-c81fe23a0e1e","resolution":{"observed_at":"2026-05-22T22:47:13.780982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11385","last_updated":"2024-06-27T16:01:28Z","snapshot_observed_at":"2026-07-06T18:32:06.826381Z","submitted_at":"2024-06-17T10:12:45Z","title":"MetaGPT: Merging Large Language Models Using Model Exclusive Task Arithmetic","version":2},"cited_work":{"arxiv_id":"2406.11385","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11385","snapshot_observed_at":"2026-07-03T17:58:46.791554Z","title":"MetaGPT: Merging large language models us- ing model exclusive task arithmetic","venue":null,"work_id":"4b2157d6-f681-4c6a-89cd-f92f26539337","year":2024},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"cited_paper":"/paper/2406.11385","citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:a850d9d269683167df1d7591f7cad701db8d2e27922b9ef87887fa251910cd5b","observation_id":"2bc6c25b-e314-44f7-816f-3abda1d72bd0","resolution":{"observed_at":"2026-05-22T22:47:13.028887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e44985fa-f330-4d6d-aeeb-c661ffbaf3e9","year":null},"citing_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T22:47:09.500229Z"},"links":{"citing_paper":"/paper/2503.23733"},"observation_digest":"sha256:90d093a6e02760fe5e6264954510124fda81fd10dd16943dd83c57cfdd314e95","observation_id":"c65b7fac-bd4c-44c1-9b52-c4655d24a360","resolution":{"observed_at":"2026-05-22T22:47:13.768589Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":20},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2503.23733."}