{"as_of":"2026-08-07T17:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5917eb9d75637bb1f6e8377e8297708d9db77a89a383a7fd46dbc9a05c477db5","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:22.310402Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:00:28.861351Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.223756Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-06T01:00:28.861351Z","title":"P.; Huang, X.; Jiang, Y.-G.; Sebe, N.; Tao, D.; Gool, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04017","last_updated":"2025-08-06T02:13:46Z","snapshot_observed_at":"2026-08-07T05:58:41.828066Z","submitted_at":"2025-08-06T02:13:46Z","title":"Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T01:00:28.861351Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2508.04017"},"observation_digest":"sha256:1a5cee6b1dc2aafc33006747c2b24c0cc7c174a8cc60fc20deec505e51101af5","observation_id":"409490f8-ec1c-4261-8af4-a4482362a558","resolution":{"observed_at":"2026-08-06T01:00:28.861351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-05T11:56:37.791379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02164","last_updated":"2025-09-02T10:14:55Z","snapshot_observed_at":"2026-08-07T04:11:09.551801Z","submitted_at":"2025-09-02T10:14:55Z","title":"Omnidirectional Spatial Modeling from Correlated Panoramas","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:37.791379Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2509.02164"},"observation_digest":"sha256:94bd8cae8fe3f9dedc811027dffb857c55deeb7d452b7f749a94e68b0f282245","observation_id":"44f4ebe2-070c-4bb0-85d9-e8365943b253","resolution":{"observed_at":"2026-08-05T11:56:37.791379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-02T22:14:31.631473Z","title":"Mllms are deeply affected by modality bias.arXiv preprint arXiv:2505.18657, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-06T08:22:05.158674Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:31.631473Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:39c3bae9d9add846d0b5367caaf8332e76fa70267dc3ea5778c0f57816929cb8","observation_id":"163ddd2a-a86a-413e-84b0-168791481c7c","resolution":{"observed_at":"2026-08-02T22:14:31.631473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.02492","last_updated":"2026-04-02T19:50:59Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T19:50:59Z","title":"Token-Efficient Multimodal Reasoning via Image Prompt Packaging","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:52:25.713970Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.02492"},"observation_digest":"sha256:856ce90240e2dec6aa4281b023bc91fa19c68b4db7cfd8ef9733e39cd41a83e2","observation_id":"fbd1d54a-dd4f-4ddb-b55d-2cb5b89c675f","resolution":{"observed_at":"2026-05-13T21:53:19.601782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.03995","last_updated":"2026-04-05T06:32:08Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:32:08Z","title":"A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T17:34:10.089555Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.03995"},"observation_digest":"sha256:d603f4855b65d58fb2a9b699cf05fe20dbe99a2c2990e97ecd3ce7168e43dcd3","observation_id":"f8d109ff-404d-49b4-b09b-18a6839cf17d","resolution":{"observed_at":"2026-05-13T17:38:02.902544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.16902","last_updated":"2026-04-29T05:22:54Z","snapshot_observed_at":"2026-08-02T23:46:35.225613Z","submitted_at":"2026-04-18T08:25:52Z","title":"Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T07:02:02.752466Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.16902"},"observation_digest":"sha256:87747bd03432f45cb458423093e73cee00c7116087581b4ca1c88b5004712dc4","observation_id":"b07b222e-4d13-46a3-a610-d57a13e7a1b0","resolution":{"observed_at":"2026-05-10T07:11:53.732553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2604.21326","last_updated":"2026-04-23T06:29:42Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T06:29:42Z","title":"MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-09T21:56:38.004300Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2604.21326"},"observation_digest":"sha256:c5839835d0dae16f9037fceeb57abaf6d887b4106b32e2deece22695370525dc","observation_id":"4a808afb-0e03-4f25-96d0-9de968dac8e9","resolution":{"observed_at":"2026-05-11T14:21:07.562485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.14787","last_updated":"2026-05-15T21:26:27Z","snapshot_observed_at":"2026-08-01T03:30:45.927162Z","submitted_at":"2026-05-14T12:56:36Z","title":"Do Composed Image Retrieval Benchmarks Require Multimodal Composition?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T21:20:49.609788Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.14787"},"observation_digest":"sha256:b337c60d72973f57e03791eeab5cb954e4ca608a404bab8ac2d915c19ee58b60","observation_id":"977cd533-9d06-4171-ad7e-30545c81c955","resolution":{"observed_at":"2026-05-20T21:23:44.429486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:b77b2c28b1728710ed643b872f87dbd151d9f0aa4b4112f66bff2599a9b6be4e","observation_id":"cc28aa76-c4c2-43ba-8e65-61703fccfcf6","resolution":{"observed_at":"2026-05-20T11:33:14.210167Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:fa5cb9699d13fc5b0c12fbda4d8dd7a2330cf76fb45357284d17fe23c49b9fe8","observation_id":"69715a54-940a-4a56-bd7d-4de3a12c796a","resolution":{"observed_at":"2026-06-30T18:35:00.347720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2605.22168","last_updated":"2026-05-21T08:39:46Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:39:46Z","title":"Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:34.039507Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2605.22168"},"observation_digest":"sha256:607f1d47fd080f52e62e643d858d4a322a28be156dcc14e5f585e8e1856bc395","observation_id":"762b4ad1-b48e-40dd-95e3-99e53e76a9a2","resolution":{"observed_at":"2026-05-22T06:06:08.750971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.08034","last_updated":"2026-06-06T07:51:52Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:51:52Z","title":"Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-27T20:11:02.445626Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.08034"},"observation_digest":"sha256:5ccd6c4b301b178f99b640d6aa7a11b4e231a35a38c675d6094d40b5e35e9eae","observation_id":"7a9952f2-aa1f-416c-a298-703ef7fd3898","resolution":{"observed_at":"2026-07-02T20:47:22.882322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.17296","last_updated":"2026-06-15T21:05:57Z","snapshot_observed_at":"2026-08-05T04:59:01.083696Z","submitted_at":"2026-06-15T21:05:57Z","title":"Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T03:31:02.911020Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.17296"},"observation_digest":"sha256:836e6e6ab534144ec588e14526d806fbda80e553fe5d869358f7aadbcdbfb761","observation_id":"4c0022df-3301-495b-a119-c24451d8c3f6","resolution":{"observed_at":"2026-07-03T17:58:47.380374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:150703e12986dc9261f07df6bd39e24773e5631c045fdbd4f6a43e50fd3aec37","observation_id":"d21d4326-f5ba-4049-a2d6-e75804a0f5a1","resolution":{"observed_at":"2026-07-04T04:29:35.710669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":"2505.18657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-07-04T11:59:50.223756Z","title":"Mllms are deeply affected by modality bias","venue":null,"work_id":"c3537b55-3b0d-4bae-b444-893629fed1f0","year":2025},"citing_paper":{"arxiv_id":"2606.23052","last_updated":"2026-06-22T09:03:45Z","snapshot_observed_at":"2026-08-06T21:15:13.417668Z","submitted_at":"2026-06-22T09:03:45Z","title":"CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T07:28:54.731659Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2606.23052"},"observation_digest":"sha256:f8a8bfa4cde24067e8199ff056b3107d8ed48b2ccad2ba22c45b381a4789f369","observation_id":"9f8ed3fd-eddc-4c01-be3d-3b7158916600","resolution":{"observed_at":"2026-07-04T11:59:50.226221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18657","snapshot_observed_at":"2026-08-04T23:23:39.041606Z","title":"Ziwei Zhou, Rui Wang, Zuxuan Wu, and Yu-Gang Jiang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01665","last_updated":"2026-08-03T03:56:33Z","snapshot_observed_at":"2026-08-07T17:10:49.629235Z","submitted_at":"2026-08-03T03:56:33Z","title":"Allocation Before Ranking: Decoupled Token Compression for OmniLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:39.041606Z"},"links":{"cited_paper":"/paper/2505.18657","citing_paper":"/paper/2608.01665"},"observation_digest":"sha256:55d8b31a76ff440eb9bdbf77675e07e1de4cd98975837254736d7fe510e726fd","observation_id":"2428e129-1e3e-41a7-a55b-7e035829ebef","resolution":{"observed_at":"2026-08-04T23:23:39.041606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18657/citation-record","integrity":"/paper/2505.18657/integrity","json":"/paper/2505.18657/citation-record.json","paper":"/paper/2505.18657"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:30:21.429352Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.429352Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:7cdbe012e8a074b3821d1f874253326762a5c0df0b9ae8b2eac78ba100a34332","observation_id":"abadf357-7af2-4e8b-9948-53262f65cd1f","resolution":{"observed_at":"2026-08-07T14:30:21.429352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:30:21.459812Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.459812Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:580b8cbbc9dc59c55bdf2639ee54ca69ad91cdabe118b5e31a8068090abff36c","observation_id":"de9914c2-3abb-45f0-ac95-d09d3c005fa0","resolution":{"observed_at":"2026-08-07T14:30:21.459812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:30:21.513272Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.513272Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:85f09269554be8e306de882d8ab9679199082db994ef0e5bdbfa7403f0a2769d","observation_id":"1f977bd7-d0b0-4f54-af21-f70a07258c6f","resolution":{"observed_at":"2026-08-07T14:30:21.513272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:30:21.584728Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.584728Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:0a16cb0832520b6f541c40c7afe8aa1eb52730eabcbaa8300e03d2d4e1d7e97c","observation_id":"84836bc0-651d-46b3-8fbf-c737d4b9694f","resolution":{"observed_at":"2026-08-07T14:30:21.584728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:30:21.589921Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.589921Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:0bdef3d893b9f47f1e2b173ab49077fd08263fb7d62ca7751e5fda3574101005","observation_id":"04bf98c0-6cca-40e7-8fd8-c244a6a200fe","resolution":{"observed_at":"2026-08-07T14:30:21.589921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:30:21.593162Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.593162Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:1e65df4600af08ae635a92b0b1067a96f7a97728d1a07622e643688badac7558","observation_id":"b188da2d-cf46-4df9-b104-023a1c6c1498","resolution":{"observed_at":"2026-08-07T14:30:21.593162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.607933Z","title":"Tactile sensing—from humans to humanoids,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.607933Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:4742a2b3068c3f1f90d35443dac3185b6484fc179c0ab499b9c08329db039bb1","observation_id":"fae684da-628a-46ff-8b47-8eb63d68578f","resolution":{"observed_at":"2026-08-07T14:30:21.607933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.697018Z","title":"Novel tactile sensor technology and smart tactile sensing systems: A review,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.697018Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:411608bd48ec2cca160d1837794084b73a3680ce7d0dc6b2f0ec6407a59c570a","observation_id":"e8a1874e-b341-4cd8-bf36-191136222c82","resolution":{"observed_at":"2026-08-07T14:30:21.697018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.755734Z","title":"Recent progress in technologies for tactile sensors,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.755734Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b9cea65c7dc07b3fe8e76bd590eb03bae3ffe6c404ab531794c016321e85c55b","observation_id":"3a8fc65a-4764-44a9-81ce-3d7e7ed403c0","resolution":{"observed_at":"2026-08-07T14:30:21.755734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.819291Z","title":"Event-based vision: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.819291Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:2bb78879ad1af631d902b328c2e46e6101b9752349b85948a784ef1fe8163502","observation_id":"c6b63d81-4111-4b67-8bc6-659793d4b861","resolution":{"observed_at":"2026-08-07T14:30:21.819291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-07T13:40:38.719385Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-07T14:30:21.878801Z","title":"Deep learn- ing for event-based vision: A comprehensive survey and benchmarks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.878801Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:902996d71961d855f5aa1ce9898117ac3bfa55c9ed030ac22e8b036687c17589","observation_id":"f1f0f181-d3aa-4f30-b2ed-01657d64df5f","resolution":{"observed_at":"2026-08-07T14:30:21.878801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:21.976724Z","title":"High speed and high dynamic range video with an event camera,","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.976724Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:301f54a786d66a336b4d517ecae28b259df9ccd31fd371708d82ec7f1a2df4c7","observation_id":"3d2aacf3-1a2b-4646-827a-f296279d0144","resolution":{"observed_at":"2026-08-07T14:30:21.976724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.058249Z","title":"360sfuda++: Towards source-free uda for panoramic segmentation by learning reliable category prototypes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.058249Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:e98709681db269e27e1aec94a1a39cd06751fb52753d6a6a38c0cd68fbbd2046","observation_id":"8803649e-f34f-46a7-9ee5-7b12445399f1","resolution":{"observed_at":"2026-08-07T14:30:22.058249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.075625Z","title":"Semantics distortion and style matter: Towards source-free uda for panoramic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.075625Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:50be0e412c8c9e2b784fd05cb3d89a50e0fa80cf042058c89e4869632fdfd935","observation_id":"af7dc34a-6b02-4acd-8edf-02aad04864be","resolution":{"observed_at":"2026-08-07T14:30:22.075625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.078642Z","title":"Omnisam: Omnidirectional segment anything model for uda in panoramic semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.078642Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b7af33d1ac39e9388c01ae524d6a7fb304eb067f14f9a1c1c84dcacee61d3bd8","observation_id":"368ebb22-04b4-414d-8dbf-4589bb639cce","resolution":{"observed_at":"2026-08-07T14:30:22.078642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.081758Z","title":"Mmbench: Is your multi-modal model an all-around player?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.081758Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:faadc6366082fe8b1d59dba0afa2b18f87c82710c61f1a8ffa42caad6b7aaba2","observation_id":"ad6c8bab-f38a-40d1-b620-5993180b1833","resolution":{"observed_at":"2026-08-07T14:30:22.081758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.084531Z","title":"Mmbench-video: A long- form multi-shot benchmark for holistic video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.084531Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ee08488ce47c7d208af49155813e052b2a4dd371531cd95f8d22f90a98a87528","observation_id":"10368d55-3909-45c7-a04e-6ec4ff1c7b8f","resolution":{"observed_at":"2026-08-07T14:30:22.084531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.227767Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":"fe4804bd-2bdb-4961-92bf-17f967b1a464","year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.087528Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b91805ca0859188202c559a99fe44b56277bf217bc745b0cf557273d006f2d59","observation_id":"6d86b2eb-c66e-42bc-a795-70e1a17855fe","resolution":{"observed_at":"2026-08-07T14:30:23.231183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18142","last_updated":"2024-09-21T15:22:26Z","snapshot_observed_at":"2026-08-04T13:51:52.964653Z","submitted_at":"2024-09-21T15:22:26Z","title":"A Survey on Multimodal Benchmarks: In the Era of Large AI Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18142","snapshot_observed_at":"2026-08-07T14:30:22.090211Z","title":"A survey on multimodal benchmarks: In the era of large ai models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.090211Z"},"links":{"cited_paper":"/paper/2409.18142","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:7cff26800fe37509e19297bd061b636b717671a47994d03442b3a381e22eb80c","observation_id":"0f72bb53-9575-40fc-8521-b66c9bf026c8","resolution":{"observed_at":"2026-08-07T14:30:22.090211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-07T14:30:22.093509Z","title":"A survey on benchmarks of multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.093509Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:24526d528de0daa6c76bd8d170a4ebd5057fbddc7e076df473cf8830e829e9e2","observation_id":"7e2f3ed1-726d-445c-be3e-c0fba0554758","resolution":{"observed_at":"2026-08-07T14:30:22.093509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T14:30:22.096111Z","title":"Visual prompting in multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.096111Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b25b81d0df350c481d09ae31ac8a1a1962c9bb2fe341b47979293094e6757847","observation_id":"22a4348b-32aa-45d7-840f-981ad9e234c0","resolution":{"observed_at":"2026-08-07T14:30:22.096111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13962","last_updated":"2025-03-18T06:54:59Z","snapshot_observed_at":"2026-08-07T16:55:45.336341Z","submitted_at":"2025-03-18T06:54:59Z","title":"Survey of Adversarial Robustness in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13962","snapshot_observed_at":"2026-08-07T14:30:22.098809Z","title":"Survey of adversarial robustness in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.098809Z"},"links":{"cited_paper":"/paper/2503.13962","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:af725392a626cb366347363a4441c9002fa924b956b54372c28f990397387bf8","observation_id":"240c9f7b-1905-4a45-85fa-6f8e67264a99","resolution":{"observed_at":"2026-08-07T14:30:22.098809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01887","last_updated":"2025-02-27T03:39:10Z","snapshot_observed_at":"2026-08-07T17:44:15.581009Z","submitted_at":"2025-02-27T03:39:10Z","title":"When Continue Learning Meets Multimodal Large Language Model: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01887","snapshot_observed_at":"2026-08-07T14:30:22.101577Z","title":"When continue learning meets multimodal large language model: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.101577Z"},"links":{"cited_paper":"/paper/2503.01887","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:394528b70a68195922c243fbd2a720fdc7e750c94ea259f32711b64b945ff555","observation_id":"5dd9b372-1165-4af8-9407-018a5b441505","resolution":{"observed_at":"2026-08-07T14:30:22.101577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05262","last_updated":"2025-08-14T12:30:25Z","snapshot_observed_at":"2026-08-05T17:24:51.837291Z","submitted_at":"2024-03-08T12:35:07Z","title":"Debiasing Multimodal Large Language Models via Penalization of Language Priors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05262","snapshot_observed_at":"2026-08-07T14:30:22.104648Z","title":"Debiasing multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.104648Z"},"links":{"cited_paper":"/paper/2403.05262","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:42bc962983d34b6cce8a0b8d1f7d6bab7a97b0e57b8c76df508f29d6b25a0303","observation_id":"48a07fd0-6595-4230-a234-f4278ffaa336","resolution":{"observed_at":"2026-08-07T14:30:22.104648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.217723Z","title":"Assessing modality bias in video question answering benchmarks with multimodal large language models,","venue":null,"work_id":"db3a355c-eebf-422f-bb80-7fa08f4c185c","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.107563Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:234b1fc295d447525bb3006042733c9991cda69cc85bd0c6a5b219d0e39749fd","observation_id":"930a19f3-df9e-4833-8bc6-83e4ba5c06bf","resolution":{"observed_at":"2026-08-07T14:30:23.221346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.110240Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.110240Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a3a8135aabec9d9f7d6b0c2cbdd4fe31b294a6f90a29ece6885701cba5b898e7","observation_id":"75e16f0a-368a-4d2e-ade3-b2407f7b5c43","resolution":{"observed_at":"2026-08-07T14:30:22.110240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T14:30:22.113116Z","title":"Are we on the right way for evaluating large vision-language models?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.113116Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:3085067ff36179128f3aa38f7b09c05502a953548351b11f74b6927a1cfa708d","observation_id":"bd31e67a-1889-4193-a03b-1846439542d8","resolution":{"observed_at":"2026-08-07T14:30:22.113116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18346","last_updated":"2024-11-13T17:17:43Z","snapshot_observed_at":"2026-08-07T08:36:46.172217Z","submitted_at":"2024-03-27T08:38:49Z","title":"Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18346","snapshot_observed_at":"2026-08-07T14:30:22.115900Z","title":"Quantifying and mitigating unimodal biases in multimodal large language models: A causal perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.115900Z"},"links":{"cited_paper":"/paper/2403.18346","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:fcd3b9f2f14a53ad314fdf690b60aa13265c8cd8c1d173a89ee201850aed803f","observation_id":"fdd05ac9-8660-40a5-8796-0e0a62eae093","resolution":{"observed_at":"2026-08-07T14:30:22.115900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T14:30:22.118528Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.118528Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b7f52861cfb581f85bdeaf97cb547ce8ee52be9f1fd3d8e2078f3a858d38f99d","observation_id":"32ab4fa7-1ee6-4b7f-b712-ece5487f0cad","resolution":{"observed_at":"2026-08-07T14:30:22.118528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.201361Z","title":"Multimodal learning with transformers: A survey,","venue":null,"work_id":"27fd7673-02e5-4001-be2d-faf35cc2af26","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.121281Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:9ee6c081f8716eeb39b4aa6640b5a4b41603b6074437bd1e7f03be2dc17bf71d","observation_id":"e9eeb4cc-c199-42b3-a5d3-e11791352b31","resolution":{"observed_at":"2026-08-07T14:30:23.205609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.191162Z","title":"A survey on deep multimodal learning for computer vision: advances, trends, applications, and datasets,","venue":null,"work_id":"87cfce6c-6562-499f-acdc-b2b50bdd7363","year":2022},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.123962Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f720f13541d6f88c9058d1d86ecb896a2c08be72b8b7a7e8c9cd75d4ef8e0ca4","observation_id":"785f5e72-992b-497b-9e28-1af5ce9120e7","resolution":{"observed_at":"2026-08-07T14:30:23.195082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.179610Z","title":"A review on methods and applications in multimodal deep learning,","venue":null,"work_id":"d4d8d5f0-305f-4f70-aaf3-013add43c639","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.127154Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:0818d2c96004671499bd465fd4d4281addaa7a9ca6e52ac843f7ed9926d5a99d","observation_id":"1efb1648-6f3f-4ad4-9f34-c66904626dfd","resolution":{"observed_at":"2026-08-07T14:30:23.183537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.169264Z","title":"Learning modality-agnostic representation for semantic segmentation from any modalities,","venue":null,"work_id":"e1ab5478-94da-4cf7-a569-ffd9fcca0813","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.129748Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:791c653d4fb30db95b563cc9cb7681ad7e8252a7352e7d051bd069b13638a318","observation_id":"d748db31-5f83-40eb-996d-6fc45ace69dd","resolution":{"observed_at":"2026-08-07T14:30:23.173138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06700","last_updated":"2025-03-20T18:36:20Z","snapshot_observed_at":"2026-08-07T17:18:44.612918Z","submitted_at":"2025-03-09T17:33:15Z","title":"MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06700","snapshot_observed_at":"2026-08-07T14:30:22.133352Z","title":"Memorysam: Memorize modalities and semantics with segment anything model 2 for multi-modal semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.133352Z"},"links":{"cited_paper":"/paper/2503.06700","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ccfab110345bbde1191e03f2796df27c0267951886d1e1e68448e6b8961b909c","observation_id":"920b8fe1-f8ca-4dd9-bc5d-82c150b38cb0","resolution":{"observed_at":"2026-08-07T14:30:22.133352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.158318Z","title":"Cafuser: Condition-aware multimodal fusion for robust semantic perception of driving scenes,","venue":null,"work_id":"3dd0bb4d-59b3-40c5-b5e3-446f8d4c793d","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.136221Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:7a066de2b458312712207faaafc432a8476ac78d7945795ee066fa7ec1eab69e","observation_id":"d3cd5a6f-8cde-4b9e-9714-82afa793bde4","resolution":{"observed_at":"2026-08-07T14:30:23.162814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.145751Z","title":"Multimodality represen- tation learning: A survey on evolution, pretraining and its applications,","venue":null,"work_id":"fb4f10df-b0eb-499b-8bc0-d82d5c461bb3","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.139263Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:014f9227fba1535cb7e38618e8d6d782aaaf1b04e378c1d120800ce0e42c45bf","observation_id":"e6e58c7d-e301-4082-9d52-5b2b22c37770","resolution":{"observed_at":"2026-08-07T14:30:23.150498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.134702Z","title":"Enhancing multimodal cooperation via sample-level modality valuation,","venue":null,"work_id":"308f1bf3-cf3b-49b3-aada-2adb2138d271","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.142122Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c910558f33a874a776d9a5791ee81691d567352c6f1f9f6bfa2afa4bac84db8f","observation_id":"c4427475-67fb-4abf-a814-295a0c98e5d5","resolution":{"observed_at":"2026-08-07T14:30:23.138981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.123233Z","title":"Centering the value of every modality: Towards efficient and resilient modality-agnostic semantic segmentation,","venue":null,"work_id":"f0e9496c-9d5d-497b-8119-b9cdb1741b13","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.144730Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c254ee7b768ec1cf3b228049e444578803f9b1e802bd507c499a1f03ad97b51b","observation_id":"b25be5e1-2a98-4a37-8d5e-64e3a28b5c96","resolution":{"observed_at":"2026-08-07T14:30:23.127895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06635","last_updated":"2025-05-10T12:58:15Z","snapshot_observed_at":"2026-08-07T15:48:14.074741Z","submitted_at":"2025-05-10T12:58:15Z","title":"Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06635","snapshot_observed_at":"2026-08-07T14:30:22.147211Z","title":"Reducing unimodal bias in multi-modal semantic segmentation with multi-scale functional entropy regularization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.147211Z"},"links":{"cited_paper":"/paper/2505.06635","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5878985141724a71c017c068f89ebaf60f9655bcbfecef092595e913c1f22926","observation_id":"9eaf1cb3-d80c-4765-8697-b2d87d7cbae4","resolution":{"observed_at":"2026-08-07T14:30:22.147211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17141","last_updated":"2025-05-15T18:54:21Z","snapshot_observed_at":"2026-08-03T23:24:30.636436Z","submitted_at":"2024-11-26T06:15:27Z","title":"Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17141","snapshot_observed_at":"2026-08-07T14:30:22.150289Z","title":"Learn- ing robust anymodal segmentor with unimodal and cross-modal distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.150289Z"},"links":{"cited_paper":"/paper/2411.17141","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:ce251219f5f60a44ba65437c319e8f88f8f5e50530cda8d51df133b67421e12e","observation_id":"32bd4f51-859d-493b-a30d-7056d89fb687","resolution":{"observed_at":"2026-08-07T14:30:22.150289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.110610Z","title":"Balanced multimodal learning via on-the-fly gradient modulation,","venue":null,"work_id":"92ee975e-273b-499e-961f-fd5f588ac55f","year":2022},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.153165Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:64c918f0a429b178c561abeb91a6025bcc06a6192f2aa3c9af2b0df2e8d28eb6","observation_id":"4240287c-4dd6-43b6-9b7e-95bc67605209","resolution":{"observed_at":"2026-08-07T14:30:23.114742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.100214Z","title":"Clip the bias: How useful is balancing data in multimodal learning?,","venue":null,"work_id":"47a8e1f4-a382-4825-9a33-7b4d0b3a10f1","year":null},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.155716Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:39df2edd2d6b0440d72c8582d7187613bd17db0d26c01902b9beb7c366156dbd","observation_id":"7f854eed-ce46-418b-a9f9-82957d64b9ec","resolution":{"observed_at":"2026-08-07T14:30:23.103890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.158369Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.158369Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:1e290cbbb0ba760e5b2765cbdef87c04c65a2fa7ad93c0c979c3ef82b7fd3927","observation_id":"d983c414-9160-48e0-bcd9-99226fe98920","resolution":{"observed_at":"2026-08-07T14:30:22.158369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.082015Z","title":"Clippo: Image-and-language understanding from pixels only,","venue":null,"work_id":"dbfc374a-c71a-44f7-9966-45f5d6d8b117","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.161631Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:9ccde441e53b607d2265d115742ba896fb6105c4005a6adaba5a904d5f19dae2","observation_id":"5281160e-64e4-46c1-8726-11206bfeb0c3","resolution":{"observed_at":"2026-08-07T14:30:23.086597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.072068Z","title":"Clip-kd: An empirical study of clip model distillation,","venue":null,"work_id":"166ebec5-3207-4fa2-a204-90cf063bf978","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.164266Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:2e4054313ba0efacad822653b7715ff29c7cf09a707c56e9a723e4e2394f1925","observation_id":"3863a0eb-aab7-41a9-b071-513a6915dc96","resolution":{"observed_at":"2026-08-07T14:30:23.075659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.062155Z","title":"Tinyclip: Clip distillation via affinity mimicking and weight inheritance,","venue":null,"work_id":"9ee3c708-b4cf-45a8-9cf1-c1cef8f77ebe","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.167042Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:eefc94dc0a8ac3be3ba0ec0b1d1f3448d955dfa84bb02a250e0a3c41a6d84b12","observation_id":"17f011f8-4d95-4edc-9b26-86e7847d4924","resolution":{"observed_at":"2026-08-07T14:30:23.065651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.052449Z","title":"An inverse scaling law for clip training,","venue":null,"work_id":"ee5ff19f-6ef7-43f7-90b3-4a45963a8540","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.169708Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:9a8469670bb35a98c0859c9cdad781b5d99757ff68c5e2af980050a2fd4fb7f5","observation_id":"0565e097-cf6d-45be-9d94-5b72c4772f89","resolution":{"observed_at":"2026-08-07T14:30:23.055966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10816","last_updated":"2025-06-13T08:32:24Z","snapshot_observed_at":"2026-08-01T12:15:50.880607Z","submitted_at":"2025-02-15T14:42:42Z","title":"BalanceBenchmark: A Survey for Multimodal Imbalance Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10816","snapshot_observed_at":"2026-08-07T14:30:22.172299Z","title":"Balancebenchmark: A survey for multimodal imbalance learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.172299Z"},"links":{"cited_paper":"/paper/2502.10816","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:76c25a3de73cda1cca77510103a69ad940aab863e21fd48407bd1ebde607243d","observation_id":"eed1ba1d-0733-439f-838c-a82bbfebd2ce","resolution":{"observed_at":"2026-08-07T14:30:22.172299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.042019Z","title":"Facilitating multimodal classification via dynamically learning modality gap,","venue":null,"work_id":"5eeed1cc-cde8-4846-b22d-c73f32d3be2e","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.175121Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:8f0eea46f39f7fe7b87755ac6efb3cb821cdaeafd33b8e4f33104ee3ce6d869f","observation_id":"54f1252b-063a-4c80-abec-02d1ee4a54bc","resolution":{"observed_at":"2026-08-07T14:30:23.045629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18445","last_updated":"2025-04-10T08:56:52Z","snapshot_observed_at":"2026-08-07T16:41:59.861327Z","submitted_at":"2025-03-24T08:46:52Z","title":"Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18445","snapshot_observed_at":"2026-08-07T14:30:22.178436Z","title":"Benchmarking multi-modal semantic segmentation under sensor failures: Missing and noisy modality robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.178436Z"},"links":{"cited_paper":"/paper/2503.18445","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:beb8f6a90c721c6d4381a9e797011c0252b8f5359c61845074ffe62f15e3af0a","observation_id":"226d7d21-0215-4242-98e2-d50a08ebf7c9","resolution":{"observed_at":"2026-08-07T14:30:22.178436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-08-07T14:30:22.181322Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.181322Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a811015bf53b97dc824ad8f88b526681db25795071c230df772d07dc87546d65","observation_id":"a9af95a0-7df2-4c73-8114-69135c20ee99","resolution":{"observed_at":"2026-08-07T14:30:22.181322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.031162Z","title":"On modality bias recognition and reduction,","venue":null,"work_id":"eb579995-4566-4835-808c-8fdd38283d71","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.184498Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:27dff43e9a8382c8f36728738dd8e39c87598cc39aa3b036dc1a96a9edb8d425","observation_id":"eba14ae4-04a6-4dd1-8bd0-27b3e1fc5453","resolution":{"observed_at":"2026-08-07T14:30:23.035177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.019839Z","title":"Cross modality bias in visual question answering: A causal view with possible worlds vqa,","venue":null,"work_id":"ac5bc647-d0da-4e96-a92b-6714760ed91f","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.187223Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:035c011e7d82da6a50bc3716618fbe2a7bf69f63036a9d87b2cc26dc5fc23eb5","observation_id":"6c3f4aba-7103-404e-ad0e-401272a7a362","resolution":{"observed_at":"2026-08-07T14:30:23.024112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:23.009569Z","title":"Counterfactual vqa: A cause-effect look at language bias,","venue":null,"work_id":"917abd9f-fcea-4427-9760-37194adcf382","year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.189752Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:4330f0a9de79697aa7829bc0d61b394f6fcb95ae4778e16eb5ad2aba291e3b54","observation_id":"b1fb5883-1613-44da-b211-b78203584a3a","resolution":{"observed_at":"2026-08-07T14:30:23.013324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.999717Z","title":"Removing bias in multi-modal classifiers: Regularization by maximizing functional entropies,","venue":null,"work_id":"84261267-78af-4bd5-90ad-687369feafd9","year":2020},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.192626Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:d238c392b956c783afe72880b9ca88ec951a0df5cc7b9efc4569f8a7d64bfb91","observation_id":"5fd3e92d-26e7-48b8-8e13-a7016f6e868c","resolution":{"observed_at":"2026-08-07T14:30:23.003308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.988855Z","title":"Overcoming language priors in visual question answering with adversarial regularization,","venue":null,"work_id":"5626fe92-6838-4eef-b17c-191f3973263e","year":2018},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.195085Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:271a5f41c1041f4ff5ba2f426b5881e90f8541d4db20ed20e166d370b5518fc5","observation_id":"6c265d65-7454-45ba-939e-f633f23abb2d","resolution":{"observed_at":"2026-08-07T14:30:22.992584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08702","last_updated":"2025-02-08T23:14:12Z","snapshot_observed_at":"2026-07-06T18:30:02.349638Z","submitted_at":"2024-06-13T00:00:20Z","title":"VLind-Bench: Measuring Language Priors in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08702","snapshot_observed_at":"2026-08-07T14:30:22.197925Z","title":"Vlind-bench: Measuring language priors in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.197925Z"},"links":{"cited_paper":"/paper/2406.08702","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:201b68929c9f908bc417b0ea6adbfcba4f6c03890fd68f33d129f4d631815c49","observation_id":"95f1802f-089e-4d52-a589-a641b2e3f5bc","resolution":{"observed_at":"2026-08-07T14:30:22.197925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08145","last_updated":"2025-05-31T02:59:15Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:31:17Z","title":"Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08145","snapshot_observed_at":"2026-08-07T14:30:22.201170Z","title":"Insight over sight? exploring the vision-knowledge conflicts in multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.201170Z"},"links":{"cited_paper":"/paper/2410.08145","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:280fca555f638cf397e93b34eacb4a3301e5f725a548be5761418559e8afd9cc","observation_id":"d09c89d4-3718-46f9-a9c6-a21ae99ffe63","resolution":{"observed_at":"2026-08-07T14:30:22.201170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.977900Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"1ad5bf10-7a9e-4484-a301-ad6cccf9cf33","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.204220Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:90402911e4c556e977c44ff4fa924d0f200f77dc9bfcb54364b37d87cc70f113","observation_id":"ed7e82ee-c4df-406b-bb6d-e744c18b684d","resolution":{"observed_at":"2026-08-07T14:30:22.982040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.966044Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning,","venue":null,"work_id":"4c1592f3-7b2e-44ed-bb6a-c9914f32122c","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.206978Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:4e8a55baa10ed794d6b23c1a3cb2e0612894eb2f958937f8b77ed1ca933035c1","observation_id":"bf7b0c12-2d21-4c55-8a2c-fd6b55594d57","resolution":{"observed_at":"2026-08-07T14:30:22.970869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.953202Z","title":"Strengthening multimodal large language model with bootstrapped preference optimization,","venue":null,"work_id":"34c6fcbb-59d2-4b49-88a7-3d62492e91d1","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.209706Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:805c7cfdfb284b3e6893ca841d56a01ec200bc19d40ae6b3f53676bd8a1a957b","observation_id":"b2929ed7-5c6a-43f6-9111-44acd1117ea8","resolution":{"observed_at":"2026-08-07T14:30:22.958519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.942920Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms,","venue":null,"work_id":"f2e809b0-f0fd-44b9-9981-cf6f6f167a6b","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.212686Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:60c9ede4c62a6e925fad0c99b11c3b6b12ab80cf234d32fe71c4c7d44a50bd9d","observation_id":"145abb58-7810-4d10-9917-8b14b04e042c","resolution":{"observed_at":"2026-08-07T14:30:22.946545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14279","last_updated":"2026-05-28T06:50:29Z","snapshot_observed_at":"2026-07-06T19:53:52.079055Z","submitted_at":"2024-11-21T16:33:30Z","title":"Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14279","snapshot_observed_at":"2026-08-07T14:30:22.216120Z","title":"Looking beyond text: Reducing language bias in large vision-language models via multimodal dual-attention and soft-image guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.216120Z"},"links":{"cited_paper":"/paper/2411.14279","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:8d637d35b98bb234c73b1e214bbd9232b5a3c3c1b0bfd45aa7ec665b36255ece","observation_id":"2793178a-cee2-4fa3-bc9a-0a090975cfb8","resolution":{"observed_at":"2026-08-07T14:30:22.216120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17928","last_updated":"2025-03-23T04:00:11Z","snapshot_observed_at":"2026-08-07T16:43:42.189386Z","submitted_at":"2025-03-23T04:00:11Z","title":"Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17928","snapshot_observed_at":"2026-08-07T14:30:22.219763Z","title":"Debiasing multimodal large language models via noise-aware preference optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.219763Z"},"links":{"cited_paper":"/paper/2503.17928","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:3b7041b09e93405a484919ec807b7dc3a3fa3d76555e900b92e291cac8952978","observation_id":"aa27677a-e313-40c2-a46b-f9467ef70160","resolution":{"observed_at":"2026-08-07T14:30:22.219763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03122","last_updated":"2025-05-21T14:00:20Z","snapshot_observed_at":"2026-08-07T17:28:50.957435Z","submitted_at":"2025-03-05T02:37:41Z","title":"The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03122","snapshot_observed_at":"2026-08-07T14:30:22.222904Z","title":"The devil is in the details: Tackling unimodal spurious correlations for generalizable multimodal reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.222904Z"},"links":{"cited_paper":"/paper/2503.03122","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:470ae3c37cea10c89bd7eb145ae6da206f44f3059666a679e249755a8cf0783a","observation_id":"4b25bda4-5890-417e-abb3-c5147a9a2c1a","resolution":{"observed_at":"2026-08-07T14:30:22.222904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:30:22.226582Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.226582Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f83f9e2c23a4efa0fee3d54dc7ba0a43fa88f22801789bf41195bdfa6ef99bac","observation_id":"a66f15ad-6718-4f94-91b5-1bae655a8ab8","resolution":{"observed_at":"2026-08-07T14:30:22.226582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T14:30:22.229737Z","title":"Deepseek llm: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.229737Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:4e5081ab86afe840d7f7d12ae5a7f6fe2e221b1da5fd3365dc4c46345a49491e","observation_id":"24dbfffb-92e8-4f8b-96f4-5184825983ce","resolution":{"observed_at":"2026-08-07T14:30:22.229737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-07T14:30:22.233235Z","title":"A comprehensive overview of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.233235Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:46987a384d0cc55c7bb5e0c4512fa9fd710193d9e64721ddac85157ec363f2f8","observation_id":"dcbe360a-bf55-4d60-bf25-1a2c58305fd8","resolution":{"observed_at":"2026-08-07T14:30:22.233235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.932842Z","title":"Masked jigsaw puzzle: A versatile position embedding for vision transformers,","venue":null,"work_id":"773a710d-ad06-4108-9d0c-40a2c97781bd","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.237361Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:cf569a741aa77cc3206eff934dae627b30107b3f604f33f0d487652d2bfa41ed","observation_id":"f0b93cc6-1b3c-47e6-ae68-aaa8e7e9b50d","resolution":{"observed_at":"2026-08-07T14:30:22.936660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.922767Z","title":"A survey on vision transformer,","venue":null,"work_id":"d805ddde-c3de-4762-b50f-3461c5ab2046","year":2022},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.240687Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:298fed4c77a134a9b988186c416c3d246bc37288502cc139940aa6e8de972b36","observation_id":"05080f11-c309-4a05-9822-8a3690c70c96","resolution":{"observed_at":"2026-08-07T14:30:22.926169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.912739Z","title":"Bringing masked autoencoders explicit contrastive properties for point cloud self-supervised learning,","venue":null,"work_id":"ee91d643-9da3-4238-9310-e08a1e567427","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.243960Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:f4b18d4839d97021853953c588f5a4ab5d42b428a4983e3b78850385c56e1f57","observation_id":"ac964b04-73d0-4318-bc75-bf67cf661dbf","resolution":{"observed_at":"2026-08-07T14:30:22.916354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.247725Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.247725Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:c1ca9d5dd8f2d89ae07b0d867188d1479856ef389433564d9ffc77dc411e6b8b","observation_id":"c05644ac-d74b-40e8-849c-e84eeae62b23","resolution":{"observed_at":"2026-08-07T14:30:22.247725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.896402Z","title":"Sharing key semantics in transformer makes efficient image restoration,","venue":null,"work_id":"81aa0bf7-328c-42a6-b8cb-66a30863cb7e","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.250976Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:b04959f4f24562d3660d8f1fd2b8787f18cac6321e378a5b7f14391463125938","observation_id":"b6b99f08-5030-4543-9808-8fbf73ca4cab","resolution":{"observed_at":"2026-08-07T14:30:22.900881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.885236Z","title":"Learning disentangled identifiers for action-customized text-to-image generation,","venue":null,"work_id":"4b95bcaa-9790-4b61-8efd-7dcbc555b4a8","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.255003Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:e1b4cbd7a620c21a029fc344f457313212ed105ccf081d991ebe342e0cd1e98b","observation_id":"f595a5dd-322b-441f-8fe8-2f54e1c5e178","resolution":{"observed_at":"2026-08-07T14:30:22.889983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.873081Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment,","venue":null,"work_id":"74346d9e-ed54-4078-aa26-13bb3b907bbf","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.259050Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:77c38f0e16de476a6a9f43ade7aba04ac6a439df27a6317f84d00bc414452068","observation_id":"94e2c6fc-7000-47c3-ac38-11650580962c","resolution":{"observed_at":"2026-08-07T14:30:22.877388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.861259Z","title":"Unibind: Llm-augmented unified and balanced representation space to bind them all,","venue":null,"work_id":"957a33fb-9222-413d-8385-dba13ecf7c8c","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.262913Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:e333b65793bc3557258513c69c0eaae0a719d9f323e217342e20bc8f0139fb95","observation_id":"b179d7a7-2263-4f13-963a-9ca3b55cd60e","resolution":{"observed_at":"2026-08-07T14:30:22.865706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.848446Z","title":"Optimizing intersection-over-union in deep neural networks for image segmentation,","venue":null,"work_id":"309cec5b-f2c5-4c1a-8114-ff9de06dfa96","year":2016},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.266455Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:cd95d33deb4d47b76576f7c9e58dd3c9864b4342d35ff82193ce59fdd9ac4ede","observation_id":"8f91d17d-86f8-4764-b193-44e7b3378a20","resolution":{"observed_at":"2026-08-07T14:30:22.853693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.835795Z","title":"Generalized inter- section over union: A metric and a loss for bounding box regression,","venue":null,"work_id":"3954862f-8ea3-492c-91b6-905ce0447e6f","year":2019},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.270817Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a73f8acc6f20940100671bbfe079e3b27ba5c335d5522756384848933abf5f64","observation_id":"73692348-413f-4060-a6f0-372b6fd8976e","resolution":{"observed_at":"2026-08-07T14:30:22.839603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.822336Z","title":"Subjective and objective quality assessment for image restoration: A critical survey,","venue":null,"work_id":"5fd5f2c9-67f2-4dcb-8889-f0b5febc56a5","year":2020},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.274373Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:5a2c05123cd892f68a5bee0762869d129f26da6504837f5786882620a0a1cb5b","observation_id":"e0ca48bf-d094-477e-96f4-6d9151494b36","resolution":{"observed_at":"2026-08-07T14:30:22.826616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.810180Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models,","venue":null,"work_id":"02d6ccf8-289c-4b6d-8252-4be420d4fc0b","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.278422Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:47ef9e509568f3aa8ce7c4bfe53f68a923b8281a3b237459c29064e5d1e9e754","observation_id":"5d79f5b9-2bf3-49e1-8b1f-412a534e7363","resolution":{"observed_at":"2026-08-07T14:30:22.815042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.797471Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset,","venue":null,"work_id":"d0c3852e-3bd7-4fef-b8d8-6dc351c4d5ef","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.281980Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:0811f450655dac8dc539cc06377fb176a9ce7909e6d736d289c527981ba986a7","observation_id":"99d06a1f-5917-49aa-a3b3-de98a6edb5aa","resolution":{"observed_at":"2026-08-07T14:30:22.801518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.784685Z","title":"Multimodal visual-tactile representation learning through self-supervised contrastive pre-training,","venue":null,"work_id":"19fdfac8-8931-4cf2-9964-07e472b56dec","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.285837Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:fd01d36e2b8464b2d1672c02a4cd603a8188906b4a8a0b9113fcd1d94eaa8c40","observation_id":"e1842fcb-53cd-434f-a681-75f6eb0718f1","resolution":{"observed_at":"2026-08-07T14:30:22.789295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16108","last_updated":"2024-05-25T07:45:41Z","snapshot_observed_at":"2026-07-06T18:19:47.765281Z","submitted_at":"2024-05-25T07:45:41Z","title":"OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16108","snapshot_observed_at":"2026-08-07T14:30:22.289194Z","title":"Omnibind: Teach to build unequal-scale modality interaction for omni-bind of all,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.289194Z"},"links":{"cited_paper":"/paper/2405.16108","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:095b4dd3ccd25cfaa304d2e331c39754b9968bb05469d0bfe0e5341734062337","observation_id":"cac625a7-724d-458f-9e85-53d7e383c7e6","resolution":{"observed_at":"2026-08-07T14:30:22.289194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.771285Z","title":"Soft robotic hand with tactile palm-finger coordination,","venue":null,"work_id":"ccf33b2b-1a38-43fb-98e4-83376a1646a1","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.292730Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:30e6fa305bdf14561811f555a33e1faf2fa947e04d6d6008a659eb146690dd7a","observation_id":"47d56575-b2a1-4521-855c-d042382911fd","resolution":{"observed_at":"2026-08-07T14:30:22.775871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.758797Z","title":"Categorizing robots by performance fitness into the tree of robots,","venue":null,"work_id":"5172e9b3-df79-4527-a3d9-46d7a393bd4e","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.296123Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:2a3f9a0da9ed651472af1912d3941af00cb3c0ee310085aa4eba6a34ff90f3bb","observation_id":"03946064-751d-4780-bb07-0fedf7bfaaa5","resolution":{"observed_at":"2026-08-07T14:30:22.762667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.747075Z","title":"Vision-based tactile sensor design using physically based rendering,","venue":null,"work_id":"e60e9835-7af8-434f-9e2e-b885ff48e03a","year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.299865Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:cd44c3a07034a57b39d00c2af0cd64982cce73372b60ab9e48f69d869ca93ec9","observation_id":"b8d77fdc-ab92-4c86-90f1-9c9553170a94","resolution":{"observed_at":"2026-08-07T14:30:22.751464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.735530Z","title":"Bi-vla: Vision-language-action model-based system for bimanual robotic dexterous manipulations,","venue":null,"work_id":"08a34ea2-75ed-49c9-b493-7e5d2f50a758","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.303293Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:efa3f80b4a49c7d59f3589798a41e4cc9d25b061d7cddccf422ddfe3c7630724","observation_id":"6f6640db-e917-4cd2-8627-48c3af45b849","resolution":{"observed_at":"2026-08-07T14:30:22.739766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.724288Z","title":"A practical tutorial on explainable ai techniques,","venue":null,"work_id":"7b24a569-8bde-4a9e-9a72-d86f5d656bd5","year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.307032Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:559157a662cab70d9d5cc4311f74ca28c2be7634e0dde4afab91a76a9012a0e0","observation_id":"6cc13352-ba83-4d59-9730-629bee828a3b","resolution":{"observed_at":"2026-08-07T14:30:22.728345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:22.711015Z","title":"Explainable ai (xai): Core ideas, techniques, and solutions,","venue":null,"work_id":"da10f8b5-f2f9-41e4-be7a-762c5033c895","year":2023},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:22.310402Z"},"links":{"citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:a7d874ac9178d812338cce07631b750f07c57fab91bc1f21ecf90eea747b097d","observation_id":"27247ff8-dfd5-4b37-9541-3ca6845d5170","resolution":{"observed_at":"2026-08-07T14:30:22.716378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 16 inbound Pith citation observations for arXiv:2505.18657."}