{"as_of":"2026-08-05T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bece577ddf6f26efe10b5032623c497e79c9c198c927d745f7c0924b28763521","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T08:41:54.503158Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.16264/citation-record","integrity":"/paper/2604.16264/integrity","json":"/paper/2604.16264/citation-record.json","paper":"/paper/2604.16264"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vi- sion foundation models and aligning for generic visual- linguistic tasks","venue":null,"work_id":"b242560e-ff86-42dd-9abe-4bd7ad326b29","year":2024},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:fd338b0c2bc257d1ac0d35aa012bce485458fafbe10c4fed7920653eab2c0bcc","observation_id":"3275d42a-0d48-4709-806f-3f04d16565f8","resolution":{"observed_at":"2026-05-20T20:54:01.389505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"c2f76d20-9d66-4c1e-b02c-02f4d39c2343","year":2021},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:4f9fdadc8d17d5c4b03dfd12138cd5eee95edbed7035a54b79093b27d27e77e8","observation_id":"e66960ee-d957-41c2-87ee-c3fb35f28fb5","resolution":{"observed_at":"2026-05-20T20:54:01.406078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can vlms actually see and read? a sur- vey on modality collapse in vision-language models","venue":null,"work_id":"df4ff592-0ba5-464a-acdc-8f07703b2180","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:6125b7d1adbb16275e31bf31b4cdf6e30e5b6d6a06e7eea4dce181f208a55a51","observation_id":"ce9cfe12-bf1e-4f51-99a7-918e036feabb","resolution":{"observed_at":"2026-05-20T20:54:01.397570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal large language mod- els: A survey","venue":null,"work_id":"0ba81ad0-dddf-4168-a835-d83f052a6e6d","year":2023},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:09e7bb7fa1a7189690dd1c4fe7934a41acf04df031e0358841620e79721a03e6","observation_id":"51251733-3a7c-4e34-8f7c-83370dc76356","resolution":{"observed_at":"2026-05-20T20:54:01.395573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesize diagnose and optimize: To- wards fine-grained vision-language understanding","venue":null,"work_id":"bc1bc8cb-dac1-408a-aa12-9246b577263f","year":2024},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:06586f13e777c6bac820a965c43517debf01141dc3b423040d650067502b620e","observation_id":"6cddc04a-31f1-403d-a843-fc49f5e3d9cb","resolution":{"observed_at":"2026-05-20T20:54:01.391567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm as video narrator: Mitigating modality imbalance in video moment retrieval","venue":null,"work_id":"234d344b-102b-4b78-b487-f543fbf32c33","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:f67026c344af1cd46d35da775e63e6fccdeb0118f50edeb415f8ffd3770af877","observation_id":"ba85d94f-5558-4b8a-b32b-2ed2d00d18cc","resolution":{"observed_at":"2026-05-20T20:54:01.399764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multi- modal reasoning via thought chains for science question answering","venue":null,"work_id":"023517ba-e370-439b-a63f-2f45d9606cbf","year":2022},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:6026e3e2c439747dd566b0d4120db456b362a1a56e08232a35f3273063af5358","observation_id":"fd5e1827-8cc6-4b4d-8519-905cae0d5b9f","resolution":{"observed_at":"2026-05-20T20:54:01.412232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tun- ing","venue":null,"work_id":"b193a3db-6a9a-48dd-aca5-d89086961d14","year":2024},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:a1dafac6e1d599e5e7f34f48ae294511a2cc513c4ae4f7dce8895b30fbb4e516","observation_id":"0f6df2ba-8624-4f9d-a601-73480860c380","resolution":{"observed_at":"2026-05-20T20:54:01.416780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:0f9a609fa4f6b754891b35191d98ebd9fb20c3cd98ea5fb3bdcb7fb50f084281","observation_id":"4acc3667-87ca-44d5-b43c-717949272b72","resolution":{"observed_at":"2026-05-10T08:43:01.156032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large lan- guage models","venue":null,"work_id":"859103f4-de76-406f-b8ed-e1d027776aab","year":2022},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:46a4d7fba0dc5c40295cc01b610b1876be0b493b48652c70d3b48e24989e675c","observation_id":"01b74e83-1f91-4543-a190-85634bdc049d","resolution":{"observed_at":"2026-05-20T20:54:01.393549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"b8546145-fb04-42ac-83e2-ce22bc7c7db0","year":2018},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:e053fdc958f7c6deedf2ed77bf60010d62ddd62c87dd4c68239fd318681166a1","observation_id":"66b1e7de-c85d-48b7-ac36-99e226c02fec","resolution":{"observed_at":"2026-05-20T20:54:01.422746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench- video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":"1219ae79-e837-4e3f-b966-12af3b0041f7","year":2024},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:ba296b6ff7bb9ac81790767b8095365d3ae4325f134b1a34e8ad0607ab519e5f","observation_id":"95d0e755-37dc-4c7a-91eb-251431ab7159","resolution":{"observed_at":"2026-05-20T20:54:01.410307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10552","last_updated":"2025-08-14T11:44:52Z","snapshot_observed_at":"2026-07-06T22:12:50.244801Z","submitted_at":"2025-08-14T11:44:52Z","title":"When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.10552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10552","snapshot_observed_at":"2026-07-04T11:59:50.274843Z","title":"When language overrules: Modality imbalance in vlms","venue":null,"work_id":"beb44eef-1d39-40a7-98b3-80a16cfe93bb","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/2508.10552","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:77881c6dae01f7aa6bbd651728b6296b365b3ec68e2620507a940d50a31b9cfa","observation_id":"4822d922-35d1-4da0-bc30-a3e6167eb3a4","resolution":{"observed_at":"2026-05-10T08:43:01.163886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating modality collapse in multimodal vaes via impartial optimization","venue":null,"work_id":"36e69b9f-98e5-4cf8-b0cd-7782fa633271","year":2022},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:87c2a088339183ad71ed5377f3bedb2a522c477d5b4d20e327f67cd53cb9c484","observation_id":"45015d1f-d69f-4a0c-9ad4-2162c9e1b89a","resolution":{"observed_at":"2026-05-20T20:54:01.404105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assessing modality bias in video question answering benchmarks with multimodal large language models","venue":null,"work_id":"f4b533d5-0d82-45d6-8787-013069fea8ea","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:a2a1eafadace04528e24470db8027274c7b44f7a6ea44282b7c7466debf3b73e","observation_id":"510e0e70-c6fc-4581-adcb-664ff92539aa","resolution":{"observed_at":"2026-05-20T20:54:01.418704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23200","last_updated":"2024-10-30T16:49:59Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T16:49:59Z","title":"HEX: Hierarchical Emergence Exploitation in Self-Supervised Algorithms","version":1},"cited_work":{"arxiv_id":"2410.23200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23200","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hex: Hierarchical emergence exploitation in self-supervised algorithms","venue":null,"work_id":"3b880222-c828-4829-8990-7818f2000510","year":2024},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/2410.23200","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:7ae625498f3bb2fb29fcbdc0fad0caca5b46afde58b558734687e8d1f6e594da","observation_id":"6c794de5-5000-4821-8da2-b93d4501d4b0","resolution":{"observed_at":"2026-05-10T08:43:01.146562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Countering multi- modal representation collapse through rank-targeted fu- sion","venue":null,"work_id":"52e52b54-c01c-4ea8-8cca-f1d7d3e7704b","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:7b43a8a5e6a771655359f1c8e80b007b22f86a3e6d60be08621c836b191ac958","observation_id":"766ef1a4-2ddc-4d11-8b5b-8f5bb5365651","resolution":{"observed_at":"2026-05-10T08:43:01.149746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.12576 , year=","venue":null,"work_id":"95fc38c6-36dc-46f4-8854-b7adbb5ca49e","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:50977ac797114655d92a1fed389e07dd27bf8b7d101f7d93d38f8570db1b32b2","observation_id":"17ac0f16-b9c4-4ddb-b4b4-f8eff948a24f","resolution":{"observed_at":"2026-05-10T08:43:01.159640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04856","last_updated":"2023-01-12T07:42:36Z","snapshot_observed_at":"2026-07-06T14:40:35.235416Z","submitted_at":"2023-01-12T07:42:36Z","title":"Multimodal Deep Learning","version":1},"cited_work":{"arxiv_id":"2301.04856","doi":"10.48550/arxiv.2301.04856","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.04856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal deep learning","venue":"arXiv (Cornell University)","work_id":"8b18ac57-ef85-4d0b-abeb-177bc50e5499","year":2023},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/2301.04856","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:bde171e4278db674f96a609d799b9cd927f2df88ff9aa4b3e3b9eee5ec311a94","observation_id":"a11ee470-c5d9-4beb-87c5-224c99a5d9e5","resolution":{"observed_at":"2026-05-10T08:43:01.143127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17696","last_updated":"2026-03-26T23:09:44Z","snapshot_observed_at":"2026-08-05T11:09:44.219025Z","submitted_at":"2025-04-24T16:04:00Z","title":"Hierarchical and Multimodal Data for Daily Activity Understanding","version":4},"cited_work":{"arxiv_id":"2504.17696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17696","snapshot_observed_at":"2026-08-03T02:10:27.131456Z","title":"arXiv preprint arXiv:2504.17696 , year=","venue":null,"work_id":"b655a911-ddab-448f-aed6-e05fb2e7d2be","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/2504.17696","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:91ccb643cf6eb18d887c0464ef458088c14782079cc130eeed9a93521bce13c9","observation_id":"70d4b906-47d1-46fd-9a2c-5f875efbc746","resolution":{"observed_at":"2026-08-03T02:10:27.131456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02382","last_updated":"2025-06-03T02:39:33Z","snapshot_observed_at":"2026-07-06T21:35:32.115224Z","submitted_at":"2025-06-03T02:39:33Z","title":"Multi-level and Multi-modal Action Anticipation","version":1},"cited_work":{"arxiv_id":"2506.02382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02382","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-level and multi-modal action anticipation","venue":null,"work_id":"9d8b3189-4585-4eba-8a31-e7cf92ad5e07","year":2025},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/2506.02382","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:6c52e5be14573b1c56af760df65c6dcd35c92e80448c427b8a234f42c8e8b520","observation_id":"662ff9ba-6ef4-4b1b-bf49-f2a76b02bd15","resolution":{"observed_at":"2026-05-10T08:43:01.167703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal machine learning: A survey and taxonomy","venue":null,"work_id":"2d0ebea2-2b98-4735-a7fe-9cc93ee920ce","year":2018},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:ae678def2758a7eebc5273866ab7bc26440ac0d50b31c40fa9a4539a8954c3bb","observation_id":"2b4cb0bd-21c6-4c3c-8761-e4a9bb78e876","resolution":{"observed_at":"2026-05-20T20:54:01.401959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intra-and inter-modal curriculum for multimodal learning","venue":null,"work_id":"210942d4-f0f5-48ed-9654-5efc931ede2d","year":2023},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:a74eecf33130715b31e62e33fcb5c4bef6d0bde9785089690d45f12f67276852","observation_id":"d16da830-3500-4943-85fe-ab570d773984","resolution":{"observed_at":"2026-05-20T20:54:01.414805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":"11a7cfc7-dcf0-4630-a730-a21034713edd","year":2017},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:d6113cd0523abc32cd4dfad87f4a053b5eb468cc87dc1316f412b7ced30cdb98","observation_id":"685c97da-759b-43ac-b77b-fdc487781475","resolution":{"observed_at":"2026-05-20T20:54:01.407952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:7143e80f31e70b654585ba4e21460e692d6995665d20d21f3ca013c54a1664c1","observation_id":"b7ccc8ea-c1c7-4d11-8a50-48a3d1ddc1a8","resolution":{"observed_at":"2026-05-10T08:43:01.171028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The effective rank: A measure of effective dimensionality","venue":null,"work_id":"54308115-08c4-42ec-a60d-81f3faf26b6f","year":2007},"citing_paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T08:41:54.503158Z"},"links":{"citing_paper":"/paper/2604.16264"},"observation_digest":"sha256:e29064708e025f2a5209243ad8e37ecfc62839e7e865c84f1c5813c58a431798","observation_id":"ea1f52eb-5eb4-47cf-8172-89a0b964fb5e","resolution":{"observed_at":"2026-05-20T20:54:01.420960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16264","last_updated":"2026-04-17T17:20:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:20:42Z","title":"Information Router for Mitigating Modality Dominance in Vision-Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":7,"verified_fuzzy":17},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2604.16264."}