{"as_of":"2026-08-08T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f40cd3193f07450b692e144903b805a53087ef8a129eb79384e29462228ab1b4","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T06:21:17.706173Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08839/citation-record","integrity":"/paper/2607.08839/integrity","json":"/paper/2607.08839/citation-record.json","paper":"/paper/2607.08839"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Soundnet: Learning sound representa- tions from unlabeled video","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:6a06301e9f2a25fecec8634713eaf1de12bd62d73a55616e4c216a1f41b193f2","observation_id":"626f703a-095f-4fcd-92d8-6f8dfa5b23bc","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:c3fb67e3993353f2af42ee101b4e6124425948ebd99e4573e94960388257a5d3","observation_id":"e5ae8f13-b760-48b7-9f18-e4bb8da46024","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Paligemma: A versatile 3b vlm for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:784358cda148e681176a5d036f1fc0136c3f0d3372d2edd30707996bb2d3fdfa","observation_id":"a42a5386-8c11-47aa-8e51-808434b3eafa","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:0e619a2455283b919835376a2bb56a49e641ce31d221b70521da545318886ef9","observation_id":"c780f504-718f-4180-a3eb-68f53964bd66","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages.arXiv preprint arXiv:2305.04160, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:ed71512f20ed118732cee000e0d38f6ffd6fff89df1bab34cbfcb9fc96d4baec","observation_id":"a711cd73-0465-40fb-9773-d401b416a485","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Toyota smarthome untrimmed: Real-world untrimmed videos for activity detection.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:9733955d4bba45a997a4decfccd492bfaff380f6be45c0227f95681d656d1654","observation_id":"d080e360-0eac-4be3-b623-c55c4e46301d","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:71691ec4fb04f59d12f1b279dafe4a6c41f74edd2b90c281759034a552a7115c","observation_id":"5ff11fed-02d1-4690-a5a5-af28d5b62a6a","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Modality-specific and modality-general representations of subjective value in frontal cortex.Communications Biology, 7:1550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:ec4807318f4ac97ec451a10e715a46b5cbca562536876023b47d42a53ce57964","observation_id":"b36b497c-6fe4-4e78-8866-dfda9c2fd602","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Toyota smarthome: Real-world activities of daily living","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:8fe5ff21e7715fcd52b7d8e3c6b27f23c908e2c3956fdf7f23cc41aa260ede91","observation_id":"a6158c07-6efc-4ec9-94d7-6a0e422f5101","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:228678b04065a51c31966c0aa652da79392b32dd4160e1d75015a0dc95de9bbe","observation_id":"7ca2e752-0e48-469a-b279-367f5fe59e25","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:cde2aca805e72962d1894e69e880c4371a41d5975cf6a45b245e490bff7c3ee3","observation_id":"3b8ca3f7-2dfd-43b1-bfc1-36959eec376f","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Cross modal distillation for supervision transfer","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:7965a3740aed924d643038bb2ede659209e1c9b4843b62983db28e929b2be5c6","observation_id":"01732568-b904-4a37-b855-abad485ba64c","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:0490722986f8019a0c100d04a7beba64a731098da549ea29b07e3d25d9191b02","observation_id":"af776546-44b7-496d-add2-51e05deedf1b","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Imagebind-llm: Multi-modality instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:f292e2549510b932f6c18bd0664a2a578f379df28639d48b33a03764fa9b2501","observation_id":"bdcb36fe-bb42-4043-b21b-e1cbb45c799e","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Enhanced computer vision with microsoft kinect sensor: A review.IEEE Transactions on Cybernetics, 43(5):1318–1334, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:b332895dae56605bca07e6da4e4d4b9776083d16f77f885cc6a62fa3cac70ecf","observation_id":"f935827b-1252-4276-82de-137d734d2f1c","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:53b2aecb9b71356d1d7ac3adc02f88135f5d825c55981c3a345ffb23018ad6e6","observation_id":"ff52c1fd-2af1-46be-8c76-bd17425c6dbd","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:bff6daf89acd0f3f529da444cdf29c8631953d8c347c99a896a49d8438ad937e","observation_id":"5e1c56d7-3c1d-4b90-99fc-710c323929a7","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:7856330010234aaf4008cef81f801862bc74337b4be088bb358ad887bbfc21cb","observation_id":"f4a318b7-0649-4984-a69f-6a7abd3abb53","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:4437ed6772ea25f92fb83cdb082d063811760b331ba5baf0715ed420bbbf546f","observation_id":"1a9ad964-6b8f-4907-a408-ed459e0b3ec9","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:b901d6920d63c5af16f35a77ca6df8ccb36952a4a1a97be4105c8d943e4786d5","observation_id":"83e4e8e5-f9cf-4c34-8070-bf1c7f657c62","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Unifying distillation and privileged information","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:71b51435f4c9a21c8bd1667a17b447f303507c853b735dcdfcd2866790a5a7cb","observation_id":"4c65beae-391c-4092-8111-7a1769271147","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Pretrained transformers as universal computation engines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:b830d32850f3fcf25783425db7c2aa12877e493ee8ac9fed057751f36c524da6","observation_id":"96beb16c-6d58-4486-9589-32eee04feb83","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Smil: Multimodal learning with severely missing modality","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:6b9c3dc0cc8fe5d3fae5cf02323a43fcf9f8bb861a1efd817c3e97aef53efeae","observation_id":"f6cd8396-4f70-4826-a7bb-0643e3a81b89","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:ca18c50c10ef0d8a60b3d3812576225b5baebc1ebab026b49f8a50b0bb977585","observation_id":"8e84c323-6dcc-4433-b93a-6f4faf148709","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Anymal: An efficient and scalable any-modality augmented language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:ef7797f4f32fef7c06a2e0ec0777aa97d23ebd2c9ac72c78a6349e8348a4ff67","observation_id":"2ac9a716-fe90-4b8a-a993-919a0edcabd6","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Taylor, and Florian Nebout","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:cdc079d9701b0006e2f2d8c539bf112f39e2bfd22af3c2b7292360c4ce2b1f63","observation_id":"340ee3e5-a208-4ea8-a014-42d4e388dc4a","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:e49c8b67e6f0eecdd8d524cdb8637180414a1f22e68a34594336f2bcea74b837","observation_id":"365376f4-bc59-4cf6-b717-39a3be9d3163","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"McDermott, William T","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:c32dce6dc57fc0fce5e8036306b8cd940f63c7c9a40672eea192c237cf649695","observation_id":"dddb8882-7ef5-486e-8988-4b5d37693553","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"X-instructblip: A framework for aligning x-modal instruction-aware representations to llms and emergent cross-modal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:4b862b74f9d9fa06342b9f44d51ccdc147ed3a39667596408fd8cf315734519e","observation_id":"b5a8313c-c7ac-43a1-b789-49eab812a745","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Missrag: Addressing the missing modality challenge in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:d41f3f97c0ba640894bf58fdcc634a283dbfec343d48f0c4b9fe7611c37de28b","observation_id":"23a9d4b9-5904-4dd6-a7bf-9c3c4a2e6d38","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:10e8bb81ed00169251d4bab8da338911f5ce20d368d47d4d9d1ee9240a34dd7f","observation_id":"33074b1e-ca8d-4687-ae4c-406c95357da7","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Do vision transformers see like convolutional neural networks? InAdvances in Neural Information Processing Systems (NeurIPS), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:ebcfb28c7af1d3bec2dc7720a9fbbef14bb88fb328d1143cff073f26734e2b53","observation_id":"b71cccaf-52ec-4b9b-9160-cdb225ba875e","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Llavidal: A large language-vision model for daily activities of living","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:74d22aacba409c4e114ec71a61179e51fc9a13e33a54a6ef36123be064d990b1","observation_id":"2d8071e2-9198-4a93-b2da-694d5b8e3031","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05711","last_updated":"2026-07-07T18:04:35Z","snapshot_observed_at":"2026-07-11T23:17:19.170750Z","submitted_at":"2025-01-10T05:01:58Z","title":"From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05711","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"From my view to yours: Ego-to-exo transfer in vlms for understanding activities of daily living.arXiv preprint arXiv:2501.05711, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2501.05711","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:6660684cde17d21b8d350139f0ef82a59b792de3b8bfe87c715d325215b66042","observation_id":"c10bd90e-a26c-4bb9-b954-b2fbbc7f999e","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Viscop: Visual probing for video domain adaptation of vision language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:2653b8ea60b32928aad74ee96ec9d33d342a23950112cddac330f513e4698554","observation_id":"ca84a7c2-2335-45d8-8cc1-9c5ad1f2e077","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-07-06T16:56:42.232555Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Timechat: A time-sensitive multi- modal large language model for long video understanding.arXiv preprint arXiv:2312.02051,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:12509027b3252319a96fa41ccd33eafaa3bfb3f238e3de160b4d2191208ba709","observation_id":"ddf24105-f1b7-4d79-bbad-836acba77bba","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:859bed3ad1d62c8bf51dfef44679441d3507ba5b8ef8d671934364352ca03f82","observation_id":"436579f9-fb15-4103-aa2c-c530183e9bda","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:49c2775d5140f0f9646d88e4aa0838270ff7c9b821688b5ae77915108420c9e2","observation_id":"025c9f29-273e-4d73-abec-e5eff61c208e","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:a7c7be807e282d8ec1399ff9eae6fd1cc1a9fb3715885e11eb7afca678587a18","observation_id":"9ab33f9a-a6c6-4717-b042-fc9e6004c88f","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Learning using privileged information: Similarity control and knowledge transfer","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:6bb47639cefefeb9e5b462359674f4f791aa6c4803e23d4380a8f16401a1ae46","observation_id":"14936159-99e8-4181-8f1e-728abba11442","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Deep multimodal learning with missing modality: A survey.Transactions on Machine Learning Research (TMLR), 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:e8cae62d7e7a99fa6edd0ba08cb08b82a84a23a5754b525be389c87f9ac644fc","observation_id":"0d940a38-29a1-463c-ad07-82105f412342","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Qwen2.5-omni technical report.arXiv preprint arXiv:2503.20215, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:813fa8d80f657687946a44dd834420c7806238e9848bc70908a3b8e3577f5e0b","observation_id":"2411e2f5-dd31-4654-952c-067e43d15dbf","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"The modality focusing hypothesis: Towards understanding crossmodal knowledge distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:888425706c287f18c730f019daeea8f6a7ddd309958b99e17cd41a12c05ae0d4","observation_id":"0fa61c4f-d2fe-482e-b6c9-c4688e8a05df","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:71c7ff75053b3ab1861d5f999b3f1fb7977896b5cfc6663ac1f2b2f2cb6f8d39","observation_id":"3e810d4c-a0ff-4ecd-9349-5fad21b68efd","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:1e578c2468d5568e9b38e2d700433e4b2270dfeaeeb4e2d6eb2ebac5c7831f72","observation_id":"82ca6b6e-400e-4d22-abc4-0c909ef136c6","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:3c79cc593f8c8f3fb87580890166c4d79985324a500c2351989b626e48ec8803","observation_id":"24ddc168-f15f-4540-bdd2-b60ee6b1cdb0","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:a3a5bc4c6cc27f49adbacf11e6fcf9f61ecc8dda20e2413f4282184e07c62d70","observation_id":"a3a22237-a628-46fd-8bf5-8fb7a228fc64","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:5f53dd324dfaf46b6cbe25cec1a3d4989027d3ae8583e62c02c044d1774c1f77","observation_id":"1fd7051e-8890-4b0f-bff8-3f46d9b1627a","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:57a7cd472dd03b2544b1f31c77a88342de397c829e4086b75f21b738a59cac92","observation_id":"a9ad08bf-df7f-44ad-863a-96d7cb48e4ad","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-07-06T15:56:25.975005Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Meta-transformer: A unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:d2500f82bd56143640a0277dcef58197f68b7958fd1de7829e2cfaac33aefd4f","observation_id":"d9ed1494-8d8a-42e7-9ef6-8ce8174919a0","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16103","last_updated":"2023-05-25T14:34:08Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:34:08Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16103","snapshot_observed_at":"2026-07-13T06:21:17.706173Z","title":"Chatbridge: Bridging modalities with large language model as a language catalyst","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T06:21:17.706173Z"},"links":{"cited_paper":"/paper/2305.16103","citing_paper":"/paper/2607.08839"},"observation_digest":"sha256:56a97322b6714beeefc86b04e0c48dc8539d1151ea6ca586dfb5d64a46b290cb","observation_id":"2dfae590-14b8-40e3-84e3-e8a20030a4be","resolution":{"observed_at":"2026-07-13T06:21:17.706173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08839","last_updated":"2026-07-09T18:00:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-15T23:17:54.548359Z","submitted_at":"2026-07-09T18:00:47Z","title":"Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.08839."}