{"as_of":"2026-08-08T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a301c41fe08415ac9e616aaf6a154fc26ed737767e1aea760da639c30238afe","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:10:26.201549Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11550/citation-record","integrity":"/paper/2506.11550/integrity","json":"/paper/2506.11550/citation-record.json","paper":"/paper/2506.11550"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:22.711341Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.711341Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:888dc38d78fb35cc88a6ec1c596735d36d3eee52c1d4d3c2847cb417286ddf5d","observation_id":"0a548648-f9e1-474f-bea7-08474783b0d5","resolution":{"observed_at":"2026-08-07T04:10:22.711341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:22.754631Z","title":"and Zisserman, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.754631Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:30a73af530720ae8a9b37164ed23ef7d8e209d069f4ec741bd8a78e0f3e54b90","observation_id":"a37b3747-9691-4892-aaf4-a8838f5588c3","resolution":{"observed_at":"2026-08-07T04:10:22.754631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:22.825029Z","title":"G., Keutmann, M","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.825029Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:28a0ecb16a3f1f0e5eb860f044ee72070d4ec413e2cc25b52a6ab1e449cd4c39","observation_id":"ef675764-2246-43ac-9302-17998766915c","resolution":{"observed_at":"2026-08-07T04:10:22.825029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11059","last_updated":"2021-06-21T12:46:47Z","snapshot_observed_at":"2026-08-03T17:23:12.981213Z","submitted_at":"2021-06-21T12:46:47Z","title":"Improving Multi-Modal Learning with Uni-Modal Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11059","snapshot_observed_at":"2026-08-07T04:10:22.882216Z","title":"Improving multi-modal learning with uni-modal teachers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.882216Z"},"links":{"cited_paper":"/paper/2106.11059","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:9a7440fd2f595823986e36bbdf8a81a1d4802fd6d92c67bdd20dbf09ed0dcfe5","observation_id":"3a4a5f74-4125-4b6d-a635-0aaaf7dbd6b4","resolution":{"observed_at":"2026-08-07T04:10:22.882216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.571157Z","title":"On uni-modal feature learning in supervised multi-modal learning","venue":null,"work_id":"93478ec3-4666-4b01-8295-879331db6f49","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.938216Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:34c6a2306a52b85cc6f97cb3d1f98d6ebf2b1e6d1c0a6c902184681c3fa7d314","observation_id":"1b778fed-948f-4364-9a02-7a15a5b8d1dd","resolution":{"observed_at":"2026-08-07T04:10:30.581147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.009270Z","title":"Pmr: Prototypical modal rebalance for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.009270Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a4971c32b2f497c33a55ae6fdb1d25d6162bfad7aa025ba797307b422c87e422","observation_id":"d32cf719-3579-4c31-808a-781c5b578f4f","resolution":{"observed_at":"2026-08-07T04:10:23.009270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.530568Z","title":"Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing","venue":null,"work_id":"6833d176-888e-4286-aa55-a3cc6d452c56","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.076510Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:5ba81dc7ee9283144a777995560d65c1ef59c34b466c552331e1622943ecb34e","observation_id":"0ac5d141-ba34-432e-a46b-bdce2cb1aa30","resolution":{"observed_at":"2026-08-07T04:10:30.536474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.348688Z","title":"and Zou, J","venue":null,"work_id":"d9683214-c0d8-4546-aa6f-8118e2e1e420","year":2020},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.142989Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:6625d904286655c26ebd3e6c173999d9cb89b538aae7c2ce602454808091fb9c","observation_id":"3d89c427-7763-4a34-8d2c-90e16c49c61f","resolution":{"observed_at":"2026-08-07T04:10:30.501756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.039325Z","title":"and Piccardi, M","venue":null,"work_id":"58c12b4d-92e9-48c1-89f5-d0f623c375e5","year":2005},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.207396Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a6bea5513088c6360e337b0a43a6473d5906e5534d8686d80035da374b4dd75a","observation_id":"4c371302-6473-4e1a-9c27-2220902b6e49","resolution":{"observed_at":"2026-08-07T04:10:30.171070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.271112Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.271112Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:884ab570b215499689875ebeeb90f8faf3a6af22ba8b04505bcffbe20cc67190","observation_id":"ead9fb94-6b5e-4e7d-a6fa-451af295da41","resolution":{"observed_at":"2026-08-07T04:10:23.271112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.711860Z","title":"Multimodal temporal attention in sentiment analysis","venue":null,"work_id":"63ddc88e-b725-48f4-83d3-261b84111142","year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.327228Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:95029e1503e27897cd3ece4fc9233b06c8bb11f9308daa0b08df8601ac904b8d","observation_id":"49f68553-7711-4e61-a2b9-55abf0f5cece","resolution":{"observed_at":"2026-08-07T04:10:29.842232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.0580","last_updated":"2012-07-03T06:35:15Z","snapshot_observed_at":"2026-07-06T02:51:07.275676Z","submitted_at":"2012-07-03T06:35:15Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.0580","snapshot_observed_at":"2026-08-07T04:10:23.380389Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.380389Z"},"links":{"cited_paper":"/paper/1207.0580","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:938713ac58af4be8c6d4452893cbb490034becec96f4f59db524b306f9d25dec","observation_id":"1948d1d7-4c49-4f0f-8181-5ecd58202e3b","resolution":{"observed_at":"2026-08-07T04:10:23.380389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.489321Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learning?(provably)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.489321Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:5dbe35e37dbe52239ce0fcacfd92f6f6bdc5c647bea1358422985989c5881541","observation_id":"32cd2ecb-c47d-4db9-be75-b762e021b3b7","resolution":{"observed_at":"2026-08-07T04:10:23.489321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.619934Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.619934Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:70d6840708d3e73ee363311fc5b262b3cafe125c00aafc20776e72e3b1347179","observation_id":"32118ad0-dc20-42cb-a51f-290795e1db07","resolution":{"observed_at":"2026-08-07T04:10:23.619934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T10:06:58.769155Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T04:10:23.745725Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.745725Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:88a4030c50591a835de2e47e223d38be7e92b093998fe211007aa7307968f42a","observation_id":"5fc06bc0-4b0f-4b26-8797-9a98b0e95f33","resolution":{"observed_at":"2026-08-07T04:10:23.745725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.507396Z","title":"Efficient large-scale multi-modal classification","venue":null,"work_id":"965308e2-6df0-4ab2-bdce-407881e3a7ec","year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.880084Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:0d26b561d3cbb68536e1bc64b8ffe3dd12f6712ea4215fe2e1202a940a8caecd","observation_id":"c70e264f-0b6b-4362-bcac-496f4c08b55a","resolution":{"observed_at":"2026-08-07T04:10:29.594072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T04:10:24.025073Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.025073Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:0128c1fa8a558ec664dd284bb23d97e1b0227fda1b198e66311513cfff8b1573","observation_id":"829b936d-f245-4217-b538-1bef5d29f346","resolution":{"observed_at":"2026-08-07T04:10:24.025073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07930","last_updated":"2024-10-14T08:19:13Z","snapshot_observed_at":"2026-08-01T00:47:25.545179Z","submitted_at":"2024-05-13T17:01:28Z","title":"Improving Multimodal Learning with Multi-Loss Gradient Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07930","snapshot_observed_at":"2026-08-07T04:10:24.203659Z","title":"Improving multimodal learning with multi-loss gradient modulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.203659Z"},"links":{"cited_paper":"/paper/2405.07930","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:b740b15f4693068f9022316e3c36628972790a8efe0ff73926998cd61b7a361b","observation_id":"cd2bdb4f-e0cb-4b42-bdf5-ff41b9ad5c0b","resolution":{"observed_at":"2026-08-07T04:10:24.203659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.329058Z","title":"Boosting multi-modal model performance with adaptive gradient modulation","venue":null,"work_id":"915deade-d8a7-4ae0-b68f-09b1511471d2","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.312620Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a44e92627fb882eb76e1aee53316d3d58c47664c2a3aecc7c70be4988b9b98c6","observation_id":"2933294e-1119-451e-8bef-39f6d905a80b","resolution":{"observed_at":"2026-08-07T04:10:29.375825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08536","last_updated":"2023-07-17T14:53:09Z","snapshot_observed_at":"2026-07-06T15:54:51.088869Z","submitted_at":"2023-07-17T14:53:09Z","title":"Variational Probabilistic Fusion Network for RGB-T Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2307.08536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.08536","snapshot_observed_at":"2026-08-07T04:10:26.395439Z","title":"Variational Probabilistic Fusion Network for RGB-T Semantic Segmentation","venue":"cs.CV","work_id":"e5dcb732-ffef-4e03-89ba-d79a9245bf68","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.420906Z"},"links":{"cited_paper":"/paper/2307.08536","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:89602819d7e331edc86a0347ff7850e77418828473ef37372347c5c15f5371da","observation_id":"e0d6d25b-6979-43dd-ad18-4559de3f7fb9","resolution":{"observed_at":"2026-08-07T04:10:26.448724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T04:10:24.551100Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.551100Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:e31ee49239140fe3af7a59107d0dadeff247584709ed2c56f7bff1b4c1427975","observation_id":"96529e4a-2b61-424a-b6d0-e66114088001","resolution":{"observed_at":"2026-08-07T04:10:24.551100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.139780Z","title":"Y., et al","venue":null,"work_id":"538b73a6-23cc-4721-8844-38ae3f4bc95a","year":2011},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.643431Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:e472072bfd9c7749f0bcdc6c3ceb3c2865fc2c35ca7769377edf9c900b500dcf","observation_id":"73ac3bbb-77bb-44f7-85c7-7adf0d51a014","resolution":{"observed_at":"2026-08-07T04:10:29.222101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.004063Z","title":"and Efros, A","venue":null,"work_id":"43e07a78-2059-4460-9f04-1725cbdccf72","year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.731313Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:94d189b2ffd2888cef09fdf4737940cbf17eb0aa244d1694c2110409c65eb625","observation_id":"cfeb68f4-f573-4ade-85c5-d9de5a4c8155","resolution":{"observed_at":"2026-08-07T04:10:29.058207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:24.830032Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.830032Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:51417ebeafccafec1127bfe0125f758323ac3933f043f6a1df1accfe7b137caa","observation_id":"8fb4b2a3-62e0-4ad5-8ecb-be3c553a1945","resolution":{"observed_at":"2026-08-07T04:10:24.830032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:24.900289Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.900289Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:82323458d8fbefae517df6bd27a4c8a6af3925bddfe6485e6238133dd5637a57","observation_id":"1baf4fb1-0daa-4f07-a19e-20c88c4711f3","resolution":{"observed_at":"2026-08-07T04:10:24.900289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.785267Z","title":"Graph interactive network with adaptive gradient for multi-modal rumor detection","venue":null,"work_id":"8ed5a795-1354-4758-9c71-211c399a2cbb","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.991403Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:c3cab34d1fb6229e481de03ed105f4bfe0cab0d6032490fbb27ef7d6e0505a96","observation_id":"05f3c57a-e8e3-46ab-b66c-22c2b7e279cd","resolution":{"observed_at":"2026-08-07T04:10:28.859950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.614651Z","title":"Learning to balance the learning rates between various modalities via adaptive tracking factor","venue":null,"work_id":"810ac292-860a-42c5-832a-6b4334c6ebd6","year":2021},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.076646Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:986ba512d956007706641edbcf20ab51b5f967fd06264a89d90630f3f09c97be","observation_id":"d590d297-cad3-497b-9b2f-61a353e0f4cd","resolution":{"observed_at":"2026-08-07T04:10:28.674407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:25.162190Z","title":"and Hinton, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.162190Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:b9171d2dc91133f4eb636f1e331a5770059469a05d8f4d5946c1ed1dfa15852e","observation_id":"0b34001e-84c2-4555-b6f7-721dbb80dc7e","resolution":{"observed_at":"2026-08-07T04:10:25.162190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.422115Z","title":"Centralnet: a multilayer approach for multimodal fusion","venue":null,"work_id":"c38edc42-2935-44e3-b197-7372cb1814ad","year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.229454Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:6747b084f2d16728fab7bea2b81be1610977237889bbc9567ff3834977193da0","observation_id":"288b2044-a7b1-4cb0-b9cf-28828a11a4d8","resolution":{"observed_at":"2026-08-07T04:10:28.487663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.272742Z","title":"What makes training multi-modal classification networks hard? In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp.\\ 12695--12705, 2020","venue":null,"work_id":"6be85312-0a87-4ea3-8091-c4a99a5b6e6c","year":2020},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.320568Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:ed6fe7c141a90a3176243bd7d3a9131088fbfff02fc3954fa8e60b4aee88bb42","observation_id":"a7fb419c-4dec-44d9-9bf6-b689ff1b43ac","resolution":{"observed_at":"2026-08-07T04:10:28.330146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.097045Z","title":"and Hu, D","venue":null,"work_id":"635f3d53-1be2-4a02-b2d7-d28857723cce","year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.401392Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:9e5e6a97d51882bdddabffce1ef8158fa76930c85858d0dd1fa24fa4888ab140","observation_id":"5c509e4e-dfa4-401d-a12a-3cdbe95f0733","resolution":{"observed_at":"2026-08-07T04:10:28.135413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:25.506597Z","title":"Enhancing multimodal cooperation via sample-level modality valuation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.506597Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:01e034e9fc3a2cf1b35c70c92e817dbcdd46b8032b6070ea03730f3fd09cace4","observation_id":"8ce45d74-709e-4ecd-b3ec-b2aef8c70c21","resolution":{"observed_at":"2026-08-07T04:10:25.506597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.897333Z","title":"Diagnosing and re-learning for balanced multimodal learning","venue":null,"work_id":"8d59bc19-4da1-488b-8d39-c8fcfbe49fed","year":2025},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.602577Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:05fa1c593d124b7e534a2cae30c11976108bf8c5786867832d7726ad47ab5b89","observation_id":"29b606e7-f28d-40b4-8212-01f0a0aff8ff","resolution":{"observed_at":"2026-08-07T04:10:27.979270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:25.688411Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.688411Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a09099f776f9d1e7a045611d655992430dc70d35d073759a9d03112b28833ff2","observation_id":"a9bae4a8-d686-43d7-bb35-31a1417d66df","resolution":{"observed_at":"2026-08-07T04:10:25.688411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.685787Z","title":"Mmcosine: Multi-modal cosine loss towards balanced audio-visual fine-grained learning","venue":null,"work_id":"e61b61d1-afcf-487e-a7df-a992b4df893b","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.766512Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:645b21292bd9d63cc59f58fecc80c9684699c9c7e20c8ef3aa04720878a4e7ee","observation_id":"1a3b309f-37d9-476f-b68c-ae2d1a87ea43","resolution":{"observed_at":"2026-08-07T04:10:27.768250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.500671Z","title":"Mcl: A contrastive learning method for multimodal data fusion in violence detection","venue":null,"work_id":"ae721352-5df5-4f7b-94b9-c23398b485a5","year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.847513Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:7f9ac8d895e2c72d26cd14c6652f39ffc37bf82c5f8b72ce5b5f94b0800d4ac3","observation_id":"605b493c-a82f-42e1-90fd-fe0e7eb854fe","resolution":{"observed_at":"2026-08-07T04:10:27.580294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18947","last_updated":"2024-11-01T13:53:44Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-27T07:22:28Z","title":"Multimodal Fusion on Low-quality Data: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18947","snapshot_observed_at":"2026-08-07T04:10:25.936570Z","title":"Multimodal fusion on low-quality data: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.936570Z"},"links":{"cited_paper":"/paper/2404.18947","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:430e3fa70da17e28e3d337a076686fe34fef565d6c0ee21c090138cf0419421b","observation_id":"1c9965ad-39f0-4d8c-ae8e-101dd49b6895","resolution":{"observed_at":"2026-08-07T04:10:25.936570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.198634Z","title":"Multimodal representation learning by alternating unimodal adaptation","venue":null,"work_id":"d1d6e319-22d7-4859-88b4-02318b134ae8","year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:26.028364Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:51e39c1360a44fbaab0b89f187080fc18ebbb5b9f2db1aa6bb0604b84ae9c082","observation_id":"e1544be6-de22-4c7b-9047-00e9578606a1","resolution":{"observed_at":"2026-08-07T04:10:27.355798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:26.886922Z","title":"Adaptive mask co-optimization for modal dependence in multimodal learning","venue":null,"work_id":"65fe9e8a-db09-4d79-9f44-2a326c1ea62e","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:26.117608Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:74006bfb41129c2fe0eebfef4d5ace098dababca6f01ca75935d0444b027c734","observation_id":"0b6ee059-eb55-4e7d-81ed-512085d0e225","resolution":{"observed_at":"2026-08-07T04:10:27.048028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:26.703245Z","title":"Vision+ x: A survey on multimodal learning in the light of data","venue":null,"work_id":"63884c98-f87f-4ff7-adcd-47cdf38b21bc","year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:26.201549Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:38523707c88797d82e300525b9f719e2fd0d06d16f0d6426899559ae19d89f7f","observation_id":"af26b6f3-d4ed-4fa4-9486-f6282cc8deac","resolution":{"observed_at":"2026-08-07T04:10:26.779388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.11550."}