{"as_of":"2026-08-07T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8686b8d18422a00530b08cbc9eaedb18de38e8e69bfaeb18c61e27b0ca770e0a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:42:02.959815Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:12:16.490080Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:36:17.633556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"cited_work":{"arxiv_id":"2507.10203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10203","snapshot_observed_at":"2026-07-01T22:36:17.633556Z","title":null,"venue":null,"work_id":"da9d241a-8ac9-4001-abf4-97fad24a5209","year":2025},"citing_paper":{"arxiv_id":"2606.02679","last_updated":"2026-06-01T14:20:12Z","snapshot_observed_at":"2026-08-04T20:09:52.630544Z","submitted_at":"2026-06-01T14:20:12Z","title":"Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:12:16.490080Z"},"links":{"cited_paper":"/paper/2507.10203","citing_paper":"/paper/2606.02679"},"observation_digest":"sha256:de3b4891b7461337727ee104374ee3642f84944436c01652c05bcbd71efcae34","observation_id":"8af3ae09-e80d-4609-a093-83081d5132f9","resolution":{"observed_at":"2026-07-01T22:36:17.634863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10203/citation-record","integrity":"/paper/2507.10203/integrity","json":"/paper/2507.10203/citation-record.json","paper":"/paper/2507.10203"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.147756Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":"f3546bb9-28e9-4681-ade7-dbc2fc24340f","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:00.907865Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:099fd77c6098a9cfa137f130e55c1a6acae14ecb5f5ba8e351de06cd39b135dc","observation_id":"908ea99e-ec7f-4dab-807d-281ef5ee7609","resolution":{"observed_at":"2026-08-06T17:42:05.151546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.137619Z","title":"Learnable irrelevant modality dropout for multimodal action recogni- tion on modality-specific annotated videos","venue":null,"work_id":"8da35c97-a16c-4bce-a287-668cb565b8ab","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:00.974590Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:430e0ce709502b4d7e58f13d2b6a7b3a94ca40ecc99a8ef97c8856a54da4e633","observation_id":"870ef843-6124-4d69-8c27-a8dfb638175c","resolution":{"observed_at":"2026-08-06T17:42:05.141154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.127164Z","title":"Look, listen and learn","venue":null,"work_id":"5bb783e7-b539-4ab9-a54b-de34ff60cce0","year":2017},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.047579Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:56e4bce58c72f74801e7fb44c41cd1e85e0190798d23cd169f64814048372627","observation_id":"5689b35d-f4aa-4a65-800a-f9e6599055b4","resolution":{"observed_at":"2026-08-06T17:42:05.130252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.117166Z","title":"Mmnet: A model-based multimodal net- work for human action recognition in rgb-d videos","venue":null,"work_id":"20a52eba-108b-45f4-8c74-224b13d6e239","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.094069Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:a3b34677c67558baed8e8237f0e1b1e983172d2e7cf4f7404685024bc6d7cbe2","observation_id":"d8f66f01-31ac-4c14-afc7-46ee85adeb91","resolution":{"observed_at":"2026-08-06T17:42:05.121056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.106574Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset","venue":null,"work_id":"9354d710-91fb-4f5a-8f4a-239b434c9e81","year":2014},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.192538Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:cae0d10c6bc9d439ef99800bea751b5dab68be58d5e5cb98cdeefb77c4430ac8","observation_id":"bb8cf2b1-9d6e-4b50-9db1-f193c67532a9","resolution":{"observed_at":"2026-08-06T17:42:05.110239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.096088Z","title":"Shapeconv: Shape- aware convolutional layer for indoor rgb-d semantic segmen- tation","venue":null,"work_id":"faf48949-4611-4786-a785-6e08a8601f7d","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.239618Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:385683b59ebd3c3541d82eaa1c3d262f8a79a76f37ca9f7db22e4425149ed78a","observation_id":"27e970f0-5db4-499f-b479-0edbc255f275","resolution":{"observed_at":"2026-08-06T17:42:05.099921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.086450Z","title":"Mars: Motion-augmented rgb stream for action recognition","venue":null,"work_id":"b11de41b-b331-4cec-9fd3-06bb6dcb1777","year":2019},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.302791Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:4b1258ee75854be5451405f078b82701a86e55a9f2f0f48f3c6e0ebe4e816ea0","observation_id":"090b2373-3d58-4812-acf2-52839de0e9f6","resolution":{"observed_at":"2026-08-06T17:42:05.089975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.076231Z","title":"Rfnet: Region-aware fusion network for incomplete multi-modal brain tumor seg- mentation","venue":null,"work_id":"ceb4961e-9106-47e5-8b26-a4d434f54960","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.367594Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:8a57ce865c3f80d0cd75803dfe2aca85e7be7958715353b2d3c02c3290bc2938","observation_id":"d70d8552-957f-4f2d-93db-df5c5f1a49c9","resolution":{"observed_at":"2026-08-06T17:42:05.079799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11059","last_updated":"2021-06-21T12:46:47Z","snapshot_observed_at":"2026-08-03T17:23:12.981213Z","submitted_at":"2021-06-21T12:46:47Z","title":"Improving Multi-Modal Learning with Uni-Modal Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11059","snapshot_observed_at":"2026-08-06T17:42:01.435643Z","title":"Improving multi- modal learning with uni-modal teachers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.435643Z"},"links":{"cited_paper":"/paper/2106.11059","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:e9f0db121eebc9ed9c5ea89fa2958de6c61d45b93d2b96182da7cbce6fa09976","observation_id":"56ae7472-50dd-4a9d-a811-b6ccc6b54b98","resolution":{"observed_at":"2026-08-06T17:42:01.435643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.066412Z","title":"Pmr: Prototypical modal rebalance for multi- modal learning","venue":null,"work_id":"25d44512-12d6-43df-a437-8fbe6a420358","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.475058Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:98adf377fe7ee88a1f69783e46f44afeac60def5528ac108c2c3ca7a927355f3","observation_id":"80d8db26-e4da-4b2c-a730-c0baa53087b0","resolution":{"observed_at":"2026-08-06T17:42:05.070117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.057037Z","title":"Modal- ity distillation with multiple stream networks for action recognition","venue":null,"work_id":"2e07f623-c4ed-42fe-89f5-5fadbe65b0da","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.530044Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:3376ca9c8ff1c32b6785b6d4b6efff8f398756712eb2cbdb8b090c0aaa1319a2","observation_id":"a2c688b3-b0a8-4981-a291-8b13f3bc6926","resolution":{"observed_at":"2026-08-06T17:42:05.060418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.047125Z","title":"Ensembles of classifiers: a bias-variance perspective","venue":null,"work_id":"8e909bbd-9998-4e00-b320-59d56f10c2df","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.569455Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:7180beadf9862a1a580cd2bc2909305ee59fabf4c071d24f8d50778ab59a8802","observation_id":"beb8b611-420f-4c29-803a-3ddf8c140bd8","resolution":{"observed_at":"2026-08-06T17:42:05.050546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.037072Z","title":"Deep multimodal multilinear fusion with high- order polynomial pooling","venue":null,"work_id":"82439d3b-e523-4146-9cd4-9d4ba51cb78b","year":2019},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.582058Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:3d1a68609527d10522b16079aa68ac01fbbfc8edf2cc0bcae4300bd8d7710983","observation_id":"c83e7b7a-be43-4e5d-832c-746131b003f8","resolution":{"observed_at":"2026-08-06T17:42:05.040940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.027607Z","title":"Acnet: Attention based network to exploit complementary features for rgbd semantic segmentation","venue":null,"work_id":"9b43d43b-ea30-4ee5-aed5-800ecbf46931","year":2019},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.614728Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:68910bf06e3d6abfe3dd298ef867ecfe7ff570b759c9de403b6ff36261793681","observation_id":"6627c548-462e-4f12-a30a-35a3182e0432","resolution":{"observed_at":"2026-08-06T17:42:05.031071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09321","last_updated":"2024-05-15T13:22:39Z","snapshot_observed_at":"2026-07-06T18:14:41.996656Z","submitted_at":"2024-05-15T13:22:39Z","title":"ReconBoost: Boosting Can Achieve Modality Reconcilement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09321","snapshot_observed_at":"2026-08-06T17:42:01.658660Z","title":"Reconboost: Boosting can achieve modal- ity reconcilement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.658660Z"},"links":{"cited_paper":"/paper/2405.09321","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:be8f51310d302ac2c2d6a9f83cf2d0a4ece1b4007da1446449f97ca043366e84","observation_id":"0272ce6d-d5ea-4e57-b70d-0bd55f980b6a","resolution":{"observed_at":"2026-08-06T17:42:01.658660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.018170Z","title":"Cdnet: Complementary depth network for rgb-d salient object detection","venue":null,"work_id":"9d4ae251-5896-4d30-998e-9a1bee954466","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.721838Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:c7ed8e4ab2bbc0323e73f4193c4131255d38345ff058f23398dfbb2d6ecc498c","observation_id":"062b0f28-00f9-437d-981a-8897d25e22cf","resolution":{"observed_at":"2026-08-06T17:42:05.021501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.008722Z","title":"Mmtm: Multimodal transfer module for cnn fusion","venue":null,"work_id":"bf9d6147-7e5d-4b89-aa1b-263d25e4453b","year":2020},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.743758Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:f7640e7e9bf801a3a603a9548741978708b2f0f6958f7f170d155ba7b3373011","observation_id":"b8f3358e-4e2b-4b2a-a6d2-b51f2adb0d91","resolution":{"observed_at":"2026-08-06T17:42:05.012004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.998235Z","title":"Boosting multi-modal model performance with adaptive gradient modulation","venue":null,"work_id":"57b4ee18-2a05-4c5c-9cc8-603e0e0a823f","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.771670Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:a8470188052c971d57b854e1b72409b2dae8d9235460c165e0652d08cb1586e7","observation_id":"6b7095c3-04d1-4a47-88c5-843a16aacd69","resolution":{"observed_at":"2026-08-06T17:42:05.002777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.988003Z","title":"Dynamic- hierarchical attention distillation with synergetic instance se- lection for land cover classification using missing hetero- geneity images","venue":null,"work_id":"7e1b5cf9-4586-4b4e-a559-a5faf5f4b2ce","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.861690Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:0fafe6b09bc6cefce5e1825add5602cc9111c1c6436e21d17a255cb034928e52","observation_id":"36d3755b-6146-47a6-a8f8-f9abcd328aa8","resolution":{"observed_at":"2026-08-06T17:42:04.992315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.978002Z","title":"librosa: Audio and music signal analysis in python","venue":null,"work_id":"33a04f22-8ec7-4a4f-805a-fe05bee82ae1","year":2015},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.907379Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:eba52ee172b435837ffb2571a5d76591f9a7ca11f5c03ee565d876ed2859e31b","observation_id":"e53318f0-d5f0-4354-b788-35161b0ee046","resolution":{"observed_at":"2026-08-06T17:42:04.981996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.967612Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":"94cb3b25-a177-4bc5-93bf-55db69dbf9f8","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.946357Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:b022602732966eab228042780c6ea623ab387131961104ac9862f486bb8c80d0","observation_id":"ee519e5c-5c5f-4ad7-9ca9-227dce635116","resolution":{"observed_at":"2026-08-06T17:42:04.971752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.957445Z","title":"Efficient rgb-d seman- tic segmentation for indoor scene analysis","venue":null,"work_id":"8b2a2b32-fd1b-43a1-a7c6-11d0847c8f4f","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.002098Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:02e51aee2c9fdfb5b739ef5d8e5b5ffc079b273c0a3d5cedf8917a08148468c3","observation_id":"67e67f09-9c36-4f60-a186-b9c7e0ca4750","resolution":{"observed_at":"2026-08-06T17:42:04.961492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.948055Z","title":"Opti- mizing ensemble weights and hyperparameters of machine learning models for regression problems","venue":null,"work_id":"340aaa1e-4070-4c59-9938-c73f4027a27a","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.060228Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:8b1c04c38e9b06585ad0126b8f670af3223a33e824e20b54e4cc259749b27c38","observation_id":"0192a209-8e5d-4645-8027-d2db3ea6a060","resolution":{"observed_at":"2026-08-06T17:42:04.951626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.802978Z","title":"Multimodal sparse transformer network for audio-visual speech recognition","venue":null,"work_id":"e4319dee-93d0-4b15-a544-c8370b9b6c68","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.087880Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:327cf38cf2d07c3c8c5e0102b41cd8bc1b4fae7dfff95c95465b420d6efb5675","observation_id":"af0e8584-6fdf-461a-a0cb-56e518cce116","resolution":{"observed_at":"2026-08-06T17:42:04.860641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T17:42:02.125314Z","title":"Soomro, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.125314Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:995f97e727309134a8f0b14e17689a40d5c3241522ea037856b27d47886f60ab","observation_id":"7ae7a4cc-7c28-4ff6-82ff-e75541299bee","resolution":{"observed_at":"2026-08-06T17:42:02.125314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.689992Z","title":"Deep rgb-d saliency detection with depth-sensitive attention and automatic multi-modal fusion","venue":null,"work_id":"a6f479c1-6089-4d5f-a752-21f294108202","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.175483Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:5447bb69e381a5ab84ecfb7c5ec61ee7cee59068c4bba3d5fc477be5d76dbec5","observation_id":"0acac3b4-316a-4cc4-86dc-af2521c4ed4c","resolution":{"observed_at":"2026-08-06T17:42:04.741289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.484329Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"0af62350-54b0-464f-b3a1-5435e0997b93","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.219731Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:2ea2a05346a2bf09b0f73657b75da126cc573de7955d36003536852cf1563fec","observation_id":"b922028d-6634-4da3-ae14-96e1d85b9947","resolution":{"observed_at":"2026-08-06T17:42:04.535266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.312528Z","title":"What makes train- ing multi-modal classification networks hard? In Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 12695–12705, 2020","venue":null,"work_id":"b0fd10e5-a594-4339-823e-a84624f5d0d3","year":2020},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.281677Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:13fc2dfb619656c2f40cec54f9e1fcaa309b6f91ea4563d4e23de2f9173a9dbf","observation_id":"c856842f-733f-4573-b385-e55543701bf7","resolution":{"observed_at":"2026-08-06T17:42:04.413808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.252546Z","title":"Mmanet: Margin- aware distillation and modality-aware regularization for in- complete multimodal learning","venue":null,"work_id":"26bae2ce-dbb9-4640-a924-ca55e7531ee2","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.317836Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:5ae9aaacc57e536b56245c6231542ba4c0db8670e903d4003138ebbb3441e56c","observation_id":"59291014-997e-4f04-a81f-2007525ac98b","resolution":{"observed_at":"2026-08-06T17:42:04.283705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.065232Z","title":"Mmanet: Margin- aware distillation and modality-aware regularization for in- complete multimodal learning","venue":null,"work_id":"f438957a-90ea-4120-83bf-8d206da21615","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.358422Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:c7d04100bfb8f27508d9e183c0e888a7bc54b6ed29f0202e6c862029b82efecf","observation_id":"1d5ef1b2-0672-4333-8fb5-06ff6fcf2195","resolution":{"observed_at":"2026-08-06T17:42:04.186328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.984854Z","title":"Privi- leged modality learning via multimodal hallucination","venue":null,"work_id":"f0d80f79-75e5-4b0c-8de3-c984c888d16b","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.426869Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:917a47d2e897f4755dd7d16166176b24063938ef467328df5b7aef2a584ec76b","observation_id":"a6ff03a9-47fb-497f-b4fb-671c8c11c719","resolution":{"observed_at":"2026-08-06T17:42:04.016758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.794437Z","title":"Msh- net: Modality-shared hallucination with joint adaptation dis- tillation for remote sensing image classification using miss- ing modalities","venue":null,"work_id":"f72fbcf2-b15f-47f4-a75f-158b55bc399e","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.448344Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:d848c665c6e97a927afc3928f21066d81d26bdbe7049eef4d46211538c13fa31","observation_id":"f5ecd532-4afe-44ae-95bf-6d0e6b01be2c","resolution":{"observed_at":"2026-08-06T17:42:03.900389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.639287Z","title":"Ro- bust multimodal learning via representation decoupling","venue":null,"work_id":"008f9fe1-a59a-4083-bfb1-f76a43a135b4","year":2025},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.485015Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:14e6918833dcb2ad7591b752248b37a3844ef993c653216ae4ca7ce8f85c45b0","observation_id":"a54a07cb-2b5e-442a-b59a-45a13b5a8303","resolution":{"observed_at":"2026-08-06T17:42:03.713025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17730","last_updated":"2024-05-28T01:19:13Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T01:19:13Z","title":"MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17730","snapshot_observed_at":"2026-08-06T17:42:02.520141Z","title":"Mmpareto: Boosting multimodal learning with innocent unimodal assistance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.520141Z"},"links":{"cited_paper":"/paper/2405.17730","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:fdae704148de48666d37777e85d5d8fef72c712a58c26d00565f12ea3351c477","observation_id":"30d0020c-f429-42a9-b865-e681c224d742","resolution":{"observed_at":"2026-08-06T17:42:02.520141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06255","last_updated":"2024-06-14T03:37:46Z","snapshot_observed_at":"2026-07-06T16:17:26.924098Z","submitted_at":"2023-09-12T14:16:34Z","title":"Enhancing multimodal cooperation via sample-level modality valuation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06255","snapshot_observed_at":"2026-08-06T17:42:02.566239Z","title":"Enhanc- ing multi-modal cooperation via fine-grained modality valu- ation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.566239Z"},"links":{"cited_paper":"/paper/2309.06255","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:30154d839de95bed74fbc114256e76b80f485db3b87b12121534d702dafd0bd8","observation_id":"e355758e-f3be-4d03-86c2-1655b43641ce","resolution":{"observed_at":"2026-08-06T17:42:02.566239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.427563Z","title":"Diagnos- ing and re-learning for balanced multimodal learning","venue":null,"work_id":"15fe780c-8a71-417a-af9c-6c2ede56513c","year":2025},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.609679Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:fe7abd6a741f26f9b3c7ecec9f06a93c0704184fd5ff95d05124471cbc8cf62b","observation_id":"7a548bbe-b269-40e5-8bf3-8f26c8278e7d","resolution":{"observed_at":"2026-08-06T17:42:03.489911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.330867Z","title":"Mmcosine: Multi-modal cosine loss towards balanced audio-visual fine-grained learning","venue":null,"work_id":"a1370a9b-f14f-45bf-b60c-c148260b82ea","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.692351Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:c3da08ddded5583f08600ad2af1ac780d819b1eeb755055c6f0be1630045834e","observation_id":"ffa7e1c7-f67d-46af-91c2-b881c1addf4c","resolution":{"observed_at":"2026-08-06T17:42:03.366133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.064811Z","title":"Multi-attention recurrent network for human communication comprehen- sion","venue":null,"work_id":"fb9f48ef-ef4b-4f69-ab14-563524c481f5","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.807931Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:1bc3215ceff0ded75f8f91feb528d8852b3eb80da22c67a3fbc8d555a88e1e85","observation_id":"60cfb31d-c657-4b08-b8d3-bebbaed4bc1d","resolution":{"observed_at":"2026-08-06T17:42:03.198760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18947","last_updated":"2024-11-01T13:53:44Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-27T07:22:28Z","title":"Multimodal Fusion on Low-quality Data: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18947","snapshot_observed_at":"2026-08-06T17:42:02.854888Z","title":"Multimodal fusion on low-quality data: A comprehen- sive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.854888Z"},"links":{"cited_paper":"/paper/2404.18947","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:1a165e911dda7acf4768f4235a01df65dc69bb98c10e602cf6eade74430451b2","observation_id":"ba50fa90-47be-42f5-bc90-c4aab0e3ba35","resolution":{"observed_at":"2026-08-06T17:42:02.854888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10707","last_updated":"2024-04-01T16:56:13Z","snapshot_observed_at":"2026-08-03T06:11:41.428440Z","submitted_at":"2023-11-17T18:57:40Z","title":"Multimodal Representation Learning by Alternating Unimodal Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10707","snapshot_observed_at":"2026-08-06T17:42:02.885780Z","title":"Multimodal representation learning by alternating uni- modal adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.885780Z"},"links":{"cited_paper":"/paper/2311.10707","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:6a2da6bb0dffc99c1c236b596e0638c23331ea14a8d91488417823f3e717def4","observation_id":"f6b29080-2a50-46d5-9158-63c17ac97e5d","resolution":{"observed_at":"2026-08-06T17:42:02.885780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02425","last_updated":"2022-08-04T07:23:42Z","snapshot_observed_at":"2026-07-06T13:17:44.718595Z","submitted_at":"2022-06-06T08:41:56Z","title":"mmFormer: Multimodal Medical Transformer for Incomplete Multimodal Learning of Brain Tumor Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02425","snapshot_observed_at":"2026-08-06T17:42:02.959815Z","title":"mmformer: Multimodal medical transformer for in- complete multimodal learning of brain tumor segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.959815Z"},"links":{"cited_paper":"/paper/2206.02425","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:7b718d58aa112eeacbcc910c8f0f88846a850fce88fedf213849b98e70f29599","observation_id":"5739ee6a-c6da-41a1-bafb-e20cd885e131","resolution":{"observed_at":"2026-08-06T17:42:02.959815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2507.10203."}