{"as_of":"2026-08-07T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a383d7455a95b1aaf75069f3eb7789fc41e7247c8147565cd497df6078267006","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:42:04.308479Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:45:18.800781Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T16:24:55.663925Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10213","snapshot_observed_at":"2026-08-03T14:45:18.800781Z","title":"Boosting multimodal learning via disentangled gradient learning.arXiv preprint arXiv:2507.10213, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.19602","last_updated":"2026-05-26T10:01:26Z","snapshot_observed_at":"2026-08-07T00:39:24.527466Z","submitted_at":"2025-12-22T17:35:32Z","title":"No Data? No Problem: Robust Vision-Tabular Learning with Missing Values","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T14:45:18.800781Z"},"links":{"cited_paper":"/paper/2507.10213","citing_paper":"/paper/2512.19602"},"observation_digest":"sha256:27f8b08d734a9b2a3d36a26d350be157ef026bed243dd6263e53da95de42c064","observation_id":"3a935e74-6a33-4dad-b7ff-9d17661416e3","resolution":{"observed_at":"2026-08-03T14:45:18.800781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"cited_work":{"arxiv_id":"2507.10213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10213","snapshot_observed_at":"2026-06-30T16:24:55.663925Z","title":"Boosting multimodal learning via disen- tangled gradient learning,","venue":null,"work_id":"fb212c4b-d4cf-4e2b-a317-8b44ca5ac32b","year":2025},"citing_paper":{"arxiv_id":"2605.28869","last_updated":"2026-05-22T08:22:31Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-22T08:22:31Z","title":"Balancing Multimodal Learning through Label Space Reshaping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T16:20:17.727753Z"},"links":{"cited_paper":"/paper/2507.10213","citing_paper":"/paper/2605.28869"},"observation_digest":"sha256:d3ce82664be266771ab5cefabcc43f20c305413e43cb1d909276a6694dc96969","observation_id":"a8263927-8c55-4a53-9a7f-fb610c31d7af","resolution":{"observed_at":"2026-06-30T16:24:55.672048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10213/citation-record","integrity":"/paper/2507.10213/integrity","json":"/paper/2507.10213/citation-record.json","paper":"/paper/2507.10213"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.206858Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":"1454d197-68b9-4c6e-992d-c995ff4f6f30","year":2018},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.865986Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:cfee91e0aae5f463372124fd6f5b5a9a0b3f4730d7d187a040caa4821b82960b","observation_id":"7ce3e954-3fe8-4a49-98ea-3e173eca0872","resolution":{"observed_at":"2026-08-06T17:42:05.210212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:01.906943Z","title":"Look, listen and learn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.906943Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:37fabf44dcf5f49b0ffdedd3851c74c77c6a49ac560e0c54339d387926e1cac0","observation_id":"76891e0f-6861-4334-9e68-aa74d522bc00","resolution":{"observed_at":"2026-08-06T17:42:01.906943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:01.945556Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.945556Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:90384dcc41a29ce34963e83c747a93a4a809689144317357fb3198bd62179d36","observation_id":"111c12ef-2554-4203-8db3-0db81948e3bb","resolution":{"observed_at":"2026-08-06T17:42:01.945556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.183072Z","title":"Shapeconv: Shape- aware convolutional layer for indoor rgb-d semantic segmen- tation","venue":null,"work_id":"5957c203-3127-426c-a3a4-77657b16a63d","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.001732Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:0936086c945a4865c6b2be6c4d0f128824ea72235da6541575c2a9b152cebf70","observation_id":"3dca69b9-94c5-488e-b819-dabcaf1b0fb8","resolution":{"observed_at":"2026-08-06T17:42:05.187715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.172400Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"259487a2-7a8b-4582-8358-6ad4d69c3042","year":2020},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.059917Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:4922fff8974dd44924be2a80f2af817a45a587c90ed4bb6486d4db23e7ad9a74","observation_id":"3ff4e644-4a5f-403f-8334-830cb7b4f694","resolution":{"observed_at":"2026-08-06T17:42:05.176407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.163108Z","title":"Mars: Motion-augmented rgb stream for action recognition","venue":null,"work_id":"49e3885a-e164-43dd-b4d3-d15cba3427c8","year":2019},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.087377Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:2dc769f9619e1e87eeeb9ffdc3eee98a7684c39b17250dde6a89cf3b07061aeb","observation_id":"233ea5cb-dfdd-4a00-906e-1ecd9520ea43","resolution":{"observed_at":"2026-08-06T17:42:05.166652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.153260Z","title":"Rfnet: Region-aware fusion network for incomplete multi-modal brain tumor seg- mentation","venue":null,"work_id":"11e1a5b8-5c32-4754-a4a8-e95aa87174e8","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.124644Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:09cdee971824df5ba5987d6e124a4b50f0f799b38d1b5a40b263e18833010cf3","observation_id":"04112079-2f49-4007-a948-94e33c779d7f","resolution":{"observed_at":"2026-08-06T17:42:05.156605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11059","last_updated":"2021-06-21T12:46:47Z","snapshot_observed_at":"2026-08-03T17:23:12.981213Z","submitted_at":"2021-06-21T12:46:47Z","title":"Improving Multi-Modal Learning with Uni-Modal Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11059","snapshot_observed_at":"2026-08-06T17:42:02.175125Z","title":"Improving multi- modal learning with uni-modal teachers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.175125Z"},"links":{"cited_paper":"/paper/2106.11059","citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:fe4b15e1d5e488e57f1903d7bbff81caab894cb80e99df647274e0a624ea62a4","observation_id":"380975ab-10e6-47ff-9976-dbb466f96d99","resolution":{"observed_at":"2026-08-06T17:42:02.175125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.143735Z","title":"Pmr: Prototypical modal rebalance for multi- modal learning","venue":null,"work_id":"0a7dce85-81dd-4b4c-9525-25d586ca8692","year":2023},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.219228Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:bb5c56616d919d2dea44a0bc0eea3100db9c55a21958ccf665afc1cd67b81031","observation_id":"d04ad3d6-4560-4391-ad1b-ba395946330d","resolution":{"observed_at":"2026-08-06T17:42:05.146878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:02.281134Z","title":"Modal- ity distillation with multiple stream networks for action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.281134Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:42f6ccb7444355332540fbe7d62264511455d25b290a9cf06c6018f5e26ce158","observation_id":"acdb6311-e898-4dcd-b8c5-be5dfaec4ac1","resolution":{"observed_at":"2026-08-06T17:42:02.281134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.129546Z","title":"Multimodal remote sensing benchmark datasets for land cover classification with a shared and spe- cific feature learning model","venue":null,"work_id":"f586734c-7515-4bc1-9adb-8360cebdcf61","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.317061Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:1e013b5a73669738306f85a1d380c15020ff718f7e9d15810b403d769deafc5c","observation_id":"8439a1b3-768b-43b0-b993-0b994e1fdd4e","resolution":{"observed_at":"2026-08-06T17:42:05.133151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.120694Z","title":"Deep multimodal multilinear fusion with high- order polynomial pooling","venue":null,"work_id":"76bd4405-11c7-456c-a776-5917ca621097","year":2019},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.357931Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:9b35f519099a3b6ed5ccd9c2c9d3d33a7f4065467c158e25292d838824774cef","observation_id":"e14c5cea-3a76-475d-a29e-8c9a3817aab7","resolution":{"observed_at":"2026-08-06T17:42:05.124051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.111792Z","title":"Acnet: Attention based network to exploit complementary features for rgbd semantic segmentation","venue":null,"work_id":"368dfc09-5b55-492f-a2ef-48c7a1d452c5","year":2019},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.426702Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:f6245768bb56138e3ba1addd422880edd60fdb081340b30a09eda7d5c1236733","observation_id":"a4c0bed5-b606-4712-b49f-8e49c2a4b5a2","resolution":{"observed_at":"2026-08-06T17:42:05.115144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09321","last_updated":"2024-05-15T13:22:39Z","snapshot_observed_at":"2026-07-06T18:14:41.996656Z","submitted_at":"2024-05-15T13:22:39Z","title":"ReconBoost: Boosting Can Achieve Modality Reconcilement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09321","snapshot_observed_at":"2026-08-06T17:42:02.447656Z","title":"Reconboost: Boosting can achieve modal- ity reconcilement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.447656Z"},"links":{"cited_paper":"/paper/2405.09321","citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:0bfacdb53bc4abdb5da73596593ea3b761bbea221f671b3278863ca3280045fe","observation_id":"c8d50297-294c-4dd4-877e-d90e382a8147","resolution":{"observed_at":"2026-08-06T17:42:02.447656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.102878Z","title":"Cdnet: Complementary depth network for rgb-d salient object detection","venue":null,"work_id":"aa129f8c-ab1d-4bfd-9d60-9feccecebe73","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.484366Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:603bc7f457819c4a9b8818a7ebb2945e48730c7ae53a8a0e0d9ff51daa595316","observation_id":"6ff0afec-753b-4bfe-938c-90dd02a5e640","resolution":{"observed_at":"2026-08-06T17:42:05.106280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:02.519545Z","title":"Mmtm: Multimodal transfer module for cnn fusion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.519545Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:92d54dc550a9def7ea8910956bfd5c2ef1b8552ed4294ab399ea97e4658ef64b","observation_id":"11dcedba-64a8-4ae9-8738-bd0a34fdee03","resolution":{"observed_at":"2026-08-06T17:42:02.519545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.088902Z","title":"Boosting multi-modal model performance with adaptive gradient modulation","venue":null,"work_id":"1a5f65ec-b327-40c6-a116-0925fc7240ce","year":2023},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.565596Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:ccaf0cf2f50e98788446152972b5bdce89fca472a19ff7c1bc74113a9bc77ec8","observation_id":"55312b4f-189a-4028-8219-5e33ae9bb006","resolution":{"observed_at":"2026-08-06T17:42:05.092029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.079481Z","title":"Multi-modal face anti-spoofing at- tack detection challenge at cvpr2019","venue":null,"work_id":"9a4fb153-adbd-4de2-9438-ed16025156d5","year":2019},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.609086Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:4d00052910874366fcca99407a4460ea22233f7de5b1a8f5ce1acbae73976bd9","observation_id":"5da6ec01-1344-4564-b4ec-74edfdede723","resolution":{"observed_at":"2026-08-06T17:42:05.083276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.069073Z","title":"Recognizing human ac- tions as the evolution of pose estimation maps","venue":null,"work_id":"42c98391-49b5-40b2-9dc2-721478b3fd5c","year":2018},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.691722Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:ac29bcf1a1ab3248b14b0e5f2aa48b28e32c391efcab95bb9a280096a554bd19","observation_id":"1dd0b98c-5887-499e-8072-bc9b37550184","resolution":{"observed_at":"2026-08-06T17:42:05.073077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:02.807378Z","title":"librosa: Audio and music signal analysis in python","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.807378Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:968ddf55408df4565988c1865b52a30ced11da91372dd53587be42e4ca258f18","observation_id":"5d092045-0f69-42b0-8bfa-e1cd241ccb71","resolution":{"observed_at":"2026-08-06T17:42:02.807378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.054702Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":"5fef885e-7881-4750-a729-041fb868cc1d","year":2022},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.854512Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:dd9091d9dc6c2266b2546072fec51ceb6da7fcf6a41b86b8467d1efecb45c640","observation_id":"f86af440-804c-42eb-8f88-84a456570335","resolution":{"observed_at":"2026-08-06T17:42:05.058046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.046210Z","title":"End-to- end audiovisual speech recognition","venue":null,"work_id":"6b4299b4-dc7d-4693-a666-4c08b605e41a","year":2018},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.885232Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:e186a24fc5bbc5a9d46a95fba3db84eedbadd51d3f4399ecc18103bc6c5c61bc","observation_id":"5850f270-ecd7-46c2-89a0-6268dd79cc14","resolution":{"observed_at":"2026-08-06T17:42:05.049148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.036541Z","title":"Efficient rgb-d seman- tic segmentation for indoor scene analysis","venue":null,"work_id":"520f9104-9ac7-4718-84db-813f82eb1d3a","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.959400Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:ffac55664909d06ce946050bb3f88409ee0f0ac2314a9e9e20ab41c3ebf17f09","observation_id":"162da72a-423e-458e-bbda-71f022f1e950","resolution":{"observed_at":"2026-08-06T17:42:05.040073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.025710Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"21426d87-274e-4536-814f-a8db8f5f9228","year":2012},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.962792Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:c7ff7470a166fdf22697a52cc266654dc14f156b1f86d466a163041114a73839","observation_id":"ca0a9b3e-3c2c-44a0-a8fa-cbb225ab5b18","resolution":{"observed_at":"2026-08-06T17:42:05.029692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.015769Z","title":"Cubemlp: An mlp-based model for multimodal sentiment analysis and depression estimation","venue":null,"work_id":"c6edc7b8-1e13-4b64-965e-cbe07d1138b8","year":2022},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.030917Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:540b59e26eee2d058c90234ca7fd9c1bbc5e4226ac0f710a099b78c6d7efe135","observation_id":"4bcf7605-00a9-44e3-9ba9-d164dde21c99","resolution":{"observed_at":"2026-08-06T17:42:05.019267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.005914Z","title":"Deep rgb-d saliency detection with depth-sensitive attention and automatic multi-modal fusion","venue":null,"work_id":"95512378-af80-497d-aed7-c1f69056b263","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.198352Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:0828b26d54d7a97ca3518bd8b938a39e3beb7f14c61eda8db84372ac368f405d","observation_id":"19b91aaf-d98a-4839-8c28-01fd9b4b9262","resolution":{"observed_at":"2026-08-06T17:42:05.009293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.995800Z","title":"Aligning audiovisual features for audiovisual speech recognition","venue":null,"work_id":"e32a438e-1cc8-4a09-8edf-0d6f611adf8c","year":2018},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.326694Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:d25176253fcce58bf9bcefe0742e8f292e4f480f0170fc5fc8c98a986c13ba56","observation_id":"423a94eb-eda4-4324-acfa-66516221871d","resolution":{"observed_at":"2026-08-06T17:42:04.999072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.986612Z","title":"What makes train- ing multi-modal classification networks hard? In Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 12695–12705, 2020","venue":null,"work_id":"e7cec9dd-e6e1-4900-ad0f-ea028b3a74cb","year":2020},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.365439Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:1a709753bcdc65e330b198b181146ae46ae1387fa8e819b8d257b02859ec9e59","observation_id":"643c19c5-4719-4c19-89bb-7afcc1dd4c5d","resolution":{"observed_at":"2026-08-06T17:42:04.990090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.977408Z","title":"Mmanet: Margin- aware distillation and modality-aware regularization for in- complete multimodal learning","venue":null,"work_id":"cc21b1b0-8733-4348-9ed6-884c3f8fbe2b","year":2023},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.423808Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:d1a3e54e7db3a41717420a2a058f2dfd642a784dbaca512841117fbf205fef77","observation_id":"74bce552-171b-4f55-b6fd-8cfd1107ed4d","resolution":{"observed_at":"2026-08-06T17:42:04.980959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.967451Z","title":"Msh- net: Modality-shared hallucination with joint adaptation dis- tillation for remote sensing image classification using miss- ing modalities","venue":null,"work_id":"15ba96a6-b621-4907-addd-bf7c8ea2f360","year":2023},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.489676Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:98a9cdee32bab6a8b1cc9bc567318b2896c50cfc9bcb510d78cfef7783208ed5","observation_id":"7aa45e91-2d10-43a4-a9e6-67329199fd57","resolution":{"observed_at":"2026-08-06T17:42:04.971514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.957424Z","title":"Ro- bust multimodal learning via representation decoupling","venue":null,"work_id":"ab77af10-527f-44aa-91c7-3f3fb11899d1","year":2025},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.635355Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:e4b5f6fccba42e4d92ea3f4c75f4afec6972000d6272660c2f60310837fcc19c","observation_id":"d4795f3d-a0dc-44db-8b56-bea49b870e76","resolution":{"observed_at":"2026-08-06T17:42:04.961344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17730","last_updated":"2024-05-28T01:19:13Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T01:19:13Z","title":"MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17730","snapshot_observed_at":"2026-08-06T17:42:03.712781Z","title":"Mmpareto: Boosting multimodal learning with innocent unimodal assistance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.712781Z"},"links":{"cited_paper":"/paper/2405.17730","citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:917a821c699831d6cc867506d0e384039eba22c73263427fb943f867a2bb0169","observation_id":"d54e3bec-5d76-4be8-9c22-7e5c7b69b99c","resolution":{"observed_at":"2026-08-06T17:42:03.712781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.789923Z","title":"Diagnos- ing and re-learning for balanced multimodal learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.789923Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:6a7432a53b86079ed85cbac23c357d05690ee12535d745f7ba1b80d66f1b78ba","observation_id":"b0cdbcd3-4aa4-4d27-b288-e1d67e9e8d9b","resolution":{"observed_at":"2026-08-06T17:42:03.789923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.918956Z","title":"A discriminative feature learning approach for deep face recog- nition","venue":null,"work_id":"f2e1e40c-cb20-44ae-95af-897feca66be1","year":2016},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.899946Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:df94839af09f6f772819dd5df6c0918ef8278f6edbef5246d18d5340b230f432","observation_id":"c8a383af-ba4c-4878-a8f6-9090bd07ab34","resolution":{"observed_at":"2026-08-06T17:42:04.946314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.775810Z","title":"A comprehensive study on center loss for deep face recogni- tion","venue":null,"work_id":"f220ebb6-e4d9-4119-ad0d-82721983896c","year":2019},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:03.980126Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:e58d32d0b61332772b0405d0c208a1e4f5137c5c6ac7f0e8a99637193bdb5768","observation_id":"a2ad0265-1475-4d5e-843d-b9be69f94120","resolution":{"observed_at":"2026-08-06T17:42:04.835118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.633305Z","title":"Mmcosine: Multi-modal cosine loss towards balanced audio-visual fine-grained learning","venue":null,"work_id":"175e5310-c265-4134-bad3-2f1b2402238d","year":2023},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:04.016314Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:f158ca92644d522b09169347ac15998f5ceae01b38d516b520307dae252c42be","observation_id":"2a5f7ef6-a917-4601-8fc3-5c6781090374","resolution":{"observed_at":"2026-08-06T17:42:04.728235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-07-06T05:52:17.418793Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-06T17:42:04.061194Z","title":"Tensor fusion net- work for multimodal sentiment analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:04.061194Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:c357a1b9ea20f7364c60fd442b45994695d4126bc1d30a5785a729d9a1f7b461","observation_id":"87cccb0a-4d54-4af5-b56c-521178c7b8ee","resolution":{"observed_at":"2026-08-06T17:42:04.061194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.186041Z","title":"Multi-attention recurrent network for human communication comprehen- sion","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:04.186041Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:30148a72fc944b817e26333b2c443a35ac985856a7814a367b12cdebcccc55b6","observation_id":"7067b54a-7989-4813-bb06-bf695e845e3b","resolution":{"observed_at":"2026-08-06T17:42:04.186041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10707","last_updated":"2024-04-01T16:56:13Z","snapshot_observed_at":"2026-08-03T06:11:41.428440Z","submitted_at":"2023-11-17T18:57:40Z","title":"Multimodal Representation Learning by Alternating Unimodal Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10707","snapshot_observed_at":"2026-08-06T17:42:04.248054Z","title":"Multimodal representation learning by alternating uni- modal adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:04.248054Z"},"links":{"cited_paper":"/paper/2311.10707","citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:d8efc2879f314146162469f33f54344206ff2fb4bcc372554c5f62da0d81dcbe","observation_id":"9a311e0e-9938-4fea-aa31-b73a702c3607","resolution":{"observed_at":"2026-08-06T17:42:04.248054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02425","last_updated":"2022-08-04T07:23:42Z","snapshot_observed_at":"2026-07-06T13:17:44.718595Z","submitted_at":"2022-06-06T08:41:56Z","title":"mmFormer: Multimodal Medical Transformer for Incomplete Multimodal Learning of Brain Tumor Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02425","snapshot_observed_at":"2026-08-06T17:42:04.283547Z","title":"mmformer: Multimodal medical transformer for in- complete multimodal learning of brain tumor segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:04.283547Z"},"links":{"cited_paper":"/paper/2206.02425","citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:72d11ce4f9534cb224c9f2e8029c5c70fee646f3d9960ab81c91bd273e04445a","observation_id":"6549ecc0-8f7d-49a4-81ea-e48e81432ac4","resolution":{"observed_at":"2026-08-06T17:42:04.283547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.433872Z","title":"Rgb-d salient object detection: A sur- vey","venue":null,"work_id":"4cf06799-aed7-4254-a4c1-8d266c8cbe2c","year":2021},"citing_paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:04.308479Z"},"links":{"citing_paper":"/paper/2507.10213"},"observation_digest":"sha256:648e6ca86defefe7008d55b7e9b2f5f282f95ce33704f8f2e7f70e023528abbc","observation_id":"ef3e5f38-1227-447a-8eb9-f6572b5ff221","resolution":{"observed_at":"2026-08-06T17:42:04.496955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10213","last_updated":"2025-07-14T12:31:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:44:56.226984Z","submitted_at":"2025-07-14T12:31:28Z","title":"Boosting Multimodal Learning via Disentangled Gradient Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2507.10213."}