{"as_of":"2026-08-07T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:821436a3cb6aa6eb4052c5a2547364174fd782291fddbd18979e86337df793f7","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:09:43.057849Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11465/citation-record","integrity":"/paper/2506.11465/integrity","json":"/paper/2506.11465/citation-record.json","paper":"/paper/2506.11465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.068767Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.068767Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:0ead75033ec575c05dbc6e15e4b437d0c41843c338695bb40ab54488fbfe71bc","observation_id":"50dfc4cd-ded7-4194-bd00-11fd38177eae","resolution":{"observed_at":"2026-08-07T04:09:38.068767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.554832Z","title":"and Zisserman, A","venue":null,"work_id":"1a29b977-9e2f-41b8-af31-b21883566877","year":2017},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.226847Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:b421c6b6dc7bea4a9156916313fe7274186a24d87b366815f9ce778d661989cf","observation_id":"d76e886a-75f2-4af7-a52a-86e4cffbefcb","resolution":{"observed_at":"2026-08-07T04:09:49.559290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.539472Z","title":"Singular value decomposition tutorial","venue":null,"work_id":"d9889f9c-aa4e-4e65-b1c7-cbde05e9ec6f","year":2005},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.350243Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:5c012a2a9a369440dad48585ad4680ef5d8a31a6e51f4dedc197d559102a407b","observation_id":"09d7dbc0-1d54-49b5-a6f2-ecb3c3651dfa","resolution":{"observed_at":"2026-08-07T04:09:49.544180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.525415Z","title":"Multimodal machine learning: A survey and taxonomy","venue":null,"work_id":"ae8c826c-4a00-4292-b258-74d981fb312e","year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.427179Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:8dde3fc97fdede0472ae80f845aff36c6727d7354e596e959a8029ee486ed4ef","observation_id":"82bf73e3-e43b-46b8-8094-7ab82b49670d","resolution":{"observed_at":"2026-08-07T04:09:49.530010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.510843Z","title":"Training stochastic model recognition algorithms as networks can lead to maximum mutual information estimation of parameters","venue":null,"work_id":"4c1a5286-f55b-4f32-9e85-8e5ceaf2cf91","year":1989},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.498054Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:5efb5ff8f3af4132edd18ec65967c6c89ceb95cab75f512686e646a555736b4d","observation_id":"2cafc4cc-ed47-42e3-880b-9fcd5e97f458","resolution":{"observed_at":"2026-08-07T04:09:49.515557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.495624Z","title":"G., Keutmann, M","venue":null,"work_id":"5885351e-0893-4c83-9b22-d1544faea1fe","year":2014},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.594262Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:bc01bef055450892675b63c423ba72e712de0d65a3161f1023d3e6e1069151cf","observation_id":"ec1d95fd-8ee2-48a8-accb-0c867feded1f","resolution":{"observed_at":"2026-08-07T04:09:49.500337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.679875Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.679875Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:8605d26efafa839cb5d5a68ad69f26a9d31edca72630d0c382883b0c6a46d702","observation_id":"e20a43c3-110e-47fb-afea-7212f0bc8b75","resolution":{"observed_at":"2026-08-07T04:09:38.679875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.472403Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"e9a38be7-aca2-4321-a17f-468b942e6894","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.753191Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:5a1c58df90f0696cbb2fa9e601f84c48535d88e001b8f7750725bfa13022eadd","observation_id":"7885befd-1227-4d1b-8bef-696afd9da023","resolution":{"observed_at":"2026-08-07T04:09:49.477032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.823412Z","title":"T., Rubanova, Y., Bettencourt, J., and Duvenaud, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.823412Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:89f9ce6d18cae4f0702fb192e6fde60dbb2a3e522921837be0a60f8f0043cc4b","observation_id":"e4c3c1a8-38f2-4f74-8bdd-d088994c2cca","resolution":{"observed_at":"2026-08-07T04:09:38.823412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.449122Z","title":"Self-attention fusion for audiovisual emotion recognition with incomplete data","venue":null,"work_id":"de19fe63-7138-4f56-9ceb-af0d7b69d4e6","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.893997Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:7d2330db2aa4f8dd3d22397f2647efe900c6395dac28ae463329d91656162aa3","observation_id":"4786108c-a60a-452b-8d9a-2da6020d58dc","resolution":{"observed_at":"2026-08-07T04:09:49.453909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-07T04:09:38.980072Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.980072Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:1220541efac3929551c2e2bd496fa2bf6acdd15199b21a313a62b89024627792","observation_id":"cf10ac09-1ebc-4fd9-a007-290cdf6daac3","resolution":{"observed_at":"2026-08-07T04:09:38.980072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.433768Z","title":"Addressing failure prediction by learning model confidence","venue":null,"work_id":"f33c5ccf-f260-47ca-b3db-b3ca8d12b827","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.064181Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:c05f72b83f2eb93bad69ba87fdf3b51dbda5d29ac951a81cde8cf2d233f3b542","observation_id":"0551a8ae-6918-4c74-8dfb-8f47cf9b286c","resolution":{"observed_at":"2026-08-07T04:09:49.438443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17419","last_updated":"2024-10-26T16:27:02Z","snapshot_observed_at":"2026-08-05T12:50:53.634445Z","submitted_at":"2024-05-27T17:59:02Z","title":"MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities","version":2},"cited_work":{"arxiv_id":"2405.17419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17419","snapshot_observed_at":"2026-08-07T04:09:43.498889Z","title":"MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities","venue":"cs.CV","work_id":"63bb8f9a-04bd-4f71-bff7-7eec732b5aad","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.130768Z"},"links":{"cited_paper":"/paper/2405.17419","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:d24e2c8dfa7b3780d2da1574ce8625f8442539c7cf513cde201793d324f69e5a","observation_id":"55f3978c-c448-4684-ae99-900215ee25cf","resolution":{"observed_at":"2026-08-07T04:09:43.650849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T04:09:39.218605Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.218605Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:429b295d38e7b6b5d7d8ca6a833b49d820c5c68096504ca2158ac941aa06a6f1","observation_id":"b7bb59bc-732c-44d1-b58a-d335e21ac48a","resolution":{"observed_at":"2026-08-07T04:09:39.218605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.417703Z","title":"Pmr: Prototypical modal rebalance for multimodal learning","venue":null,"work_id":"c7a518bb-325f-49a2-92d1-145c2955d47e","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.294459Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2e6d7a8b1f60d5ede7a4c9a8a3b08037a6a56aa50d14d55680510171c5057dbd","observation_id":"f19b3643-e38e-41ca-813b-463a025a7aaf","resolution":{"observed_at":"2026-08-07T04:09:49.422317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.268514Z","title":"A survey on deep learning for multimodal data fusion","venue":null,"work_id":"c928ca20-dbf8-4a76-80a9-4c5d434c6987","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.356065Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:53e4e38167198d41c2442ff59cd02410be13834646c44c7d1c593cf232a396dc","observation_id":"545a75d6-ae72-469f-a773-b66ee6fd6e5f","resolution":{"observed_at":"2026-08-07T04:09:49.341220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.165673Z","title":"C., Wang, X., and Li, H","venue":null,"work_id":"5e78f638-0457-443c-bd50-614648afea93","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.433527Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:66244698453dd9216beca596da8c95d40e4950cb45171943186de5c679f6ebcf","observation_id":"a4fd3df9-1b5d-4eb6-8613-e142ab914055","resolution":{"observed_at":"2026-08-07T04:09:49.199632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10794","last_updated":"2025-08-21T11:31:09Z","snapshot_observed_at":"2026-07-06T17:04:17.738921Z","submitted_at":"2023-12-17T19:06:29Z","title":"A mathematical perspective on Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10794","snapshot_observed_at":"2026-08-07T04:09:39.501652Z","title":"A mathematical perspective on transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.501652Z"},"links":{"cited_paper":"/paper/2312.10794","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:5e15e5fc267083d548d786257696b16391a447a817e46bd3bba67e55a03146a2","observation_id":"8820c915-2613-45bc-ac88-5c32f18a1484","resolution":{"observed_at":"2026-08-07T04:09:39.501652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.121245Z","title":"Multimodal dynamics: Dynamical fusion for trustworthy multimodal classification","venue":null,"work_id":"a1f85b65-fea9-4ea5-bb0c-0e2a23202234","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.571302Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:8b45555b8e37c46c0cba3566c754bca4b81d2e9b9cf0fbf3e09c8e6aeef0c071","observation_id":"03b11aec-86b4-4fd2-9e88-275a6673e170","resolution":{"observed_at":"2026-08-07T04:09:49.139355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.650765Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.650765Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:9650ca6bee031489984cd620f4ca423fe38733abb8c84266520c84aa05ca4cdc","observation_id":"0074a38c-b600-4ccb-8213-a9b30af6ad1f","resolution":{"observed_at":"2026-08-07T04:09:39.650765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.718540Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.718540Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:0c07814c64adfb2cef0a423918e77ef37622025be499231121a38ebdd80876f8","observation_id":"ea0983aa-2509-4c86-9810-d1956fd73305","resolution":{"observed_at":"2026-08-07T04:09:39.718540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09321","last_updated":"2024-05-15T13:22:39Z","snapshot_observed_at":"2026-07-06T18:14:41.996656Z","submitted_at":"2024-05-15T13:22:39Z","title":"ReconBoost: Boosting Can Achieve Modality Reconcilement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09321","snapshot_observed_at":"2026-08-07T04:09:39.795317Z","title":"Reconboost: Boosting can achieve modality reconcilement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.795317Z"},"links":{"cited_paper":"/paper/2405.09321","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:44c62f888c29fee553a75e32e6e3cefd09ac4eef6a9b8bc93d3911ebebfea8cf","observation_id":"6b0631c4-cabe-4c4a-baa7-ce27b0913306","resolution":{"observed_at":"2026-08-07T04:09:39.795317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.086507Z","title":"Adaptive unimodal regulation for balanced multimodal information acquisition","venue":null,"work_id":"34ca46b7-f4ae-49ff-8b31-3a71426c09a0","year":2025},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.862671Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:22f059a3954deeb2ee5b63e38d1a6a29518a949121719ed178fa64cef63dcc0e","observation_id":"7aaf9aba-4f25-42eb-8a9f-d8ec915f37d2","resolution":{"observed_at":"2026-08-07T04:09:49.090763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.950008Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learning?(provably)","venue":null,"work_id":"0c92c132-45ef-4195-9287-78bacdbfa18d","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.922194Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:b23aeebde28624a31dd60e9b817140170fda6bcbd49bf4d35cd5e6461fffbebc","observation_id":"e306a950-b2aa-40f3-8948-a3b310b95012","resolution":{"observed_at":"2026-08-07T04:09:49.016974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-04T21:04:33.037459Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-07T04:09:39.997161Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.997161Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:236ff7765215cbcea31c495e0868361345533be6ace01972ce50d95618c71283","observation_id":"23ea6d0e-235a-495f-bd8c-67dcabef7be7","resolution":{"observed_at":"2026-08-07T04:09:39.997161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.790269Z","title":null,"venue":null,"work_id":"63026fe7-f717-415d-aa72-0ece5d521f5f","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.072016Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ed97868301fd71f45d8e44826ca7c8864b68b0288376001c4a3691d4260d7dcf","observation_id":"25da82be-d28c-4481-bd7e-c6c802b68b09","resolution":{"observed_at":"2026-08-07T04:09:48.867236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.713059Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"0f0da435-eecd-47ef-8b18-946e9da1bb9c","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.154442Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:7f4a333e6e0b91882929b283a1026ff13a50c1054f41dca7ef14e41ed7e197db","observation_id":"4320cb08-331b-4022-b18d-cbd218295782","resolution":{"observed_at":"2026-08-07T04:09:48.736558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08593","last_updated":"2019-09-11T16:26:37Z","snapshot_observed_at":"2026-08-05T14:31:02.514313Z","submitted_at":"2019-08-21T04:27:38Z","title":"Revealing the Dark Secrets of BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08593","snapshot_observed_at":"2026-08-07T04:09:40.244763Z","title":"Revealing the dark secrets of bert","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.244763Z"},"links":{"cited_paper":"/paper/1908.08593","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:641fcb6c1728e72745dff5a3a7bdafc3cfbed8fb6e5cd6768cb867b848900838","observation_id":"dd8abe0d-cd06-417d-a8f4-04b7f5f7f8d8","resolution":{"observed_at":"2026-08-07T04:09:40.244763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.660865Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"56ec7837-69db-42a3-a80b-29fcd91845d9","year":2011},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.308098Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:05cff3753f5efadc6b67d39f79acd5444aec1b2749cec098e94f5b8dba6b1407","observation_id":"e4c048b0-6165-4175-9943-dff252466a8f","resolution":{"observed_at":"2026-08-07T04:09:48.699781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T04:09:40.379262Z","title":"H., Yatskar, M., Yin, D., Hsieh, C.-J., and Chang, K.-W","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.379262Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:d665ffc98caa548f4267630eee146f8a95f1f83ad2305ae70eceb92a785eedb7","observation_id":"d5a6dd0e-544b-4395-a0b8-db9e4b7cb64e","resolution":{"observed_at":"2026-08-07T04:09:40.379262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.504475Z","title":"P., Lyu, Y., Fan, X., Wu, Z., Cheng, Y., Wu, J., Chen, L., Wu, P., Lee, M","venue":null,"work_id":"a3aa4cd4-bc2c-4135-a3e9-417d00e2b04c","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.437438Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:c7e575b7016acc9c3c4570b5c9852df1e151225501bf682dfe2b601541a8b505","observation_id":"9ff55cff-2ff8-4236-b7ff-edc47bc4d7aa","resolution":{"observed_at":"2026-08-07T04:09:48.581228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03430","last_updated":"2023-02-20T09:19:30Z","snapshot_observed_at":"2026-07-06T13:49:55.774217Z","submitted_at":"2022-09-07T19:21:19Z","title":"Foundations and Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03430","snapshot_observed_at":"2026-08-07T04:09:40.521348Z","title":"P., Zadeh, A., and Morency, L.-P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.521348Z"},"links":{"cited_paper":"/paper/2209.03430","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:a6ad5aa99161e7203eeedebc185f3f2b5fc8edad98c36623d4becfaa843c0a54","observation_id":"a18a3558-b526-4404-a362-657ea7b69717","resolution":{"observed_at":"2026-08-07T04:09:40.521348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00064","last_updated":"2018-05-31T19:28:23Z","snapshot_observed_at":"2026-07-06T06:42:20.997236Z","submitted_at":"2018-05-31T19:28:23Z","title":"Efficient Low-rank Multimodal Fusion with Modality-Specific Factors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00064","snapshot_observed_at":"2026-08-07T04:09:40.621399Z","title":"B., Liang, P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.621399Z"},"links":{"cited_paper":"/paper/1806.00064","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:abf83f5206423f8323f1d1e96da7ccf4190fe7fc0b561da4c3f11e60827505f7","observation_id":"d7a3ff90-7b6b-4e7e-b8a0-5b3b1f6a6866","resolution":{"observed_at":"2026-08-07T04:09:40.621399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.348449Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"89bcd6be-9fe4-42b3-a56c-e44a5d39ba3a","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.697091Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:cc98ba1f7c2b96120b5a94ba953db4029532893afd5016f56bf691ce7f7b1e9c","observation_id":"e0e52db5-9606-435e-a9c9-4036ca3f6cdb","resolution":{"observed_at":"2026-08-07T04:09:48.420532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.235166Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":"7296db1c-0b5a-43a3-97a2-998c888e363d","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.821931Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:d0e8a3a342007f3cf598cad1e4fec98a3530b99267487bdbd730b0b177e0949a","observation_id":"239cea9e-0360-41c7-bea2-1287ac56cd59","resolution":{"observed_at":"2026-08-07T04:09:48.259625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08889","last_updated":"2024-06-07T05:45:02Z","snapshot_observed_at":"2026-08-02T21:49:10.577943Z","submitted_at":"2023-06-15T06:45:46Z","title":"Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08889","snapshot_observed_at":"2026-08-07T04:09:40.892599Z","title":"S., Matyasko, A., Jaiswal, S., Fernando, B., and Tan, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.892599Z"},"links":{"cited_paper":"/paper/2306.08889","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:22b4d467b2c5cde08a20e19d962437986fede5e6c4d241d4058cf5295b785f75","observation_id":"547cea5c-7798-47df-9452-779a9b14c033","resolution":{"observed_at":"2026-08-07T04:09:40.892599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09595","last_updated":"2023-02-22T18:58:10Z","snapshot_observed_at":"2026-08-04T16:23:13.264745Z","submitted_at":"2023-01-23T17:51:39Z","title":"Zorro: the masked multimodal transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09595","snapshot_observed_at":"2026-08-07T04:09:40.977183Z","title":"Zorro: the masked multimodal transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.977183Z"},"links":{"cited_paper":"/paper/2301.09595","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:cfb948915ab1dede836d7a60b46775df31db1d24029687e834ec979b5a2d7fb2","observation_id":"16ce0f8b-0daf-4bc3-967d-d938b0dc3d2b","resolution":{"observed_at":"2026-08-07T04:09:40.977183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-06T21:17:51.553405Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-07T04:09:41.086921Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.086921Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:3b0d5d0dd2269ef78885b679e58d08b8a599a0d68c544f42da94f38347a2399d","observation_id":"d46087ef-f70c-4d11-83e1-910194c6e1e2","resolution":{"observed_at":"2026-08-07T04:09:41.086921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.029523Z","title":"and Monro, S","venue":null,"work_id":"107df467-8f43-4d44-ac67-9af0261f62f5","year":1951},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.216679Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:319bf470a3d3ec70a733b7f18d5e4e68ee0afc2eef9a464edc15a66ccf2c74a8","observation_id":"ea171b79-85fd-47e4-ae91-6a6c7b111834","resolution":{"observed_at":"2026-08-07T04:09:48.138516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T04:09:41.333805Z","title":"R., and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.333805Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:3166ce74436f9fe25ea0f9c286bb19a586967b3318d84878e8427014e1a49aaf","observation_id":"ebcad2ad-3b0e-4e4e-9aba-961f1d4e01b2","resolution":{"observed_at":"2026-08-07T04:09:41.333805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:47.791989Z","title":"L., Tickoo, O., and Huang, J","venue":null,"work_id":"82bdae25-0059-4508-af16-ee038fb27043","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.440088Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:116b889d2e41c1ebaf559c3edc3ba852f8c68c095938fb5044e873531c1df8c4","observation_id":"5ffad669-1854-4da8-9703-6fcf17fd33b9","resolution":{"observed_at":"2026-08-07T04:09:47.883478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:47.400653Z","title":"H., Bai, S., Liang, P","venue":null,"work_id":"38121e28-c27a-4a32-ac6d-239d81c90852","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.552413Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:45839aeba53f759e9f50249b05a16db8d76e172cd62d54402f6c1319ae041ae0","observation_id":"d0858fa7-edf5-4ef4-812c-4c2c3767b01d","resolution":{"observed_at":"2026-08-07T04:09:47.606166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.645870Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.645870Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2f1421cb75a7ed0391db157c6e6b755f0d5dc375d6aee973c59ff0de620f86e5","observation_id":"2fe37389-a3c9-4df0-afb3-bb45496bb3d9","resolution":{"observed_at":"2026-08-07T04:09:41.645870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:47.146084Z","title":"H., Zeeshan, M","venue":null,"work_id":"c626d340-34ca-4bc0-814b-ad44b6ccd562","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.762413Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:9db837803ad088163d8f28dbb866fbaea1ec2b0e82b14811debb9b4ad51b5a8e","observation_id":"ca52aa6e-4920-443d-9036-e6abdfdecfe2","resolution":{"observed_at":"2026-08-07T04:09:47.235792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.964740Z","title":"What makes training multi-modal classification networks hard? In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp.\\ 12695--12705, 2020 a","venue":null,"work_id":"471023e5-9a33-445b-8d46-bc89880836f1","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.879818Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:92e044239a141e9dbd3863f406b3d733ca114c1d892f4f78e580b159860e7f48","observation_id":"a82048ad-0376-4017-b5ad-0b4f1e841597","resolution":{"observed_at":"2026-08-07T04:09:47.029696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.667936Z","title":"Deep multimodal fusion by channel exchanging","venue":null,"work_id":"8acc6872-3368-456b-8bfb-b21b3332e1c4","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.996523Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:e4c6c17abd5ff805c5bbd1770bd62f7783b4d771d12d3a215aa7c5f14cafde8e","observation_id":"a99a2d56-7b1f-4a7f-a537-54692516e151","resolution":{"observed_at":"2026-08-07T04:09:46.828432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.385561Z","title":"Multimodal token fusion for vision transformers","venue":null,"work_id":"0f0c05bc-cabc-4bdf-b84a-b77f59878762","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.101140Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ca7a125763c9932f8268f622c1e1eb3340ebb9097103d21f2e945ab239c2e6a1","observation_id":"f21ef0bb-bf4f-461c-800f-d0a1362c8203","resolution":{"observed_at":"2026-08-07T04:09:46.490537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.134082Z","title":null,"venue":null,"work_id":"8b898024-086a-446a-8e0d-09fbca5d91b5","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.170844Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:66835c4a635a47af5f08cf38d65794138a420d4923544a9445d4619771954da5","observation_id":"2d4e5a44-063e-4e35-8056-c28ae24e966e","resolution":{"observed_at":"2026-08-07T04:09:46.245419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.909761Z","title":"Enhancing multimodal cooperation via sample-level modality valuation","venue":null,"work_id":"3b569985-143f-4723-86d0-b72cfcdc3e3a","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.227002Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:5b810837001226fba2ebf88bda6f1bed3aad23376255e458339f8741d6470204","observation_id":"7323a5ea-4aaa-4e4c-aa74-bd1a0b5851e2","resolution":{"observed_at":"2026-08-07T04:09:46.014133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.669812Z","title":null,"venue":null,"work_id":"b3715aae-c909-4b85-b527-244f2e868b16","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.283576Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:145a25014cc24f7b3b46530af17a5c4de2ba2138412ce3dc166fcab12a0f23fe","observation_id":"a1a04a73-0842-4a2e-beba-ec1c69b862ca","resolution":{"observed_at":"2026-08-07T04:09:45.793727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.455629Z","title":"Multimodal fusion with co-attention networks for fake news detection","venue":null,"work_id":"f98012d1-dbf6-492e-b73f-ef9b5c3a8119","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.335445Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:c51053acd6a449abeaaf331ec1d9da5cf815f38e324de9dbeb277742589b47e9","observation_id":"9441ca14-8e29-4259-abb4-a2903efd00ea","resolution":{"observed_at":"2026-08-07T04:09:45.527009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.190683Z","title":"Multimodal multi-loss fusion network for sentiment analysis","venue":null,"work_id":"a559dc81-f14f-40f0-b2f2-f00e059765e6","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.388586Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:8bc9f466bd7d27af8f6e1f18905ccf5e6d9654111dd603a99c9ac5a96b699b18","observation_id":"049e80b9-65b8-495a-8450-e1a6d4325ab9","resolution":{"observed_at":"2026-08-07T04:09:45.332401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10912","last_updated":"2023-06-08T06:58:05Z","snapshot_observed_at":"2026-07-06T14:54:19.013733Z","submitted_at":"2023-02-14T15:35:17Z","title":"Balanced Audiovisual Dataset for Imbalance Analysis","version":2},"cited_work":{"arxiv_id":"2302.10912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.10912","snapshot_observed_at":"2026-08-07T04:09:43.177423Z","title":"Balanced Audiovisual Dataset for Imbalance Analysis","venue":"cs.LG","work_id":"0477f687-83a3-4dd8-a628-71e8457e9fd4","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.449291Z"},"links":{"cited_paper":"/paper/2302.10912","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ddc97d60a2a992d6e501505e1927050c845aedff1cb3eb1b4ade8f1abf11e592","observation_id":"2b312de6-de2a-406f-800e-4eb2aee2f3c7","resolution":{"observed_at":"2026-08-07T04:09:43.246686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.987846Z","title":null,"venue":null,"work_id":"0100f699-731d-4168-a94a-fa3c74440895","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.505015Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:20b0cc177d8a0ac3d7f4109ec57704b70213895185c80c991c50d9dd173c4877","observation_id":"f9ef6733-d0c6-460b-9bd2-99b47c4c3490","resolution":{"observed_at":"2026-08-07T04:09:45.069587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.805199Z","title":"Facilitating multimodal classification via dynamically learning modality gap","venue":null,"work_id":"6b56bce9-92ff-49cc-9baa-6f4f9bc2e5d4","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.553697Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:499355433debc2782c56e1362c330f6bb5825fe353b69c5afd50a5df8e998ae6","observation_id":"66ed191c-5d3d-4682-beeb-b3e45e79ae60","resolution":{"observed_at":"2026-08-07T04:09:44.948613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.559006Z","title":"Learning to rebalance multi-modal optimization by adaptively masking subnetworks","venue":null,"work_id":"1395fb90-5a7d-4eb8-a57e-e3d2d7a40456","year":2025},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.619478Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ab0fc71d2bf747f7fd501221cc0fb7d41490c0633ec9e3090e3d870e541cae2a","observation_id":"f45c8981-637e-44af-9e1a-b8e6becbbf24","resolution":{"observed_at":"2026-08-07T04:09:44.656662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.315962Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":"0421c666-186b-451b-a6fb-fbb5bd494353","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.689333Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:71f2842e9a8cba315b93b5540c9634fa109df4bfced8e313396afcccd06461f6","observation_id":"e4aab786-902f-4950-b114-ce9358f957a4","resolution":{"observed_at":"2026-08-07T04:09:44.419762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-07-06T05:52:17.418793Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-07T04:09:42.779895Z","title":"Tensor fusion network for multimodal sentiment analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.779895Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ebe194b64e37f0a9c371a7441fbf546fb284de87e01a2e1a997d0389bf7d51d9","observation_id":"1b29b99a-b9c2-4b6a-87ff-895202aa7c49","resolution":{"observed_at":"2026-08-07T04:09:42.779895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.099237Z","title":"B., Liang, P","venue":null,"work_id":"a875bad2-1178-480b-ad4d-6f3bbd70b883","year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.869769Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:20ac8ff5869fc5364509f9935ef46b7e1ddd72d8c717172498a568da1c2001e3","observation_id":"33865e64-506f-4578-9ab0-f0365b44c665","resolution":{"observed_at":"2026-08-07T04:09:44.221027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:43.840717Z","title":"T., and Peng, X","venue":null,"work_id":"ed92a5fb-85c3-4ae1-8f3a-8f1b78666a19","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.959924Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:7a1b3dfc018bff6feca25472dce941133bebde45c5ca9de97e2f79bc8a0b8ac9","observation_id":"d43883cf-fe5d-4810-887c-33cfd95e3fd6","resolution":{"observed_at":"2026-08-07T04:09:43.959333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18947","last_updated":"2024-11-01T13:53:44Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-27T07:22:28Z","title":"Multimodal Fusion on Low-quality Data: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18947","snapshot_observed_at":"2026-08-07T04:09:43.057849Z","title":"Multimodal fusion on low-quality data: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:43.057849Z"},"links":{"cited_paper":"/paper/2404.18947","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:f0d01d670a7601b95ab401bcf5bae710c55b92c18241855abb8c81c90dfeb9dc","observation_id":"c2704c55-8763-4037-aeaa-3d9c784a8eef","resolution":{"observed_at":"2026-08-07T04:09:43.057849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:51:19.233284Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.11465."}