{"as_of":"2026-08-07T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58fc3371b665e14e51dee24646eee2d396fa83e9b8f5e1632f92a6b54cf69737","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:17:33.743609Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:48:28.447490Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:53:33.960468Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03304","snapshot_observed_at":"2026-08-06T15:48:28.447490Z","title":"Bridging domain generalization to multimodal domain generalization via unified represen- tations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.447490Z"},"links":{"cited_paper":"/paper/2507.03304","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:c3cf0d7c37bd8936d39e6c2ff0f02bc3d5ddeae98eabe69c8f536954aff65e78","observation_id":"bdc993b6-96dd-4fdc-b61a-fd7b27d75e34","resolution":{"observed_at":"2026-08-06T15:48:28.447490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"cited_work":{"arxiv_id":"2507.03304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.03304","snapshot_observed_at":"2026-08-05T21:53:33.960468Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","venue":"cs.CV","work_id":"61c9446f-b2ee-4b5e-99a8-12103b8cacd9","year":2025},"citing_paper":{"arxiv_id":"2508.07878","last_updated":"2025-08-11T11:51:06Z","snapshot_observed_at":"2026-08-07T06:18:31.329878Z","submitted_at":"2025-08-11T11:51:06Z","title":"TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:53:28.082648Z"},"links":{"cited_paper":"/paper/2507.03304","citing_paper":"/paper/2508.07878"},"observation_digest":"sha256:aa890198e5527d096e224abea2496f85771c89f1fb8875108370c035ee6f2bd4","observation_id":"211054c5-9651-4fd4-aa8f-cb0ac8b06d73","resolution":{"observed_at":"2026-08-05T21:53:34.006173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03304/citation-record","integrity":"/paper/2507.03304/integrity","json":"/paper/2507.03304/citation-record.json","paper":"/paper/2507.03304"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:30.662544Z","title":"Robust cross-modal representation learning with progressive self- distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:30.662544Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:9a27899bcf34db7d8943265a7c3a07673eba0e4fbfd345879fc4e9e9788f2b4c","observation_id":"367629b1-06fd-44bf-8af8-a12ad636b06d","resolution":{"observed_at":"2026-08-06T20:17:30.662544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.307807Z","title":"Person30k: A dual-meta general- ization network for person re-identification","venue":null,"work_id":"3efd176d-aca3-44cc-a016-26a5ffa42f21","year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:30.714796Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:d1b2f344d6cf50cfe97ef0fede305237b47eed6f9eede75ee474b3aca4e26c38","observation_id":"3c7174f9-cb10-461d-8361-32a23f45ea8e","resolution":{"observed_at":"2026-08-06T20:17:34.311524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.298489Z","title":"Ex- ploiting domain-specific features to enhance domain gener- alization","venue":null,"work_id":"f3dc1d0f-9c24-45cf-9e67-70d77d8fcd84","year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:30.817961Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:3bdf5bf1f75a6bb74cb3b2dca6e78a5cca5c4235549790041a7b7a0f9119a160","observation_id":"625d2206-bb91-4a9e-b088-a9f8acd006fd","resolution":{"observed_at":"2026-08-06T20:17:34.302108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.289726Z","title":"Domain generalization by solving jigsaw puzzles","venue":null,"work_id":"bd7b0833-b123-4214-b975-215c9d91aaa9","year":2019},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:30.939942Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:c1feb694e4fea85aba27942940bc2bbb3ff194985a729a02df0adbec2b8b759f","observation_id":"c46aa49c-7926-4040-aacf-81d74b420993","resolution":{"observed_at":"2026-08-06T20:17:34.293311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.281740Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"40705188-9bd1-4a33-a382-347d783a92c8","year":2020},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.021925Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:0e5b247144496ac8217922c96ea41e2f837b1e34d4c925d0038ebdf76e26c1fa","observation_id":"83fe79c4-12a6-4c3f-8875-4dce30852bc1","resolution":{"observed_at":"2026-08-06T20:17:34.285032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:31.100518Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.100518Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:3229b0193a80c90cfeb1162b2dd4eecd66533bf48133cdb73b7963b6ed4dbc8c","observation_id":"ca91e6ad-7b25-4850-ba6a-1cd22ec982d5","resolution":{"observed_at":"2026-08-06T20:17:31.100518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.268329Z","title":"Club: A contrastive log-ratio up- per bound of mutual information","venue":null,"work_id":"39affa69-2f17-43de-8b74-088c45fb3230","year":2020},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.162298Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:13eb86585769c8177e024ede75e5a6e4bce12c7aabc55d34fd55f1182843739c","observation_id":"d2284a4b-3ff1-4c65-97d7-a6ee1734dc99","resolution":{"observed_at":"2026-08-06T20:17:34.271871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.258553Z","title":"Robustnet: Improving domain generalization in urban-scene segmentation via in- stance selective whitening","venue":null,"work_id":"ea6bd1c0-aec0-4125-ad94-575f9fad8be5","year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.230593Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:b450efee696db0e47e4b0dc818856c1c6d8e1a0996a65d1b77b21fcea3de97c9","observation_id":"7235d909-7359-4f44-a604-e0d0da7610e4","resolution":{"observed_at":"2026-08-06T20:17:34.262285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.249415Z","title":"Openmmlab’s next generation video understanding toolbox and benchmark","venue":null,"work_id":"b23fe1c4-bc9b-4dd1-af19-5d11b603e481","year":2020},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.322944Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:cf9c0765537d16ffecdbea679ce5e3a627888541d9e15aa9651ff20640e71e75","observation_id":"76568704-939d-4ba7-b555-2531e143678e","resolution":{"observed_at":"2026-08-06T20:17:34.253281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.239396Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"8cb82356-08cd-475f-8f06-73f611047b4d","year":2018},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.387598Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:44f96adb9eb910e9583a6515c3c5707ced246a42b5a78148251678645a92ecf7","observation_id":"0d48e055-6574-4c8c-9a5b-3142ba062454","resolution":{"observed_at":"2026-08-06T20:17:34.243179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.230287Z","title":"Simmmdg: A simple and effective framework for multi-modal domain generalization","venue":null,"work_id":"9445daa2-dd20-492f-bfe1-898afd93f49c","year":2023},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.494194Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:246271b64a8ddd3e457235c141253279ecc3f348d7187db64de947f58ef73547","observation_id":"d1ec1c8e-4551-4c30-8080-8f31d01b84cd","resolution":{"observed_at":"2026-08-06T20:17:34.234404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.221734Z","title":"Towards mul- timodal open-set domain generalization and adaptation through self-supervision","venue":null,"work_id":"634e76d5-de3c-485d-b8d2-3baca340a7d1","year":2024},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.530990Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:f77fa3ef1ee32ff9f7ed3c2c3e000259e3403b6e928d502b6e15987f50b97df9","observation_id":"8136cfee-7770-41b1-be7e-ae6e20088cf3","resolution":{"observed_at":"2026-08-06T20:17:34.224985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.213223Z","title":"Multi-modal align- ment using representation codebook","venue":null,"work_id":"8e2618d0-78bf-4512-9418-8d283c14131a","year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.597009Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:c21a7bea257e81d3f26a339f7218b9059cc584bf80d47a041c785a11915a4a64","observation_id":"7551c2b5-df3c-4027-b81d-a1c2b3935fed","resolution":{"observed_at":"2026-08-06T20:17:34.216171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.204599Z","title":"Cross-modal representation flattening for multi-modal do- main generalization","venue":null,"work_id":"9cb51c94-0901-4ba7-8971-360751fd0488","year":2025},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.658418Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:217d252cef836505b1f66b575d66fe526376c8fb5d161d37d1104f6dea74fe70","observation_id":"054b1fa6-6cf8-47af-8382-67846ed614dc","resolution":{"observed_at":"2026-08-06T20:17:34.208054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:31.731723Z","title":"Ace: A generative cross-modal retrieval framework with coarse-to-fine semantic modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.731723Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:21e75d75150392eb07666d26d7940fb0482ce529a5cd4426744467cae64170a9","observation_id":"40d239d3-9cd2-4cac-a313-79ab721ea3d0","resolution":{"observed_at":"2026-08-06T20:17:31.731723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:31.828849Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.828849Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:e541f166c18a0cc7524420b2cc30fc7985d8f412b6b138215606b58c99bc1b43","observation_id":"32bfe891-36d2-4b79-a35d-3dd57f575f5d","resolution":{"observed_at":"2026-08-06T20:17:31.828849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-06T20:17:31.994571Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:31.994571Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:12dc0f4c94ea4200b90d6dd65962e62b24f4e474b738ec5de27099c5cdde447e","observation_id":"5aab43cb-8fb3-423a-9c37-4e3974d0e37e","resolution":{"observed_at":"2026-08-06T20:17:31.994571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.192058Z","title":"Domain-adversarial training of neural networks","venue":null,"work_id":"c66ec3c3-1f94-47d7-a2ad-08ec5f142fef","year":2016},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.116201Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:db440ba558459b60ca85813688c4698216f4c734dca02ff6d0bd210953a62421","observation_id":"a4ae10b5-14ce-4b08-8abd-2159760e5ae9","resolution":{"observed_at":"2026-08-06T20:17:34.194868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:32.233001Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.233001Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:dbbc77229ef4b0ab4c594a0c855731c22f220af52a5e0b2d613d079350fe8899","observation_id":"62b183e1-9bb4-4426-adb8-5d3a9d5dc224","resolution":{"observed_at":"2026-08-06T20:17:32.233001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03095","last_updated":"2021-08-05T07:31:58Z","snapshot_observed_at":"2026-07-06T11:07:08.503991Z","submitted_at":"2021-05-07T07:49:56Z","title":"Learning Shared Semantic Space for Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03095","snapshot_observed_at":"2026-08-06T20:17:32.349703Z","title":"Learning shared semantic space for speech-to-text translation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.349703Z"},"links":{"cited_paper":"/paper/2105.03095","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:eabb65a8355f914f0afe0ec1cabd46e1cb3e01ae7965acb855d5dfdc69a9b655","observation_id":"7f52017b-2b61-49a6-8f99-1983ff533651","resolution":{"observed_at":"2026-08-06T20:17:32.349703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.179717Z","title":"Mixgen: A new multi- modal data augmentation","venue":null,"work_id":"b0c48ed1-289b-4de1-8c0c-c02d032c1a3a","year":2023},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.475160Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:77a9073e67ad6f19b0f7dc1abd219bd49b302269f616e18c518eced56dfadbed","observation_id":"672a4428-19a5-42d5-80db-97b04e360d6a","resolution":{"observed_at":"2026-08-06T20:17:34.183265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:32.574686Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.574686Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:89507e799b8a2d44eab02ea4301fbc50ab0d578ff7d389e64b5e401240db8361","observation_id":"72a52d41-58aa-433a-860e-cda34ffc7a6a","resolution":{"observed_at":"2026-08-06T20:17:32.574686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05168","last_updated":"2025-06-01T05:09:27Z","snapshot_observed_at":"2026-07-06T17:41:31.462546Z","submitted_at":"2024-03-08T09:16:47Z","title":"Enhancing Multimodal Unified Representations for Cross Modal Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05168","snapshot_observed_at":"2026-08-06T20:17:32.719103Z","title":"Un- locking the potential of multimodal unified discrete represen- tation through training-free codebook optimization and hier- archical alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.719103Z"},"links":{"cited_paper":"/paper/2403.05168","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:bdae1588a875223bb5da1dcd2cfc1f416f44d3f4c64749161640d886a91340d8","observation_id":"d5116977-16d3-4b68-b859-77414f9c3c14","resolution":{"observed_at":"2026-08-06T20:17:32.719103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.167069Z","title":"Semantic residual for multimodal unified discrete representation","venue":null,"work_id":"4e543499-1713-485a-a7a7-8baa998e915d","year":2025},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.834039Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:f11e4af435d27b1b661137c01eac21598737732d0b3ddf9d67b4ca5e11f5a025","observation_id":"e332a5bf-2105-4644-b886-cbb5985d958b","resolution":{"observed_at":"2026-08-06T20:17:34.170036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.157160Z","title":"Overcoming both domain shift and label shift for referring video segmentation","venue":null,"work_id":"1f424b5e-1973-421e-965e-7010a8eded2b","year":2025},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:32.986054Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:27d53d072971d0a6d249dee515508efd99f66651581a8d9c84c955600e621837","observation_id":"1c6a9cf2-7ba9-45a6-b35f-a0b2098824d7","resolution":{"observed_at":"2026-08-06T20:17:34.160480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.147634Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learn- ing?(provably)","venue":null,"work_id":"ad8cecf9-f948-4848-84e6-9995f08c0d6f","year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.145796Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:ca4c45a2ea4fd2f895e554a7298e87fca3b9041bf35a418b9b821793a94cd58d","observation_id":"1d58d270-e56e-480d-8f6c-e2db95288fdc","resolution":{"observed_at":"2026-08-06T20:17:34.150997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.139069Z","title":"Self-challenging improves cross-domain generalization","venue":null,"work_id":"4eac9fa3-0507-43b1-8371-870617c3c8ce","year":2020},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.265779Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:3fd330fb4d88f375aab16cef1a6ac0b2b5b326b0ca7ac61e0e919faf4015950c","observation_id":"215936f2-5b94-4727-bf94-9c0c718462e4","resolution":{"observed_at":"2026-08-06T20:17:34.142163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T20:17:33.384873Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.384873Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:235422814e48f95e80519b28fc42be0dd887484fbdb4348e81a44249e72a4d73","observation_id":"8e06b915-609c-48b9-a755-b4cb14c9aebf","resolution":{"observed_at":"2026-08-06T20:17:33.384873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.525005Z","title":"Supervised contrastive learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.525005Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:b3c671be6c532e16cb2e7bbb7c9ca77a7f447a4e8345be5becfdcabc3b453661","observation_id":"906275a0-1dc9-43df-b581-9eff0201ce3b","resolution":{"observed_at":"2026-08-06T20:17:33.525005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.124833Z","title":"Learning to generalize: Meta-learning for do- main generalization","venue":null,"work_id":"d8b9b058-5656-4bfc-969c-92c5460e3d46","year":2018},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.661806Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:21ada6e32b2926959e8917173c0c6fed8069861671a6916ee09ebde27c4f2764","observation_id":"ece49bbc-b443-4e35-a483-7030e21f7ca1","resolution":{"observed_at":"2026-08-06T20:17:34.127998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.115555Z","title":"Domain generalization for med- ical imaging classification with linear-dependency regular- ization","venue":null,"work_id":"df358c01-efee-4b68-bb56-9aea2f8a8607","year":2020},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.664130Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:195ad000a74e0dc50e48a7063982670a5bfc7fff1f95014bce11c881f2b642fd","observation_id":"de586f03-dbb5-4607-b641-327b72510c13","resolution":{"observed_at":"2026-08-06T20:17:34.118896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05438","last_updated":"2021-06-10T00:23:33Z","snapshot_observed_at":"2026-07-06T11:17:47.803564Z","submitted_at":"2021-06-10T00:23:33Z","title":"Cross-Modal Discrete Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05438","snapshot_observed_at":"2026-08-06T20:17:33.666611Z","title":"Cross- modal discrete representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.666611Z"},"links":{"cited_paper":"/paper/2106.05438","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:3129b809422a568636f6ce6c899b66e10cff1db30b35590acda1622cc85f8180","observation_id":"6a796008-bc33-4c1b-bc93-88294838052a","resolution":{"observed_at":"2026-08-06T20:17:33.666611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.106690Z","title":"Feddg: Federated domain generalization on medical image segmentation via episodic learning in continuous fre- quency space","venue":null,"work_id":"77d1e81d-a288-40d3-9a4b-3f8f3d7d1995","year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.669339Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:213be18151a21cf31ced3b5b674228be9fdce80d194a3f062d33e60d36b1c5f0","observation_id":"4c65e704-fbf4-466e-89c6-9418f63b6845","resolution":{"observed_at":"2026-08-06T20:17:34.109865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.097672Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":"c38c0334-26c5-4b3b-b84a-009aed6a36c8","year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.671848Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:1d227ab975a08fb86b8f270da377f7db57ea17d920a6be08468772745f579c24","observation_id":"804d2320-b95d-4157-a804-a18d31913ab4","resolution":{"observed_at":"2026-08-06T20:17:34.101332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.088370Z","title":"Do- main generalisation via risk distribution matching","venue":null,"work_id":"a862bcdc-654e-485c-a994-927bd12176fe","year":2024},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.674222Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:5f1ccbc849ca91399533b70310d0230a8b78ef710f81760af4d6efa95de272b0","observation_id":"7b655176-915c-432c-a424-59cafb054e08","resolution":{"observed_at":"2026-08-06T20:17:34.092456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.677254Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.677254Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:bedcf7ba17ea61c9cb0ebf26bd1f88a143dd66e3a9a6ae3ae435d7e853707f83","observation_id":"ecb813f9-36db-44a4-a33c-4bd6f24d62fa","resolution":{"observed_at":"2026-08-06T20:17:33.677254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.076686Z","title":"Causality-inspired single- source domain generalization for medical image segmenta- tion","venue":null,"work_id":"8c9e1576-9b53-4d7f-b1aa-2665b83696e9","year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.680080Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:667ab9e03bb3efb536011366ff17328393fd828b0dcec84d2f1d80025813fa52","observation_id":"afd8d279-07a5-40f5-bf63-bf0ab16a0799","resolution":{"observed_at":"2026-08-06T20:17:34.079762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.068478Z","title":"Two at once: Enhancing learning and generalization capacities via ibn-net","venue":null,"work_id":"4f799d8f-e4b8-4cb1-9860-3eaec892a876","year":2018},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.682525Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:f6df22ff304696013b819716dd3d1e2a0c9ae0efcde2edea52d50257857d5469","observation_id":"f62ac8d6-b12d-4f7b-9f23-028cd51ac077","resolution":{"observed_at":"2026-08-06T20:17:34.071718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.685007Z","title":"Audio-visual speech recognition with a hybrid ctc/attention architecture","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.685007Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:afed4bf42c91aa7300cc308afe889c4fe4003dd26d1d8952163fe9049885d1c9","observation_id":"0dfb147a-8649-456e-8643-73fe8cb170ff","resolution":{"observed_at":"2026-08-06T20:17:33.685007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.056485Z","title":"Domain generalization through audio- visual relative norm alignment in first person action recog- nition","venue":null,"work_id":"5523df64-c0e5-4b8b-bc75-7f5bc9cefaaa","year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.687167Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:26a0a5293b37bd4fda96366874bd94c614354bcf1603f70574142ffaa300e752","observation_id":"235b3f85-4e5e-4de5-9357-d3a68211a5dc","resolution":{"observed_at":"2026-08-06T20:17:34.059536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.690248Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.690248Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:e1802eb9a2dd9b6d8259528b490bf535d7e89026576718f6d026da3527f6dbb0","observation_id":"c8abcd8e-0385-4cf5-b14f-903b0c4cf40a","resolution":{"observed_at":"2026-08-06T20:17:33.690248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.042858Z","title":"Domain generalization of 3d semantic segmenta- tion in autonomous driving","venue":null,"work_id":"e76ce739-82a9-4376-bd61-47ad94ca78ae","year":2023},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.692980Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:9ef4c1fa7c665152970e623b13450080a78777e2cce9786262b41c94227b41ca","observation_id":"840e71de-0fed-49d7-8705-117c18b55733","resolution":{"observed_at":"2026-08-06T20:17:34.046466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.033435Z","title":"Xkd: Cross-modal knowl- edge distillation with domain alignment for video represen- tation learning","venue":null,"work_id":"28634843-f0b0-4088-aa06-e82b6fadf5ff","year":2024},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.695469Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:4d4d24ad238e3fab3201912e0e9bdceccdc1ddb5b46164f472d4ce9c2e5d362d","observation_id":"ab3faffb-3a66-45b9-9aeb-2def61d19010","resolution":{"observed_at":"2026-08-06T20:17:34.037073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.704652Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.704652Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:914799a7a78ddcdc2a5a87097733bb5225b2cdc08d86c99d76fc750ecb5f5a99","observation_id":"57f60cfa-bad4-45c9-9323-aeb604e93460","resolution":{"observed_at":"2026-08-06T20:17:33.704652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3474","last_updated":"2014-12-10T21:20:54Z","snapshot_observed_at":"2026-07-06T04:03:12.627088Z","submitted_at":"2014-12-10T21:20:54Z","title":"Deep Domain Confusion: Maximizing for Domain Invariance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3474","snapshot_observed_at":"2026-08-06T20:17:33.706889Z","title":"Deep domain confusion: Maximizing for domain invariance","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.706889Z"},"links":{"cited_paper":"/paper/1412.3474","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:45738d2982a502871a75925de9d36b4db799e4e3da581c7f03e8e79b4fae49d4","observation_id":"35372632-7d31-427b-963e-610a229af351","resolution":{"observed_at":"2026-08-06T20:17:33.706889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24406","last_updated":"2025-05-30T09:45:41Z","snapshot_observed_at":"2026-07-06T21:33:36.129612Z","submitted_at":"2025-05-30T09:45:41Z","title":"IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24406","snapshot_observed_at":"2026-08-06T20:17:33.709950Z","title":"Irbridge: Solving image restoration bridge with pre-trained generative diffusion mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.709950Z"},"links":{"cited_paper":"/paper/2505.24406","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:5392d5029d838a3d9964d7096cebde5b917b823fc24267b8ad406af96c45a15a","observation_id":"4d4e4a51-aac1-4641-a3e7-efe0001d5e29","resolution":{"observed_at":"2026-08-06T20:17:33.709950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.020589Z","title":"Generalizing to unseen domains: A survey on do- main generalization","venue":null,"work_id":"56a0daf5-5193-48c9-b5f5-6444093cd8bc","year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.712714Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:d75556d1cdbe0bec8e284653b21ffa8ca8634163489d036a0c592d1d073dcc5f","observation_id":"a76050e3-8300-4e75-97d3-7c85a440b111","resolution":{"observed_at":"2026-08-06T20:17:34.024699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17675","last_updated":"2025-03-22T07:03:57Z","snapshot_observed_at":"2026-07-06T20:57:02.587855Z","submitted_at":"2025-03-22T07:03:57Z","title":"Towards Transformer-Based Aligned Generation with Self-Coherence Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17675","snapshot_observed_at":"2026-08-06T20:17:33.715241Z","title":"Towards transformer-based aligned generation with self-coherence guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.715241Z"},"links":{"cited_paper":"/paper/2503.17675","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:3aefad24260ad2bbc3fd83bf6ab0867ec4fc445d97cbd53aee883bb4a0fc1b59","observation_id":"55207443-e347-4e52-9919-a7340aa99d6d","resolution":{"observed_at":"2026-08-06T20:17:33.715241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.717661Z","title":"Vlmixer: Unpaired vision-language pre-training via cross-modal cutmix","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.717661Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:b8508667303f0b2c0688036904833836c4ff7c31d5ef99489f88630e4d730acd","observation_id":"5288a065-ccd6-40ea-b0a5-a03739c47ffc","resolution":{"observed_at":"2026-08-06T20:17:33.717661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:34.007695Z","title":"Achiev- ing cross modal generalization with multimodal unified rep- resentation","venue":null,"work_id":"619f6fce-fe3d-4011-a86f-f6523da5c23c","year":2024},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.719984Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:f16ce0483a039fe8196f72312b2467b4945b8ca583d63b59079a870864f57701","observation_id":"4a04a520-0c9b-4136-b36a-ee9a8c11bacd","resolution":{"observed_at":"2026-08-06T20:17:34.011211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-07-06T06:06:04.571585Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T20:17:33.723554Z","title":"mixup: Beyond empirical risk minimiza- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.723554Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:bb5711426a00c61e6ffae27a0bcd10c67fd976c4b93beb449bec9ec4fee8c018","observation_id":"d0b7965f-640f-441b-84b8-2ab63eabcc06","resolution":{"observed_at":"2026-08-06T20:17:33.723554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.726778Z","title":"Towards effective multi-modal interchanges in zero-resource sounding object localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.726778Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:c4c825dd158f8c7bdeb231df00edd8b9c32d8e7dc683fac170a3ef83794d0151","observation_id":"c78852ac-f983-4f70-9ce7-22d74d7406c8","resolution":{"observed_at":"2026-08-06T20:17:33.726778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.994029Z","title":"Deep domain-adversarial image generation for do- main generalisation","venue":null,"work_id":"53a3eef9-e336-4100-80d2-6b0aaf2369cd","year":2020},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.729663Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:a8759dbf957296a4af3f14c097581d8baf4db8228b7f3b7340ed25badd0008b7","observation_id":"274f3c99-efa3-4402-8f0c-0942b630b3b1","resolution":{"observed_at":"2026-08-06T20:17:33.998204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.984126Z","title":"The feature dimensions for video, audio, and optical flow are 2304, 512, and 2048, respec- tively","venue":null,"work_id":"90fa59b0-4235-41f5-bea7-b013d5a02909","year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.732280Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:f29d4d85ea629eda37e5db781b87d0514cb668b6e2f60d2ec8357811350b9c75","observation_id":"ce04ae21-10af-465f-a1ce-205d586acd9b","resolution":{"observed_at":"2026-08-06T20:17:33.987896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7665.9960","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.818666Z","title":"In contrast, our proposed approach sub- stantially improves their performance in the MMDG set- ting","venue":null,"work_id":"fb67a8fe-a998-4660-980c-ececa5c37722","year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.735441Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:3ff4b12e4d033f5a301bb6aea7892b1109c1f795023e04b731ab7ee82ca8d817","observation_id":"198db991-3e51-4860-aba8-d3d4dc5bb88c","resolution":{"observed_at":"2026-08-06T20:17:33.826037Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.973951Z","title":"Notably, our method exhibits minimal fluctuations across all parame- ter settings, indicating a lower sensitivity to hyperparameter selection","venue":null,"work_id":"64e233db-446c-4fcc-9f04-89ff988b290a","year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.738182Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:fb7fc672aa25f24d1db9dbff52211409797583e552844645f15b95d0f46c3f0a","observation_id":"39431b76-be70-446e-9b0d-6c8f699dff9e","resolution":{"observed_at":"2026-08-06T20:17:33.977922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.964650Z","title":"We do not ab- late Lcls since it is essential for classification","venue":null,"work_id":"67c0b14e-fbc6-4ae1-805b-a93f50ebead4","year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.740779Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:b20113144bdaf4d2c7fc730e632154e751d7efabc8c3abc6ba2704706fe89c35","observation_id":"f164fdb5-87d3-4fab-b0a4-8b278bc93993","resolution":{"observed_at":"2026-08-06T20:17:33.968234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:33.954891Z","title":"It can be observed that the gen- eral and specific information of each modality are well- separated and consistently aligned across domains","venue":null,"work_id":"2600b4df-e14b-4195-b450-1e534b6f35b5","year":null},"citing_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:33.743609Z"},"links":{"citing_paper":"/paper/2507.03304"},"observation_digest":"sha256:846b8d6588ea992ba07b4177b8224f43a7a499efaec53834dee0f999c04d54ce","observation_id":"19bb939f-7ff0-444f-99ea-caac1b72b22b","resolution":{"observed_at":"2026-08-06T20:17:33.959004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:17:38.510784Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2507.03304."}