{"as_of":"2026-08-07T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1c72b24c4e4be9aae45a08f69073234df59dda1a62bfc23ee6a14f3df272bda","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:48:33.963779Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:53:28.021948Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:53:34.084878Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"cited_work":{"arxiv_id":"2507.14935","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.14935","snapshot_observed_at":"2026-08-05T21:53:34.084878Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","venue":"cs.CV","work_id":"6327123f-e2d1-4fa6-8677-6aaac304d2e9","year":2025},"citing_paper":{"arxiv_id":"2508.07878","last_updated":"2025-08-11T11:51:06Z","snapshot_observed_at":"2026-08-05T21:53:25.467226Z","submitted_at":"2025-08-11T11:51:06Z","title":"TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:53:28.021948Z"},"links":{"cited_paper":"/paper/2507.14935","citing_paper":"/paper/2508.07878"},"observation_digest":"sha256:597c7bc25e652953f2ae8f040c38d4edb1bd7ba71c2f126c46949c30e553b25d","observation_id":"aa53c0d5-f2ba-4c21-9783-00fd73b7fa6f","resolution":{"observed_at":"2026-08-05T21:53:34.172007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14935/citation-record","integrity":"/paper/2507.14935/integrity","json":"/paper/2507.14935/citation-record.json","paper":"/paper/2507.14935"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:46.839549Z","title":"Robust cross-modal representation learning with progressive self- distillation","venue":null,"work_id":"c86f1d34-c0fc-46ed-a0c2-4d18ca645c11","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:25.548996Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:72f921ab7e8945c8d0eef0a681a766c61328e4c33c15a1472d54437a1a03ac5e","observation_id":"9a653eda-7ed8-461e-9c05-254125e640ed","resolution":{"observed_at":"2026-08-06T15:48:46.945276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:46.581398Z","title":"On the effectiveness of image rotation for open set domain adaptation","venue":null,"work_id":"1be469ff-f1ff-44ed-8f6d-e7ea8dc703ef","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:25.670170Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:0bf265377b2642e6b80f33aa7a07876074bac1c7b779bf1f6b6ade36a09f904d","observation_id":"da722cd7-14fe-4fba-9270-de4615f6ea92","resolution":{"observed_at":"2026-08-06T15:48:46.699431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:46.358245Z","title":"Domain generalization by solving jigsaw puzzles","venue":null,"work_id":"8b46ae57-a7e6-437f-8092-b9ea035b3ef3","year":2019},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:25.778914Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:dc37d0b7120688ba4fbe93953527d5ec66fafdd626598239520a49ff77175062","observation_id":"f27956e9-7a49-4e87-ac8a-f86e3d175bdf","resolution":{"observed_at":"2026-08-06T15:48:46.448429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:25.886544Z","title":"Collecting highly paral- lel data for paraphrase evaluation","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:25.886544Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:d9c6a556560bc04c991301b9aec288ee38932d8c0b684a5e1c83a4848a146e8e","observation_id":"dee88b25-f9c6-4d64-b7b1-a9ce145e3d7c","resolution":{"observed_at":"2026-08-06T15:48:25.886544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:46.077088Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"cb723723-2fc8-42da-83a4-c16365e9a15c","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.060304Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:20dbaaa8103afabc9c85161b23fe8f08a282eba1ee955325e9135e099e6f309e","observation_id":"396e61a4-d780-417d-a576-1fbeb402b0c1","resolution":{"observed_at":"2026-08-06T15:48:46.213437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:45.829118Z","title":"Hts-at: A hierarchi- cal token-semantic audio transformer for sound classifica- tion and detection","venue":null,"work_id":"50a100dc-e92c-43e3-893b-6f3340d1e8a8","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.165853Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:7960f68ae88d0e43b1923f3c1772d0d699cd69c8e673841eb2670dccf42e3dfd","observation_id":"40a90f4a-be71-4554-a7b7-24b51ec6dc28","resolution":{"observed_at":"2026-08-06T15:48:45.924381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-06T15:48:26.258804Z","title":"Valor: Vision-audio- language omni-perception pretraining model and dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.258804Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:2bab738fe6c1d0a7ce06b72167bb4b5dc8fffc5721cf60cf89f33277347be9e9","observation_id":"9eacc5aa-1288-437f-a5f3-2e665af6c317","resolution":{"observed_at":"2026-08-06T15:48:26.258804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:45.620243Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"c3d9b959-b704-48f8-93d0-82deadf93da6","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.393490Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:a8af02f27bef60807f8338e4b573d033219f483bcd2de37668d603b9e4a31544","observation_id":"4528c55e-2a93-4781-ae74-7c72c085ea0e","resolution":{"observed_at":"2026-08-06T15:48:45.722400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:45.362830Z","title":"Sinkd: Sinkhorn distance minimization for knowledge distillation","venue":null,"work_id":"d235a393-45a8-4e24-896d-d9b9b18f5628","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.524128Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:602d6feca68dd77aeca566e8ea489972fe633dd847247d158a7897d33a13a9fe","observation_id":"7406c049-2539-466b-aa97-8122938036f1","resolution":{"observed_at":"2026-08-06T15:48:45.497935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:45.094617Z","title":"Sinkhorn distance minimization for knowledge distilla- tion","venue":null,"work_id":"31b6a4e5-adc4-4f37-86e1-1c1d9a3663d5","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.655853Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:681f0d576bcf014e5f7446fe531e88f7833b292728f92eeb3f52633b4b8f9972","observation_id":"d694a12a-1115-452f-949a-aca3c1e76ad3","resolution":{"observed_at":"2026-08-06T15:48:45.205864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:44.779528Z","title":"Optical: Leveraging optimal trans- port for contribution allocation in dataset distillation","venue":null,"work_id":"52e58b36-2798-4a86-a200-204f6e272291","year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.771225Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:0d912c5693178f5833906f5da4fa664489f9a6daf6301b0a7c11c698b0e792fd","observation_id":"1b229b04-2c2d-4e19-a83e-327b027cdebf","resolution":{"observed_at":"2026-08-06T15:48:44.922516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:44.484757Z","title":"Layoutenc: Leveraging enhanced layout rep- resentations for transformer-based complex scene synthesis","venue":null,"work_id":"719213ea-cf35-438a-b3da-c8e0e1793119","year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:26.885590Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:ce1622cb213c5c41b45ad5b2c88c5137edc5ebfa97803dd959d58d7db3b06516","observation_id":"2f994dd1-b7c2-4e6d-8938-a2e94fdcde70","resolution":{"observed_at":"2026-08-06T15:48:44.599120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:44.276042Z","title":"Streetsurfgs: Scalable ur- ban street surface reconstruction with planar-based gaussian splatting","venue":null,"work_id":"d5718c88-df0f-4528-815e-e68090ea8045","year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.037175Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:4c02a93ee80304e0e3c44b6e95384d022d8cde3dce0dab226d158524e0d805f8","observation_id":"a3cf246e-ee9e-41e9-9ee8-07a0e685898f","resolution":{"observed_at":"2026-08-06T15:48:44.384755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01518","last_updated":"2024-07-01T17:59:09Z","snapshot_observed_at":"2026-08-05T04:17:30.481007Z","submitted_at":"2024-07-01T17:59:09Z","title":"Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervision","version":1},"cited_work":{"arxiv_id":"2407.01518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01518","snapshot_observed_at":"2026-08-06T15:48:35.300627Z","title":"Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervision","venue":"cs.CV","work_id":"9c36c332-6766-464c-bc22-9e79d392ccfe","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.140292Z"},"links":{"cited_paper":"/paper/2407.01518","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:e0c78d67ec067f7692c3667aa1a336e15d153a4b5f40c98cd2a9192d89a7d74b","observation_id":"af806a17-5526-4171-8036-6b1e99c5917e","resolution":{"observed_at":"2026-08-06T15:48:35.385262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:44.054129Z","title":"Simmmdg: A simple and effective framework for multi-modal domain generalization","venue":null,"work_id":"5e26a475-78ce-47d7-95b4-f349d5daa3c3","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.241584Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:a1f472067416ed6ee8bb4cfa0afcbab68bc8d6007f38a6991c11bc51030b1ade","observation_id":"33e87a74-1eb6-464c-b70a-86a9749d9f10","resolution":{"observed_at":"2026-08-06T15:48:44.159885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:43.813402Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":"03734e91-7d69-45f0-bf71-bbcf0d535b23","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.379391Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:8df95b33fcf28190fa2be80b2f83454ca628c82c6dee0784d940ac996f6213eb","observation_id":"507023a4-0327-44b5-b8ea-a620ee805697","resolution":{"observed_at":"2026-08-06T15:48:43.936791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:43.580110Z","title":"Multi-modal align- ment using representation codebook","venue":null,"work_id":"5e3b5699-f88c-4f3b-9a5c-9ca8f524bcbf","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.511828Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:6126f93df7c6b60fe8ba8efa4b3cef06cec75ece9a6c213c705c393f7b4cf514","observation_id":"09215f9d-9f71-494e-b01f-299865375760","resolution":{"observed_at":"2026-08-06T15:48:43.707248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.17507","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:35.089831Z","title":"Ace: A generative cross-modal retrieval framework with coarse-to-fine semantic modeling","venue":null,"work_id":"f9f9de8b-4f43-4a3f-9f20-4cc82f31725a","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.648562Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:40e38508064b3417772b12f8a45ed3aea8d2b635711ec63b11740d76449631a2","observation_id":"51531b0d-6a4b-410d-be22-2e8426a6893c","resolution":{"observed_at":"2026-08-06T15:48:35.160122Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:27.779563Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.779563Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:907016c08f31e66fd9e0315abe4829420dcb4c6525cb432bbc11d04d11b6b309","observation_id":"2f814264-7211-4be5-a0d5-027e32162906","resolution":{"observed_at":"2026-08-06T15:48:27.779563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:43.375040Z","title":"Domain-adversarial training of neural networks","venue":null,"work_id":"73a14d35-46e5-4cb6-ab02-005b70816863","year":2016},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:27.947964Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:6b2e46780b4f5ad6b36ee2ff5a5b65934f5d6796cca4e0daf6a03f53da293020","observation_id":"fd407d55-5386-4d64-9c20-ccaf26e2e10f","resolution":{"observed_at":"2026-08-06T15:48:43.460597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:28.115661Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.115661Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:19bf2d292f58229384969f6e12dfd08baa9e02177d37f44ab0f9ad15d1bab1ee","observation_id":"4c64e29f-8989-4401-991e-dc5f1e2c3740","resolution":{"observed_at":"2026-08-06T15:48:28.115661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05168","last_updated":"2025-06-01T05:09:27Z","snapshot_observed_at":"2026-07-06T17:41:31.462546Z","submitted_at":"2024-03-08T09:16:47Z","title":"Enhancing Multimodal Unified Representations for Cross Modal Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05168","snapshot_observed_at":"2026-08-06T15:48:28.218101Z","title":"Enhancing multimodal unified rep- 9 resentations for cross modal generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.218101Z"},"links":{"cited_paper":"/paper/2403.05168","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:366f82fbba2b8a5c8b97c2f8d9797c1ae9fec3471e3d12ce535c802f29e9eb18","observation_id":"5693eb52-ffb9-4a0e-a0b6-c3fd604f14b2","resolution":{"observed_at":"2026-08-06T15:48:28.218101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:43.132687Z","title":"Semantic residual for multimodal unified discrete representation","venue":null,"work_id":"5da9940b-f49d-4bc1-b0e0-fa52008b4882","year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.320120Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:ece5d963eb5d3e22bf898a95c1b49cba67cca8eaa1b4357d59dc0b5f2e8b2137","observation_id":"302450ac-17aa-42a6-8c26-e1ed2f82c0bd","resolution":{"observed_at":"2026-08-06T15:48:43.239672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03304","last_updated":"2025-07-04T05:17:32Z","snapshot_observed_at":"2026-08-06T20:11:09.413532Z","submitted_at":"2025-07-04T05:17:32Z","title":"Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03304","snapshot_observed_at":"2026-08-06T15:48:28.447490Z","title":"Bridging domain generalization to multimodal domain generalization via unified represen- tations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.447490Z"},"links":{"cited_paper":"/paper/2507.03304","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:c106ce8d371e2ca5eb1fcf2abe792263c5d6535ced992edb5131de0c3534ea99","observation_id":"bdc993b6-96dd-4fdc-b61a-fd7b27d75e34","resolution":{"observed_at":"2026-08-06T15:48:28.447490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-07-06T19:07:37.761860Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-06T15:48:28.600859Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling.arXiv preprint arXiv:2408.16532, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.600859Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:106e1fa0d845d8e1562c08ec1b97519a79e567ca5ec854b530fddd7b509571c7","observation_id":"b0f93d54-2536-44a3-91c0-881c016cfe4f","resolution":{"observed_at":"2026-08-06T15:48:28.600859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:42.901197Z","title":"Learning to generalize: Meta-learning for do- main generalization","venue":null,"work_id":"1aef9830-845a-4f5c-a1a4-b51510e04e0b","year":2018},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.728539Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:8949bede5e6f7e12e63f912f35278aaa7021f84bc2bd8c9585c70a581586432d","observation_id":"807fa901-b252-4444-8f09-06bbc1d8feb9","resolution":{"observed_at":"2026-08-06T15:48:42.994612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:42.661177Z","title":"Domain generalization for med- ical imaging classification with linear-dependency regular- ization","venue":null,"work_id":"0fac315e-0973-4c0b-aa09-5a218b326e63","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:28.883688Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:1bc347a7bc3b0d96147498d44bcbe5294a036b78727db44b97780d0f99ae8f42","observation_id":"e4e07c83-b58c-4ac9-9336-480b1ebb98c7","resolution":{"observed_at":"2026-08-06T15:48:42.783890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:42.383504Z","title":"Adjustment and alignment for unbiased open set domain adaptation","venue":null,"work_id":"f55bdc41-d131-4264-9f03-a4f881b4d6f2","year":2023},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.019728Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:772f188b866ce601aeb84bc191893b87fe614bf084a333d49e3db2d07524e1a0","observation_id":"882ef81a-0a97-43bc-8971-19b5b257d701","resolution":{"observed_at":"2026-08-06T15:48:42.499297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05438","last_updated":"2021-06-10T00:23:33Z","snapshot_observed_at":"2026-07-06T11:17:47.803564Z","submitted_at":"2021-06-10T00:23:33Z","title":"Cross-Modal Discrete Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05438","snapshot_observed_at":"2026-08-06T15:48:29.139488Z","title":"Cross- modal discrete representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.139488Z"},"links":{"cited_paper":"/paper/2106.05438","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:78c6bd09f75cf0f1aa74742afafe9b31f158912f710dbeff24856a9916492e3f","observation_id":"b9e429f1-b3ba-46b4-82a2-594c73c93eff","resolution":{"observed_at":"2026-08-06T15:48:29.139488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:42.145825Z","title":"Feddg: Federated domain generalization on medical image segmentation via episodic learning in continuous fre- quency space","venue":null,"work_id":"e45a2fdd-9a28-43e4-bffd-fb2d65d7107b","year":2021},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.274536Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:7fa75dce9f2f957d46b8ef30ca7442a9b1e29bdb08fefda0dd1b762d8f44d36e","observation_id":"1c7a639d-2e41-4ca0-b4a7-ed46348417e7","resolution":{"observed_at":"2026-08-06T15:48:42.266176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:29.435332Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.435332Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:e52a5a01558ed5e98cd89a70a85993239c414d858ff018a59d45376dc09caef6","observation_id":"a53e4ee0-723a-424f-9877-952fddd56894","resolution":{"observed_at":"2026-08-06T15:48:29.435332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-06T15:48:29.595479Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.595479Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:ae4cf282e75d911e3c86c8a1bebf632559384dc67907b6e3cc66b38f1bf3157c","observation_id":"3d48944d-23b5-4973-ace7-88db099cecdf","resolution":{"observed_at":"2026-08-06T15:48:29.595479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:41.815153Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":"eaae8196-b5ca-491d-b46d-ee401e1f0ddc","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.699219Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:8858b572d8eae7273065d558031fd1ba0e6626839b292461004e7e86dd2a69a8","observation_id":"604260d1-9db9-4e96-9617-9735f183c9ad","resolution":{"observed_at":"2026-08-06T15:48:41.956515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:41.568053Z","title":"Two at once: Enhancing learning and generalization capacities via ibn-net","venue":null,"work_id":"2bd9ddae-8fa5-4f72-a467-3064a850e3c0","year":2018},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.830914Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:e0827acd8f6bc9211467148f662f160ef3014a77e3ef92eceb4e7b87dec65e42","observation_id":"a19c92f6-8dc0-4a89-b56e-f1530b4f90c6","resolution":{"observed_at":"2026-08-06T15:48:41.672767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02337","last_updated":"2022-09-13T17:45:36Z","snapshot_observed_at":"2026-07-06T13:38:33.063832Z","submitted_at":"2022-08-03T20:47:11Z","title":"Estimating Visual Information From Audio Through Manifold Learning","version":2},"cited_work":{"arxiv_id":"2208.02337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.02337","snapshot_observed_at":"2026-08-06T15:48:34.639077Z","title":"Estimating Visual Information From Audio Through Manifold Learning","venue":"cs.CV","work_id":"7fb13290-71cb-4ce4-83f6-223f1e0b1043","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:29.953749Z"},"links":{"cited_paper":"/paper/2208.02337","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:b79be9992ecc926b05a4b47366996e29cba8690426f291f6a6bcf4d0167267e0","observation_id":"0a5add89-0bdf-4104-b171-e11c1a236067","resolution":{"observed_at":"2026-08-06T15:48:34.769435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:41.360271Z","title":"Audio-visual speech recognition with a hybrid ctc/attention architecture","venue":null,"work_id":"6e3e3037-ab85-48b9-b3f7-6cd5fc5bd455","year":2018},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.116086Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:2d7bdd9ad0f755618807f5dc9199a294614f58c3688286db81362bbd1d478226","observation_id":"b771fb0b-8b4f-4812-8c64-7d035d63b104","resolution":{"observed_at":"2026-08-06T15:48:41.464962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:41.104283Z","title":"Domain generalization through audio- visual relative norm alignment in first person action recog- nition","venue":null,"work_id":"2b3659f2-9ec1-4307-a84e-83641c8b24a6","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.254045Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:68563d94f3f0fc97c65d3ee6504eec7cf4b315951633d821eaa98f4815e9e8bf","observation_id":"0a61c64f-76dc-42b1-930c-c750e10ea19f","resolution":{"observed_at":"2026-08-06T15:48:41.216157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:30.385147Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.385147Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:8b1346af9982ee8e1ef4f778a39f34a4aba49145062d2656c3022bde90cd780e","observation_id":"eb751c58-b667-4e10-8fff-866a3022576c","resolution":{"observed_at":"2026-08-06T15:48:30.385147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:40.846574Z","title":"Mask2anomaly: Mask transformer for uni- versal open-set segmentation","venue":null,"work_id":"0e855279-a1ea-4469-a362-04f59c39b6cf","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.518039Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:8445c79b799c72438b81decb7a69c7a4104e59f0e5c0f7b0f4e451c82718d2b2","observation_id":"0f742929-52d9-43e4-a3c9-5c0dc224b5e2","resolution":{"observed_at":"2026-08-06T15:48:40.949706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13929","last_updated":"2023-12-24T10:18:13Z","snapshot_observed_at":"2026-08-06T00:15:33.528521Z","submitted_at":"2022-11-25T06:51:35Z","title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","version":5},"cited_work":{"arxiv_id":"2211.13929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.13929","snapshot_observed_at":"2026-08-06T15:48:34.412193Z","title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","venue":"cs.CV","work_id":"58ac7830-c2f1-4c78-81fb-6656e60cf760","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.648250Z"},"links":{"cited_paper":"/paper/2211.13929","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:3be6456660c15b2dd52954bfe382af2f91d4630a64ea50ead21f82bd7840b0b1","observation_id":"62bdf01a-5e88-4d31-b262-8bf4980429fa","resolution":{"observed_at":"2026-08-06T15:48:34.487611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:40.531653Z","title":"Open domain generalization with domain- augmented meta-learning","venue":null,"work_id":"e2490b9e-8acc-4c43-a6a5-ab4ea4d317d9","year":2021},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.804084Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:13f699daca8e19b443bad7df218977ced06e573e874030a9d861982542494dd1","observation_id":"24c727c0-79b1-4434-95d5-26697d9abdf6","resolution":{"observed_at":"2026-08-06T15:48:40.701072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T15:48:30.917220Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:30.917220Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:0e8bb2ccf10ed19e1611d67250be1599f4508cd18e7cd9544755a2e4547173b5","observation_id":"7281a904-b633-496b-bf6b-43836baae6e1","resolution":{"observed_at":"2026-08-06T15:48:30.917220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:40.276540Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"28ec7589-6e80-4581-aca9-e9bdcc506396","year":2018},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.035641Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:23cdad8da853e4ad258780ced62c435cf03d06bc08c746aaaa0a4d167fda1e8a","observation_id":"ef32786e-a737-49b6-8428-03a2dcfd6dff","resolution":{"observed_at":"2026-08-06T15:48:40.399365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:40.052579Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"92d3b0af-eaa4-4a82-8686-769d93e12783","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.148002Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:ea41f43456d4a3c5f2cd11ccf1e366d8b3b8ad9add8723a4e3830bc2b0caa3dc","observation_id":"9651d3e8-bc5d-4b0a-bc27-b1d713ae757f","resolution":{"observed_at":"2026-08-06T15:48:40.163541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:39.814185Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":"6464db8e-4cce-4bb7-91f9-e1df8389317d","year":2017},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.310142Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:44a0e209dfe7b1c4ae000b1487eda243841e1a49ed855c0c2d5848d11c2bee3d","observation_id":"5de95d9f-85c0-426e-9575-b89836e6821f","resolution":{"observed_at":"2026-08-06T15:48:39.944179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3474","last_updated":"2014-12-10T21:20:54Z","snapshot_observed_at":"2026-07-06T04:03:12.627088Z","submitted_at":"2014-12-10T21:20:54Z","title":"Deep Domain Confusion: Maximizing for Domain Invariance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3474","snapshot_observed_at":"2026-08-06T15:48:31.427887Z","title":"Deep domain confusion: Maximizing for domain invariance","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.427887Z"},"links":{"cited_paper":"/paper/1412.3474","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:2c3bed6d87aeefb61350f7100115c1c2d522434e54f1845255965672aa231fa4","observation_id":"ec0d5cd5-d07d-4e68-a099-f64740d5f903","resolution":{"observed_at":"2026-08-06T15:48:31.427887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24406","last_updated":"2025-05-30T09:45:41Z","snapshot_observed_at":"2026-07-06T21:33:36.129612Z","submitted_at":"2025-05-30T09:45:41Z","title":"IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24406","snapshot_observed_at":"2026-08-06T15:48:31.574133Z","title":"Irbridge: Solving image restoration bridge with pre-trained generative diffusion mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.574133Z"},"links":{"cited_paper":"/paper/2505.24406","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:45c346f11cd13054957d189a67f5f924b439ac7284e4836bcd546d827bb87552","observation_id":"4f23e8e0-ffe8-4fd5-b1ec-ea7f4cc4fc3e","resolution":{"observed_at":"2026-08-06T15:48:31.574133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17675","last_updated":"2025-03-22T07:03:57Z","snapshot_observed_at":"2026-07-06T20:57:02.587855Z","submitted_at":"2025-03-22T07:03:57Z","title":"Towards Transformer-Based Aligned Generation with Self-Coherence Guidance","version":1},"cited_work":{"arxiv_id":"2503.17675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17675","snapshot_observed_at":"2026-08-06T15:48:34.135202Z","title":"Towards Transformer-Based Aligned Generation with Self-Coherence Guidance","venue":"cs.CV","work_id":"b1c97c0f-7f33-46b1-aca2-226ff4d6d7f6","year":2025},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.694527Z"},"links":{"cited_paper":"/paper/2503.17675","citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:f232d64703034120d6555452e79286842b028f422a4cf5bd80a1bdc1c1d861ef","observation_id":"02e59edd-c139-4d7d-a293-980bf430387a","resolution":{"observed_at":"2026-08-06T15:48:34.215630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:39.593847Z","title":"Vlmixer: Unpaired vision-language pre-training via cross-modal cutmix","venue":null,"work_id":"97ff53ea-f65a-41a0-bb67-ca56db59a5cc","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.802571Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:1049be7f3f762b030537b66f2b27a5a49a818744a2eaaccc90dd7fccebe28cd9","observation_id":"449e3041-9ccf-43fd-b742-3b06a1d220cb","resolution":{"observed_at":"2026-08-06T15:48:39.699412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:39.291505Z","title":"General- izable decision boundaries: Dualistic meta-learning for open set domain generalization","venue":null,"work_id":"7f0963c8-9be8-4564-810f-2afe38ae9744","year":2023},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.971663Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:a458f6fb6a185656ce13e38851baf5fd375491f8510e5d2e1ef80dca41ce6df0","observation_id":"4d17012a-086b-478e-98a8-7edd453a268c","resolution":{"observed_at":"2026-08-06T15:48:39.416582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:39.028346Z","title":"Achiev- ing cross modal generalization with multimodal unified rep- resentation","venue":null,"work_id":"9781ecd4-edab-43a6-ad24-90ae5642039f","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.142674Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:a11c10b3a9f7b7ebe454a4af6269ea7c7406a521d6d5b4e9dc0f878b06926d6e","observation_id":"820ec6f5-c22a-461a-9ce0-6d02045a981c","resolution":{"observed_at":"2026-08-06T15:48:39.140480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:38.813266Z","title":"Hyper- spectral image classification based on unsupervised hetero- geneous domain adaptation cyclegan","venue":null,"work_id":"499350de-efdf-4ad4-a46d-6c5ba3d01241","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.246628Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:abe348b90a50c369883cf988932d7b042a93a51a74c80da7d3bf95b86e09291e","observation_id":"19e3608f-e6cf-420e-aaaa-a654c73fda0a","resolution":{"observed_at":"2026-08-06T15:48:38.914667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:38.567442Z","title":"Class semantics modulation for open-set in- stance segmentation","venue":null,"work_id":"e0fcab85-6891-4a4e-8b9c-4882bb768984","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.352440Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:700a81ad9643edadab30554e65f766a958170c2fc45ba35c0d8d5815ff977952","observation_id":"5d2da7bd-d3ac-45e0-a4d3-cf220f061a64","resolution":{"observed_at":"2026-08-06T15:48:38.668841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:38.332181Z","title":"Learn- ing domain-invariant and discriminative features for homo- geneous unsupervised domain adaptation","venue":null,"work_id":"abc392dc-f3e0-4c6c-b830-45ddb4aeb66c","year":2020},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.477375Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:fdbda9ce6a01d85b2109ccb0b4aa2e2a8cb712608f0d88011bf71810719b8d15","observation_id":"0c7c5007-6929-411b-8fac-ce29d6d3443e","resolution":{"observed_at":"2026-08-06T15:48:38.436124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:38.047512Z","title":"A du- ality based approach for realtime tv-l 1 optical flow","venue":null,"work_id":"14e3d218-ee76-4c7b-af50-e25c75705cba","year":2007},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.607661Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:e8a102f1f481e28297ac6bcb4232aed8d572a7bf1d84da86db235d49c681f00b","observation_id":"c55857b4-5572-411e-8a7d-b081986d96b4","resolution":{"observed_at":"2026-08-06T15:48:38.192212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:37.822037Z","title":"mixup: Beyond empirical risk management","venue":null,"work_id":"34b6334b-6562-4410-a544-d783b3ffbf4e","year":2018},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.769497Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:6cc4f5f49223e560d36c41139d9484c9493f5186a6df3f688690bd3a11af7044","observation_id":"7f10b910-2872-4c0b-8b06-b8d5b1dc0448","resolution":{"observed_at":"2026-08-06T15:48:37.927785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:37.588073Z","title":"Extending multi-modal contrastive rep- resentations","venue":null,"work_id":"8425d193-9fcd-426b-ad51-45c4e64e6590","year":2024},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:32.872091Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:0146a4bc8a993ffc99f3002958ce4f6f6417ed4298df7d539aaaecd56c26db09","observation_id":"78b6b8c4-a9aa-4cd1-91a4-8751551b2670","resolution":{"observed_at":"2026-08-06T15:48:37.701085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:37.339769Z","title":"Towards effective multi-modal interchanges in zero-resource sounding object localization","venue":null,"work_id":"68fd717c-bfd9-4f71-acd0-6ef579340a8b","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.001801Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:8bb1a356753602b9d2cab8d381be98c7168d005a26a5864a5f48bb0072c0c3ea","observation_id":"92ae4c94-4bfa-47f6-af31-dc2573259f2d","resolution":{"observed_at":"2026-08-06T15:48:37.459916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:37.091333Z","title":"Positive sample propagation along the audio- visual event line","venue":null,"work_id":"a3001644-95e4-405e-8714-70c726da2b31","year":2021},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.180736Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:07cee9878a1945e0065d68c0d6bd6ece974003cc9372897e7f22c43d3b102a1b","observation_id":"55de53c6-1ece-419d-9a92-e46d4b6bf367","resolution":{"observed_at":"2026-08-06T15:48:37.179781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:36.808629Z","title":"Contrastive pos- itive sample propagation along the audio-visual event line","venue":null,"work_id":"75fd4f94-95a2-42c1-a872-adaec974b9cf","year":2022},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.294913Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:4bc2c2c8ffc9f76fc647e8e1b8a12178bd4bc59a1310af504fcc47897212084b","observation_id":"97ddbd13-ffc0-4fa6-b81a-5493df3479fa","resolution":{"observed_at":"2026-08-06T15:48:36.975633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:36.565930Z","title":"As shown in Figure 4, applying the same mask to paired multimodal samples helps improve model perfor- mance","venue":null,"work_id":"b391b064-72e8-414e-8463-1fbd7120e7a5","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.446319Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:0db36130526cef6976ec0ae4c0158255ef406bd2a4d8449f57448fecf79b476c","observation_id":"9e964db3-0843-4c9d-8e06-6d5cebaacee9","resolution":{"observed_at":"2026-08-06T15:48:36.711555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:36.320385Z","title":"As shown in Figure 5, we experimented with five different settings: 256, 400, 512, 800, and 1024","venue":null,"work_id":"c3ccfd89-6873-4d47-bcaa-86cf907217fa","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.590702Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:280c95e15639e93af936d5f960c8457854c0d35b293c016c7f43e9dc9f26e643","observation_id":"ea7d8129-f526-46f0-a843-fcf27af389a9","resolution":{"observed_at":"2026-08-06T15:48:36.441196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:36.073817Z","title":"Lcoarse serves as the foundation of the model, while Lf ine and Lcujp further refine the unified representation space and enhance the model’s open-domain detection capabilities","venue":null,"work_id":"f27ea03c-addb-4fbf-9682-eb1b6bd7dee0","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.713818Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:970d99d8aee70727fe788c9d13ef625321f9dcf862ed609ef21ff1df464c45fe","observation_id":"de07682c-87f8-4353-a6c1-e34fea5fdacb","resolution":{"observed_at":"2026-08-06T15:48:36.199359Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:35.811481Z","title":"CUJP8, despite having more split block reorder- ing, optimizes memory usage and reduces training time compared to MMJP6 [14]","venue":null,"work_id":"306ac833-8956-4a6c-88ad-1b1a0b377578","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.844344Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:be64a5c907ce63afbd5e698e36d58f2b384d8cc0001dadfa241ae65ca37bfe3b","observation_id":"0ed9da58-6fc8-4401-ab6b-a4ca137ccec8","resolution":{"observed_at":"2026-08-06T15:48:35.956451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:35.530038Z","title":"The visualization maps audio-video-text triplets from the Valor32K dataset [7] into the unified rep- resentation space (codebook)","venue":null,"work_id":"e650563b-55b9-4063-95fd-86f38518bf82","year":null},"citing_paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.963779Z"},"links":{"citing_paper":"/paper/2507.14935"},"observation_digest":"sha256:08249d055c048832d451126d9ae752878747ff153acd3c7819ad7cd23a2a9761","observation_id":"4d271cca-30a9-434f-9f9a-a9835f3a91a5","resolution":{"observed_at":"2026-08-06T15:48:35.616927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14935","last_updated":"2025-07-20T12:09:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:42:01.645218Z","submitted_at":"2025-07-20T12:09:19Z","title":"Open-set Cross Modal Generalization via Multimodal Unified Representation"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":5,"verified_fuzzy":45},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2507.14935."}