{"as_of":"2026-08-08T16:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec7e2396b68d4bd69b677b773dc87f032c0488b0192c7e26c04c8563d731d9e5","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:39:37.920953Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.11602/citation-record","integrity":"/paper/2606.11602/integrity","json":"/paper/2606.11602/citation-record.json","paper":"/paper/2606.11602"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Look, listen, and attend: Co-attention network for self-supervised audio-visual representa- tion learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:abe6a28cb0ab9b0ba3b5082ad592b3dda9dde6412dadf35e697f3d0294549c61","observation_id":"407f5517-65c5-49dc-9f2c-0ecbacd8af5f","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Self- supervised object detection from audio-visual correspondence,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:ed132b62367fd75939c94330497d05cc2c5769043fb32b0a1c176980080c9d52","observation_id":"427b5d01-357a-46bc-9155-2cea6392bb8c","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Detection of audio-video synchronization errors via event detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:776c6da5fcd917a7480b982a454c7700a56e42e940b8968419f5d2423dc69fdd","observation_id":"7705b846-6f68-461e-8303-2d18d069dbd6","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-07-06T08:52:26.716343Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":"2001.08740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-07-03T08:57:47.660611Z","title":"Audiovisual slowfast networks for video recognition.arXiv preprint arXiv:2001.08740","venue":null,"work_id":"3617874f-d8ea-40ca-9b94-f4150287b9f4","year":2001},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:59464d96b93ad8f773309f7fa8eb5037b8ee01c57cd5dc6b7af9470990557777","observation_id":"8a8885ba-b003-423e-a10c-cc72a3821ff8","resolution":{"observed_at":"2026-07-03T08:57:47.661964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Text-to-feature diffusion for audio-visual few-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:e5917c3c9d60166ee94fef4571373f2dcc53cfa837e7db20158f48912f749829","observation_id":"d06aa5fc-5c46-4c6a-818b-64f8fad912a4","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Advancing weakly- supervised audio-visual video parsing via segment-wise pseudo label- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:c06d0f10a5ba4dbd279f79929b8d4ef6616d83357e0c6ed68a399b5bced482ef","observation_id":"54404212-e78c-4650-b4f9-5933a0f61669","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Aloha: Adapting local spatio-temporal context to enhance the audio-visual semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:630077e795ab25b6dce2af7787a93628f42cd83fc6c629f71152ba2ccc726b30","observation_id":"5153b275-6677-40c3-a6cb-48ccbd299d6a","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio-visual event localization with cross co-attention and dynamic audio-object semantic alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:8fbf8d4fc621a51906ed210cc6fb42b1f963caaabf09aa59cfc0d70d455cafc6","observation_id":"7d3c7e45-ce3d-4c2c-938d-a7f0aed9b531","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"X-sta: Cross-modal spatial-temporal alignment network for unified audio-visual segmenta- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:18bff5884c3560f225e8115a0f9f1687c2211234b26ee07af2678fd936bb2b91","observation_id":"2959b878-b23b-4c2f-8b06-ca6442f5a6cf","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Coordinated joint multimodal embeddings for generalized audio-visual zero-shot classifi- cation and retrieval of videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:d8e1c147c4919c454f45b9ec1dd4d9fe8cf6fc69f91f42261bcdde0cca6788a3","observation_id":"fe56af1e-d90c-4690-b982-ded29839d47e","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Avgzslnet: Audio-visual generalized zero-shot learning by reconstructing label fea- tures from multi-modal embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:e7a930b090f2bb673aeb494ae534dfb0c4df4b377a7bca9254522c1afc0f8f7a","observation_id":"8b59b25f-814a-4d8c-8653-d6283f5eacd5","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio-visual generalised zero-shot learning with cross-modal attention and language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:2de7a0e61e071a557b8c91c06404b98a8067e36144474010431b672dc0ec2946","observation_id":"16a33141-9b62-4e3b-92f1-47baa334d382","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Temporal and cross-modal attention for audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:c131a9cf34bf8f8e1d3e5892cd464bc49e23ac4c29d6177b81674d073bd5b35f","observation_id":"5a0dd993-46ba-4cd9-9439-0e3d68b41b26","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Hyperbolic audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:cdf95747d08176bdd123f66b93d5547d8827e82145ed1c00216e5dec88e20da3","observation_id":"1d9a12c0-d7d0-48e7-8569-fd45e1995514","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Motion- decoupled spiking transformer for audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:d6b2feb64f219329b5ed4d62d2a1673b789f2820f5317c47d40cc72ba288375f","observation_id":"0fd3846c-9034-4dba-b5f0-500a7bb01383","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"A generative approach to audio- visual generalized zero-shot learning: Combining contrastive and dis- criminative techniques,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:1e84255654da9356e52d2c5557d09b0bae4bb381f7120f9aac81d1ae917d8cca","observation_id":"3da2b60a-7be1-4598-bb26-53eee3b2f6c1","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Spiking tucker fusion trans- former for audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:ee96d7ec58ec89a319fe90d0d04eab1587390f4d6dd12645b8c8df06455efb6b","observation_id":"70b2dc0a-9254-43b3-89da-0204dc39aa1d","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio- visual generalized zero-shot learning using pre-trained large multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:8a5ad068a84d3bda03db0ccee0ab9d2a8989b1a23cb2cac48521cea1f23ffeb4","observation_id":"f343b011-37cc-45a4-b789-b76f70a541bc","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio-visual generalized zero-shot learning the easy way,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:3d576a09c44626c32ed2e937c5cd55cd8ddbcd9742db369f05edaf64f4df3648","observation_id":"3b6ef146-2b3f-4e39-8d5c-9265421c2bb5","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Discrepancy-aware attention network for enhanced audio-visual generalized zero-shot learn- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:1e88cdc4d732afc8a6651bbb61e601639c8adb0ecff600cbe55119419494ddf8","observation_id":"58a3d039-e239-4f10-8228-e408eb613dc7","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Fusion-regularized alignment modality-adaptive audio-visual network for audio-visual zero- shot learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:64c1686bb3ba18c2fb1efb7a1cac9fa9b644680d983571412d4916fab0b2477e","observation_id":"b1f66517-45b1-4e3a-b415-0024d349a36d","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Z-score normalization, hubness, and few-shot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:dc2d2e84e32dca1ffc02df7d138969da40e8fd90f7363756244c69d760e1afd3","observation_id":"f50ba71e-18b2-47c4-8a6b-5c24760609e0","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:2d6b136e7461dac11a2322d64bb2e7f7ef1666321ac54488e181f42790b16b6b","observation_id":"b1d40317-1968-4647-b5f6-d577c1b754b8","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:ea7608bf9e3192f461940cc5b83ce33b3008061352de12c3daa9ca8bffc176d2","observation_id":"05d828a6-f434-4c1c-8347-61637631926e","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Tackling uncertain correspondences for multi-modal entity alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:82b3967c82777f27c0161e169f794409ffe422004ea4b573ac9446f57dcef880","observation_id":"4d8135ae-73c5-4da3-84e0-ad35475fea95","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Unialign: Scaling multimodal alignment within one unified model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:4755de7e212bd48ea95a870f8125d8d48f0e663ffb79d5b04952a292233abbc8","observation_id":"22b77b5c-c76d-4c97-85a9-c2d1d97125c5","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Relational knowledge distilla- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:6bdd16f4b38ed8131067658eedb113c6a65984845876627f37df98395ab662b5","observation_id":"a6312b14-7efb-4631-9251-229ff764654a","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11017","last_updated":"2024-12-17T16:27:21Z","snapshot_observed_at":"2026-08-08T11:22:21.612738Z","submitted_at":"2024-12-15T02:10:18Z","title":"On Distilling the Displacement Knowledge for Few-Shot Class-Incremental Learning","version":2},"cited_work":{"arxiv_id":"2412.11017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11017","snapshot_observed_at":"2026-07-03T08:57:47.662538Z","title":"On distilling the displacement knowledge for few-shot class-incremental learning,","venue":null,"work_id":"fa607e4d-ac95-4563-988a-fb52fe0e3dec","year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"cited_paper":"/paper/2412.11017","citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:3151ce6bd963c78cf7651f75d47335ab9ddb610c46d396bfaf91032f2bded600","observation_id":"f54605b0-cedf-401e-ba73-e45c41f2ca84","resolution":{"observed_at":"2026-07-03T08:57:47.664025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22197","last_updated":"2025-03-28T07:28:56Z","snapshot_observed_at":"2026-08-07T16:30:55.163729Z","submitted_at":"2025-03-28T07:28:56Z","title":"Extremely Simple Out-of-distribution Detection for Audio-visual Generalized Zero-shot Learning","version":1},"cited_work":{"arxiv_id":"2503.22197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.22197","snapshot_observed_at":"2026-07-03T08:57:47.659947Z","title":"Extremely simple out-of- distribution detection for audio-visual generalized zero-shot learning,","venue":null,"work_id":"77ad0038-3d0e-436c-8f3a-a85acddc4f9c","year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"cited_paper":"/paper/2503.22197","citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:33cc090997510577fb35c515ab7e8c9f9d69ce270710a70efa151f1ad0340c20","observation_id":"8ad004f7-4a2a-40d2-beff-f16e962c6e0c","resolution":{"observed_at":"2026-07-03T08:57:47.661468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2606.11602."}