{"as_of":"2026-08-19T16:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:146a205e739a7b27e0fb401cf13902af239f013cde5d8bec4107b4b5357d087e","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:09.912975Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19938/citation-record","integrity":"/paper/2505.19938/integrity","json":"/paper/2505.19938/citation-record.json","paper":"/paper/2505.19938"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.540625Z","title":"Contrastive masked autoencoders are stronger vision learn- ers,","venue":null,"work_id":"b4a8696f-35e3-41bf-8f67-6ccfc6587d01","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.568706Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:436520cd9121489fda906e792f4b110599dee9d4493ab5b9874c7c889a318ae2","observation_id":"56943cd2-bb7d-40db-8ce6-ad0560ce3393","resolution":{"observed_at":"2026-08-07T14:09:24.663955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.322233Z","title":"Pyramid constrained self-attention network for fast video salient object detection,","venue":null,"work_id":"da3250ee-5404-49d8-8c55-285665f2844c","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.651719Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:9281d77dcdc98b63e6e5c34f7ed6ac6a81b813965bfa0228cffa9c5d125e2499","observation_id":"2b640d07-4292-42d4-ace2-7d59051f7b50","resolution":{"observed_at":"2026-08-07T14:09:24.434976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.088658Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval?","venue":null,"work_id":"f2efb55f-a431-4805-9cd6-2771bf8fe189","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.737481Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:584d5361855988928ad003195db6ed921fb73c8b67b9b06baa639d719e331e4f","observation_id":"8ef2a54b-4207-4fd3-88b8-a0049b3c53d4","resolution":{"observed_at":"2026-08-07T14:09:24.199773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.840323Z","title":"Isomer: Isomerous transformer for zero-shot video object segmentation,","venue":null,"work_id":"d82ddf7d-c31c-4214-863c-ff475e5007ae","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.827885Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:1f0deaab4be6e77c385bf6758c7272dd417b828f1f59924962138fece897b7c3","observation_id":"81e4713e-a90c-4f92-9e21-5d16d6c5f391","resolution":{"observed_at":"2026-08-07T14:09:23.939461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.582861Z","title":"Avgzslnet: Audio-visual generalized zero-shot learning by reconstructing label fea- tures from multi-modal embeddings,","venue":null,"work_id":"45401756-adec-43b7-b33c-3b3896e70b93","year":2021},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.895004Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:49d5478364b7bc8cad1ad1acc90327d9fa17452ac1197ce68b4bc2950b12fa91","observation_id":"9774c393-8a97-4a22-bcca-4e2128547b1e","resolution":{"observed_at":"2026-08-07T14:09:23.716658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.435136Z","title":"Audio-visual generalised zero-shot learning with cross-modal attention and language,","venue":null,"work_id":"a1997aac-26b3-4d9b-9b13-3e0906b0ad8d","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:01.947941Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:9f3cfb830003d4c219859cc5781188f59b539c1e77103ba44292cc89a176abd7","observation_id":"96dfe273-d3b7-44f3-b65f-168020578767","resolution":{"observed_at":"2026-08-07T14:09:23.495744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.236054Z","title":"Temporal and cross-modal attention for audio-visual zero-shot learning,","venue":null,"work_id":"922b160d-8706-4a06-ae33-bf35993d008d","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.034750Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:e7abd3c92167f2b0bf637d77967e680093ce645ce060a75c9f2bb6de3a2472c7","observation_id":"5374bc77-da0d-4a67-99d4-261c17547950","resolution":{"observed_at":"2026-08-07T14:09:23.327195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.029494Z","title":"Enhancing unsupervised video representation learning by decoupling the scene and the motion,","venue":null,"work_id":"e711db84-39fb-4392-b8da-74fdb033b959","year":2021},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.099314Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:13bcab25f8ddc219f9bc248a75080f4b411e8b35583e568ef40b0302bd802acc","observation_id":"72eadc1a-7ed2-45af-b8bf-4ac01f2ebc22","resolution":{"observed_at":"2026-08-07T14:09:23.141166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.794361Z","title":"Spiking tucker fusion trans- former for audio-visual zero-shot learning,","venue":null,"work_id":"422b5e72-0932-472c-94da-1d879c65517f","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.171589Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:855665dcd704a49d328f90fb25252183ca140747416a8ab3a5f53b0b4e531b51","observation_id":"d294de1c-d33d-434d-8345-dfd0b1d232df","resolution":{"observed_at":"2026-08-07T14:09:22.897923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.598547Z","title":"Motion- decoupled spiking transformer for audio-visual zero-shot learning,","venue":null,"work_id":"67f7f3f9-3710-4476-b0b5-1a56295dfe0c","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.280202Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:55e83bb44a57be05ea1c1f8740af0c67927b94ca17116c7f54f9e57c127f8bd7","observation_id":"d22828d8-7513-4d2c-9f2f-ea4dd1827329","resolution":{"observed_at":"2026-08-07T14:09:22.698806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.367463Z","title":"Conv2former: A simple transformer-style convnet for visual recognition,","venue":null,"work_id":"fb19ab02-d19a-4342-a4f9-5e398a24853b","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.344994Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:41a114a0581e79ef4a71fd9aa3a32687c1bc866ced079821c496651b84fb3735","observation_id":"cd4268d7-8fc9-4232-b1dc-3848f2550c48","resolution":{"observed_at":"2026-08-07T14:09:22.478377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.131321Z","title":"Bidi- rectional cross-modal knowledge exploration for video recognition with pre-trained vision-language models,","venue":null,"work_id":"a5076edb-e5df-4a3b-8ab2-12ea5a5552b4","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.452965Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:f1abd27ced40a6419a6a7968c77a5aeb544cbf2712256209cb5b045caa97eb12","observation_id":"8d4b895f-2d50-49f8-8933-91b75b429e17","resolution":{"observed_at":"2026-08-07T14:09:22.246538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.914430Z","title":"Box2mask: Box-supervised instance segmentation via level-set evolution,","venue":null,"work_id":"a476c1e6-8522-4224-b3b3-a15b9e30ae99","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.565696Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:ae82eb1be41272fe30f67a3994480b28ebac353944db30120f1c3782c94c50e3","observation_id":"152c6262-d221-4388-88d4-ec2ce45aa4ef","resolution":{"observed_at":"2026-08-07T14:09:22.011981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.695713Z","title":"The devil is in the crack orientation: A new perspective for crack detection,","venue":null,"work_id":"331483c9-5bda-4dca-a2ac-ab925845a46e","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.614753Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:1d501f5493888c507a680b20599d3b9e7441da608815a67e0a3618325fbf1fde","observation_id":"bc6f5344-5385-4392-8b9c-c5f25606c707","resolution":{"observed_at":"2026-08-07T14:09:21.768417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.448937Z","title":"Offline and online optical flow enhancement for deep video compression,","venue":null,"work_id":"6ea89e7b-3798-4da0-a895-cdee9ac21490","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.713981Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:b7e8718bd9230c9b8aa2ff7a347b0a71ec4220e45c530caca519a201e33ef96b","observation_id":"9c838a6c-1fa3-437c-b871-9888bd701059","resolution":{"observed_at":"2026-08-07T14:09:21.562105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.310771Z","title":"Ustc-td: A test dataset and benchmark for image and video coding in 2020s,","venue":null,"work_id":"9a43e47f-0dcc-476e-9a8d-35fc9832ded5","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.799059Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:216b3756ba6ecb60f2e1cd5fcafafa7f24c0653840665b16e71d42ce257e200a","observation_id":"e0d569d4-dc6e-496f-90bf-fb5eca6c6ede","resolution":{"observed_at":"2026-08-07T14:09:21.383618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.028794Z","title":"Object segmentation- assisted inter prediction for versatile video coding,","venue":null,"work_id":"cadef676-adf9-400c-9116-e34b33551591","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:02.886398Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:6b6326affb6cec987874b8fd1c8618fe25aec8cb4b03319a04348b8eb8d8e761","observation_id":"9a8775c8-91b0-4118-b3b2-a4ddc6f22524","resolution":{"observed_at":"2026-08-07T14:09:21.214751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.779701Z","title":"Geometry-aware guided loss for deep crack recognition,","venue":null,"work_id":"b01e1cf6-b5cf-4e19-8c2a-0dab18e9a11a","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.005736Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:fc4a677c1d5fd9d35343bb36fa6b7ecb3b6fa2a12c69253092c615287fce5356","observation_id":"bc236cc0-2058-43a1-a884-2c063075f2b1","resolution":{"observed_at":"2026-08-07T14:09:20.894270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.562673Z","title":"Latent embedding feedback and discriminative features for zero-shot classifi- cation,","venue":null,"work_id":"e69d99a7-d14e-437a-97d6-cfd432c098cf","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.178906Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:8d3a357b15f1352e2740f3422ed02472ee87cb6ef943b9df75b4ba56fa7a60f6","observation_id":"335a8d7e-b2a8-4b77-a304-5a584cda06ca","resolution":{"observed_at":"2026-08-07T14:09:20.667962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.333451Z","title":"Gener- alized zero-and few-shot learning via aligned variational autoencoders,","venue":null,"work_id":"4e8217f8-99b9-4db4-ad0b-1a14b6208663","year":2019},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.261550Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:8ee3deeaa125ab738cdd5631b411edfcb82cb47334050937c101a632eeadf1f1","observation_id":"aeac26fd-b60c-43a0-85e7-f85d70e3ffdf","resolution":{"observed_at":"2026-08-07T14:09:20.422107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.181546Z","title":"Generalized zero- shot learning via synthesized examples,","venue":null,"work_id":"b46fb2ea-33d9-40de-8bec-e1d5bc355009","year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.347665Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:31bfeaf18669dc81f70c2f79e6714faa92c91ca4a57c5701ac381442ca242bbb","observation_id":"4890ef3a-e3fc-492f-a6f5-431316bf26d1","resolution":{"observed_at":"2026-08-07T14:09:20.273737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.969228Z","title":"Feature generating networks for zero-shot learning,","venue":null,"work_id":"bbb50639-73d2-486e-bfb3-b09addaa9b67","year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.436163Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:4a244a7eef0ba024f587be6c3e718557e93922d01414d2cef843002169d9869e","observation_id":"fa02b7cb-7af7-4bb7-a696-d85af6a46754","resolution":{"observed_at":"2026-08-07T14:09:20.056647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.671954Z","title":"A gener- ative adversarial approach for zero-shot learning from noisy texts,","venue":null,"work_id":"c0d28b81-91b4-4a3e-be2c-f3de5e7ebd84","year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.656519Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:576ca7a15c39d50747c47511d42867a511d6be777c90d5328f3c1db2446afdde","observation_id":"96beda2a-9a91-4ed1-a624-f49bfb6cec95","resolution":{"observed_at":"2026-08-07T14:09:19.795041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.406773Z","title":"Bootstrapping audio-visual video segmentation by strengthening audio cues,","venue":null,"work_id":"80ab2942-2cc2-41b9-ad48-ef97575026d7","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.748830Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:2ec2b2da18ed8f20a3c063fc21981f1135bf01be60f75c892c268518e2c4a8e7","observation_id":"8eb83658-a615-48bd-863b-b75ee70eff8f","resolution":{"observed_at":"2026-08-07T14:09:19.515338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.196970Z","title":"Learning affective features with a hybrid deep model for audio–visual emotion recognition,","venue":null,"work_id":"4a0549f2-00a5-4fdf-858f-244b10a2a9c3","year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:03.884901Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:95cc7bd2b1ad1e531dc492c5c24e868cdcafc14005337cf40f04ac04a7357f85","observation_id":"32f96bad-46e4-402f-9eb1-b8924ee198ce","resolution":{"observed_at":"2026-08-07T14:09:19.308470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:04.015637Z","title":"Audio-visual temporal forgery de- tection using embedding-level fusion and multi-dimensional contrastive loss,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.015637Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:c5ff6fe48e1fd9e1cdf324ae62fb7968f708124154da1d3e1482f54d05e48cff","observation_id":"e0feff2f-b320-4bc7-8f0e-7ddc95a4d5b4","resolution":{"observed_at":"2026-08-07T14:09:04.015637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.941853Z","title":"Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"4607cd66-11e9-45dd-aca5-6f361420af7c","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.124896Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:579063567e4d88a1c605c4166eaeeebe573cba58fb605d839f2d838c223f4610","observation_id":"5f40ea82-1016-437e-9738-3f96262091e9","resolution":{"observed_at":"2026-08-07T14:09:19.061134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.732945Z","title":"Question-aware global-local video understanding network for audio-visual question answering,","venue":null,"work_id":"2824ba14-e80e-4aa8-a2dc-a4d4b6573c20","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.244947Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:cc0fd1b7f2c240b6f37c66f35a09fa617c18bad53626d354b26ca1019ecdab4d","observation_id":"99c8f7ca-4ecb-45b9-9098-c0024099dac6","resolution":{"observed_at":"2026-08-07T14:09:18.816815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.501936Z","title":"Zero-shot audio classification via semantic embeddings,","venue":null,"work_id":"21a8233c-013b-40ff-9720-b901d1cf06a4","year":2021},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.384768Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:aeda48f5873316500d412ff5bbd9e761df0e568d7acba685e68d0727ce956b03","observation_id":"8598ebb1-6c3c-4604-bb54-bdf61f09a116","resolution":{"observed_at":"2026-08-07T14:09:18.571251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.183054Z","title":"Activitynet: A large-scale video benchmark for human activity under- standing,","venue":null,"work_id":"4a468eb2-12e2-43c7-aa75-6716d87dd674","year":2015},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.517362Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:095b86115505f8bcdd4aff80d563f4fdfe81bbc87704cf8ff132cffb1e3b7734","observation_id":"ca30d387-47f6-4d08-bffd-b47bf6915d08","resolution":{"observed_at":"2026-08-07T14:09:18.328939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:04.655427Z","title":"The multivehicle stereo event camera dataset: An event camera dataset for 3d perception,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.655427Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:b1992ba514505656451ecf25a275c856ba2f673daefe6cc3c6427c4f7a6447e7","observation_id":"b763a99f-a635-4215-876f-5ec52e37bf42","resolution":{"observed_at":"2026-08-07T14:09:04.655427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.910459Z","title":"Events-to-video: Bringing modern computer vision to event cameras,","venue":null,"work_id":"f4dfbde5-245f-4f70-8c97-aa3cca500550","year":2019},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.774982Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:23f67ea5a103ecdf903ac9bb5f759961d509988c575b786ec991ad53ca32ee78","observation_id":"b1d3db10-a6c6-4a30-92b2-24bf19a37cb6","resolution":{"observed_at":"2026-08-07T14:09:18.032441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.598900Z","title":"High speed and high dynamic range video with an event cam- era,","venue":null,"work_id":"f65108c0-9818-48c8-8002-e3e78c11a3e6","year":2021},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:04.914751Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:b61c15e6e6fa7bf58eddeb619c2b69ac498694f5f800768588c59949683446cc","observation_id":"ce3f04ee-9d93-4e6b-b5f4-d1e7d154b55d","resolution":{"observed_at":"2026-08-07T14:09:17.734144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.450650Z","title":"A controlled-delay event camera framework for on-line robotics,","venue":null,"work_id":"8b3b9a8c-e633-4a9c-8a3a-c82f4b8c9f44","year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.065292Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:fb1de9e9cb5d11ac6743a4f264709a2d36feb4d214ee8dd91497538f48e49e2f","observation_id":"168ebb16-0ac6-4d13-b09d-39f8574077ec","resolution":{"observed_at":"2026-08-07T14:09:17.503876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.177996Z","title":"Exploring event camera-based odome- try for planetary robots,","venue":null,"work_id":"7c81a165-fbed-4987-9a91-cee697a9b932","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.199442Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:20bef669859d25b9b18f5d5353568801294283ace443ce987874c66f9be4e510","observation_id":"790bfafb-2384-473b-919f-fa664d7e7f34","resolution":{"observed_at":"2026-08-07T14:09:17.337725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:16.985494Z","title":"Emergent visual sensors for autonomous vehicles,","venue":null,"work_id":"6ee1ee39-d852-4fb8-b740-9cae2c1de01d","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.554856Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:2fa672c702e2985ca9f4eb8c153f53412c4d4fd1bf739a43efe5684b5cd01ab6","observation_id":"2bfae8a2-9561-414e-830a-3820729395b6","resolution":{"observed_at":"2026-08-07T14:09:17.062862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.686946Z","title":"Dsec: A stereo event camera dataset for driving scenarios,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.686946Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:6e14f69115339b2d8e5bdb3cd267447d375dc2ec7a90bbb65046154e95e7b8f4","observation_id":"a201dff8-bc2f-4aa4-9654-00b954b1b25b","resolution":{"observed_at":"2026-08-07T14:09:05.686946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.796504Z","title":"High frame rate video reconstruction based on an event camera,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.796504Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:4ff000f9a7fad3ea184475699de926d9123754c2d8d9904b55b4e34bb1ed81a0","observation_id":"04cb1f09-c62d-4ee6-bed6-1eaab6adbf21","resolution":{"observed_at":"2026-08-07T14:09:05.796504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:16.675067Z","title":"Eventcap: Monocular 3d capture of high-speed human motions using an event camera,","venue":null,"work_id":"b4054d79-b812-4f5d-a724-006cd27ef7be","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.886800Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:f0b7de961410b238e8606c48b2d09ce6cd6d1dccaaaf06a4d1b5b3fd8412b2ed","observation_id":"0abe025d-b50e-45ab-997e-152fb4cffb0b","resolution":{"observed_at":"2026-08-07T14:09:16.829097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:16.430667Z","title":"Towards a framework for end-to-end control of a simulated vehicle with spiking neural networks,","venue":null,"work_id":"9d930385-f512-4c35-9285-016b757d2085","year":2016},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.992309Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:f0f4d2109a8627df9e3cc69ab1d32a46cd613d01cdc83e7c722c48d8e4bc27eb","observation_id":"ca3e4702-39f3-48f1-a5e6-f5a483e1bc4d","resolution":{"observed_at":"2026-08-07T14:09:16.580114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:16.161994Z","title":"Esim: an open event camera simulator,","venue":null,"work_id":"e9774e4f-13b4-4adf-a648-27f4d19d8f8c","year":2018},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.104578Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:8073766278ff6111bd9cdca00093d25e854b4a433efee4762a976f43eb87544d","observation_id":"8ad00811-e3d4-4fd9-9bbe-b2fcd6bb35fd","resolution":{"observed_at":"2026-08-07T14:09:16.297738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:15.943730Z","title":"Deep residual learning in spiking neural networks,","venue":null,"work_id":"1a9bd051-cab4-4a47-af0b-10c44f553676","year":2021},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.254621Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:5a9941810885c7482c4f24e5dbc4de1cf6930cc3aaf310fc18127c3ba6ae5ae7","observation_id":"50984320-2288-4ec0-bdfd-0b7b540096be","resolution":{"observed_at":"2026-08-07T14:09:16.030530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:15.751134Z","title":"Neuron-based spiking transmission and reasoning network for robust image-text retrieval,","venue":null,"work_id":"6efdca7f-c81f-4fc3-a282-83e8d5acc711","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.375431Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:1452a30fb97a0cdd2006e35909ec17af791f4dcf9b3456ba153110218883e749","observation_id":"1908f1e8-a23c-43e1-8215-0962b04c3ad5","resolution":{"observed_at":"2026-08-07T14:09:15.810887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:15.606538Z","title":"Spikemba: Multi-modal spiking saliency mamba for temporal video grounding,","venue":null,"work_id":"1db01be3-0364-4953-8aee-f03b2f10c9bc","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.524922Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:947da2369495d079103be96ae703f138614bca494b49a56174a9364dc8f11246","observation_id":"8ea97e88-dfc0-404d-bb79-fc02000280f3","resolution":{"observed_at":"2026-08-07T14:09:15.659258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15425","last_updated":"2022-11-22T12:45:05Z","snapshot_observed_at":"2026-08-16T19:39:28.061719Z","submitted_at":"2022-09-29T14:16:49Z","title":"Spikformer: When Spiking Neural Network Meets Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15425","snapshot_observed_at":"2026-08-07T14:09:06.676151Z","title":"Spikformer: When spiking neural network meets transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.676151Z"},"links":{"cited_paper":"/paper/2209.15425","citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:92a2f379865d9e1d52cae8e36c1b039a99aae781dd50e8ad89203437657eca28","observation_id":"46043712-dc94-4421-871e-5663e2582dac","resolution":{"observed_at":"2026-08-07T14:09:06.676151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:15.413269Z","title":"Learning optical flow from continuous spike streams,","venue":null,"work_id":"5228c47c-ffbb-48cd-8ff1-d249b6aeffee","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.803713Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:bdc063dab997f237375a5de83f26241edc15c90591c46be2c612393b358be05c","observation_id":"6ba149dc-de50-4140-a96c-a68f0935e6ce","resolution":{"observed_at":"2026-08-07T14:09:15.530931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:15.181294Z","title":"Mrdflow: Unsupervised optical flow estimation network with multi-scale recurrent decoder,","venue":null,"work_id":"083cd739-38c0-46a6-babf-4d9f273bc8e5","year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.924771Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:a20d41dd7b5f209090002210357d98490bf473614393dce459a0ef6cd37134e0","observation_id":"66f12683-fef4-46c6-a877-3248c9c04f75","resolution":{"observed_at":"2026-08-07T14:09:15.259577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.001775Z","title":"Progressive tandem learning for pattern recognition with deep spiking neural networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.001775Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:f6f11bd8f9f6fe08101085573daa3e46dc2887b28a2fc0bd041d02085ff6c1d6","observation_id":"278be33e-297f-4b06-8070-7a744574ee54","resolution":{"observed_at":"2026-08-07T14:09:07.001775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:14.943465Z","title":"A hybrid neural coding approach for pattern recognition with spiking neural networks,","venue":null,"work_id":"109f7d19-2d1b-4192-8e62-aa223f74dff2","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.144661Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:e39488ccaa0f3489d21808e93feb41ccd6dde9fcbc6cd68b5d8f3ebac46eb58b","observation_id":"8fcc8209-16b4-474f-b5b7-d1365f29a074","resolution":{"observed_at":"2026-08-07T14:09:15.059970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:14.662285Z","title":"Neuron-based spiking transmission and reasoning network for robust image-text retrieval,","venue":null,"work_id":"010764b7-b4b9-4090-950c-bafd31b17b68","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.244932Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:3c212a8df3311d9972cd5d820856fb26c330c2a845aa1be7fbb624bd6cc6fb2c","observation_id":"db5e6eba-a867-4b5f-9c9b-9b7ae219c9e0","resolution":{"observed_at":"2026-08-07T14:09:14.787790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:14.370995Z","title":"Multi-scale spiking pyramid wireless communication framework for food recognition,","venue":null,"work_id":"8334f958-e7e7-4fac-9b85-ed64d342ef81","year":2024},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.374851Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:c9b18e0083d8feee5d1e527a047fa8e53b45504d5f51763df75226a9d2ddc5a0","observation_id":"6fd95f30-7122-4b75-a031-d4ac0e3c045b","resolution":{"observed_at":"2026-08-07T14:09:14.550685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:14.206409Z","title":"Modality-fusion spiking transformer network for audio-visual zero-shot learning,","venue":null,"work_id":"bf4dddee-ccc3-4ea8-bfcd-ec5eb47a384f","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.528788Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:3343ccaeb30eec6de1539120bbd2c8b992b87208accf7509d7c887005e046fcc","observation_id":"afecb359-12b1-45c5-a368-c58306b4cdd9","resolution":{"observed_at":"2026-08-07T14:09:14.299387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:14.010853Z","title":"Evolving spiking neural network controllers for autonomous robots,","venue":null,"work_id":"d71db42b-df6e-4f07-b77b-d4d3fe50ed16","year":2004},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.624761Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:d6d20900dffa939393eea309407c1827b349922aac859314d779a9a6d7e9ce90","observation_id":"c347e535-9f45-417b-96d3-32f7a3f910ff","resolution":{"observed_at":"2026-08-07T14:09:14.087173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:13.841368Z","title":"A hybrid rein- forcement learning approach with a spiking actor network for efficient robotic arm target reaching,","venue":null,"work_id":"6a1342ca-90cb-4099-996d-1f24451b1c08","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.764899Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:e0b8f343666cbb646a8ad2255e6ffd79096e2ace09aed04a3d04772b95ce0f3c","observation_id":"d514cb12-ea7f-4377-af39-8414dbc4b048","resolution":{"observed_at":"2026-08-07T14:09:13.898839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:13.460565Z","title":"Labelling unla- belled videos from scratch with multi-modal self-supervision,","venue":null,"work_id":"cf6098e1-184e-4b8f-b7bc-38bd18332aa1","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.892721Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:0252a88073fc66026be99acaa27083077b16fbb4271d16fa7fec3c519e1214fe","observation_id":"6197bdc3-8273-4f63-9980-0717138746e5","resolution":{"observed_at":"2026-08-07T14:09:13.667100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:13.179014Z","title":"Training deep spiking neural networks using backpropagation,","venue":null,"work_id":"f5158f91-bf13-41ac-b923-a5ed01f2483e","year":2016},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.014840Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:94218c28aeb7ddb2ee579ca02972c9ece4e6f4d9b98911469cb9109dd3a2d3ba","observation_id":"62c2a68e-2068-42ef-95c3-d5731f50b2c0","resolution":{"observed_at":"2026-08-07T14:09:13.309184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T14:09:08.114827Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.114827Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:c9007265c57b90fe632f4f40c598c8a3a8330cf22fd0bdefeb200c91b980c15f","observation_id":"0a7f348c-7b08-4a95-879d-6c975b739301","resolution":{"observed_at":"2026-08-07T14:09:08.114827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.959805Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"41f53599-70df-4168-b2c7-c38b938ca6fd","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.294831Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:ad063c22a5522b7684c04c169476aa23a01161acaad83f6116f84e063ebfb9b1","observation_id":"73e029cc-5e64-408c-ba90-87b5c3841221","resolution":{"observed_at":"2026-08-07T14:09:13.063599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.741844Z","title":"Evaluation of out- put embeddings for fine-grained image classification,","venue":null,"work_id":"b53259de-cb87-4af0-8faf-d40fb8cdce88","year":2015},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.552122Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:7c5b18580cf4084c4bbd465e5fa679f5448ab9fc641c962361ae98fc3446a825","observation_id":"c9ebbbad-7867-4301-93db-4ea49adc30c6","resolution":{"observed_at":"2026-08-07T14:09:12.827084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.520660Z","title":"Devise: A deep visual-semantic embedding model,","venue":null,"work_id":"0dbf9f07-1aaf-4624-a139-7ac1da6113d7","year":2013},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.696128Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:7ae5ab700da6951b1c33ec7b58256bdb149795d53535fd297adb572cda85fcfd","observation_id":"2817b972-4b79-4cc2-9ccf-408ce2df92f9","resolution":{"observed_at":"2026-08-07T14:09:12.592774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:12.202475Z","title":"Attribute proto- type network for zero-shot learning,","venue":null,"work_id":"1e0dcd15-0a24-45fa-bd66-d11288dfd0f8","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.864855Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:571d0ace29ec6aec3f46b597f696396aa25ae2995c715748fe46fe2ba444ef40","observation_id":"f3da65f5-da96-4ccb-813c-e0b2ff9074dd","resolution":{"observed_at":"2026-08-07T14:09:12.381999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.910129Z","title":"f-vaegan-d2: A feature generating framework for any-shot learning,","venue":null,"work_id":"fa4025ec-e662-48a5-a4f8-65b16ea54405","year":2019},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.054759Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:3fdab706f1d6467fd3a132d55476a3773aca8188d37238c7dda0f9a8b29acafd","observation_id":"5c73589e-bba8-44ac-92fd-0a93f7fb45cc","resolution":{"observed_at":"2026-08-07T14:09:12.053420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.658492Z","title":"Coordinated joint multimodal embeddings for generalized audio-visual zero-shot classifi- cation and retrieval of videos,","venue":null,"work_id":"428c530b-8331-44d1-814f-5d28868005ca","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.224775Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:20b6904b35f4b49e2b898f648399224a59f64a74fb6e7c196f0e228a3b16f6b3","observation_id":"592f091a-326b-4d8e-95ba-2544a116faf8","resolution":{"observed_at":"2026-08-07T14:09:11.779300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.433135Z","title":"Hyperbolic audio-visual zero-shot learning,","venue":null,"work_id":"0bdb919b-2fb8-4b96-96b9-a4c7d0b31280","year":2023},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.287939Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:e32c91841770dbff18e12a0b9c4235fddafb7d7aecb63f86698f29eef67cd40c","observation_id":"9d9254a5-804d-4161-9e73-79ecb95ecf07","resolution":{"observed_at":"2026-08-07T14:09:11.520841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.213727Z","title":"Label-embedding for image classification,","venue":null,"work_id":"49a190f8-2cbe-45a9-ad67-376b5f9bbcb0","year":2015},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.395070Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:47ab6563193411371a6fd4cade1f282637a46c678f9914338d1afaaee9fed396","observation_id":"eb881181-73c0-4686-95a0-5754709a04f3","resolution":{"observed_at":"2026-08-07T14:09:11.290505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:11.044249Z","title":"Coordinated joint multimodal embeddings for generalized audio-visual zero-shot classifi- cation and retrieval of videos,","venue":null,"work_id":"4f278855-0bba-4ef6-b17e-48e7c6a2f1cc","year":2020},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.495795Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:d70192fb17adef5971b67beddaa4917bedccddc684a421c5ff78815c56beaee0","observation_id":"e60af83a-2dac-4304-a94f-50d39e6e2620","resolution":{"observed_at":"2026-08-07T14:09:11.127256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.568720Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.568720Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:71569844af65a3b2889539138051b5b312fb7fecbac63170e1334a24f56b9246","observation_id":"13fd456c-432e-403a-8ef0-0484e6d60668","resolution":{"observed_at":"2026-08-07T14:09:09.568720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.761411Z","title":"Large-scale video classification with convolutional neural networks,","venue":null,"work_id":"892de2bb-cf37-4652-a7bf-0685867bdae6","year":2014},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.628189Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:2bb87f9e23770b894b6fc7d915fb815b2e5159cbbb3da330903c114e2150c6b6","observation_id":"961118c7-1ec5-4ad6-a11e-f40eea78e88b","resolution":{"observed_at":"2026-08-07T14:09:10.887396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.510790Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"89e94835-5a33-4327-9837-aaf621ccea32","year":2017},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.714162Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:fb75f2f64048605a69342fca855ad54ef9169223913b5ed423ebd21691b6a011","observation_id":"cc69ac4b-8d18-4d93-8c3b-98839b187297","resolution":{"observed_at":"2026-08-07T14:09:10.668104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.309685Z","title":"Youtube-8m: A large-scale video classi- fication benchmark,","venue":null,"work_id":"835e65eb-0094-4325-aac9-b6c5e48f2ab4","year":2016},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.800570Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:373a98af59e3982704da248426f3ad568f8389792d02f1a7d6b2f37df94a6d22","observation_id":"7a6f9a88-c432-455e-912e-86a7ffa889ae","resolution":{"observed_at":"2026-08-07T14:09:10.440823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:10.122113Z","title":"degree with the School of Computer Science, Harbin Institute of Technology, Harbin, China","venue":null,"work_id":"df791a28-a3c6-447f-9803-46d38de6d353","year":2016},"citing_paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.912975Z"},"links":{"citing_paper":"/paper/2505.19938"},"observation_digest":"sha256:c7f357dbf5d1dba60c3c071c3c19385bb72125988efe36a68d6bf0f0e1a62fc7","observation_id":"c083aee1-8488-41d6-ac1f-46f9eb635c3d","resolution":{"observed_at":"2026-08-07T14:09:10.197158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19938","last_updated":"2025-05-26T13:06:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T08:00:29.075039Z","submitted_at":"2025-05-26T13:06:01Z","title":"Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":63},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2505.19938."}