{"as_of":"2026-08-08T22:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32cd96a0673e1070c38a79afb37a921391bcb6ad6a5debcf7770bb5608221195","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":67,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:45:46.102491Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":31,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-08T15:45:46.102491Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06355","last_updated":"2025-07-08T21:12:11Z","snapshot_observed_at":"2026-08-08T15:40:21.853004Z","submitted_at":"2025-02-10T11:10:41Z","title":"Fine-tuning Multimodal Transformers on Edge: A Parallel Split Learning Approach","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:46.102491Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2502.06355"},"observation_digest":"sha256:75e7f50d4f8f3b46da72f1fb90afdb2980c99138feb1e0d7d1abbc07a699ee11","observation_id":"01a0685b-d2c9-4e6d-8743-21b5b06fdc70","resolution":{"observed_at":"2026-08-08T15:45:46.102491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2504.15214","last_updated":"2026-04-16T21:24:58Z","snapshot_observed_at":"2026-08-07T19:59:02.656854Z","submitted_at":"2025-04-21T16:36:38Z","title":"Histogram-based Parameter-efficient Tuning for Passive and Active Sonar Classification","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T18:11:44.073658Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2504.15214"},"observation_digest":"sha256:227a88dcc398a905c4059076552addadcec39b579566956adc7a72afbeb7624b","observation_id":"9d3c259c-a869-4382-9f1b-db706ca8510a","resolution":{"observed_at":"2026-05-22T18:11:54.476417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-08-08T09:33:29.860844Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:5630ec6b8c3615aa5c67a4d953cb464ef45b858f8b85422a4a0dc14996416a2d","observation_id":"d15fcc3d-a5ac-40e7-ad52-82e7c5442a09","resolution":{"observed_at":"2026-05-22T17:41:53.072562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T15:37:35.932400Z","title":"AST: audio spectrogram transformer, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14543","last_updated":"2025-05-20T15:58:54Z","snapshot_observed_at":"2026-08-07T22:30:28.667202Z","submitted_at":"2025-05-20T15:58:54Z","title":"Time to Embed: Unlocking Foundation Models for Time Series with Channel Descriptions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:37:35.932400Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2505.14543"},"observation_digest":"sha256:68349123bff50ed04f19b8a75a09097e2c46554fdfb3bf7caf818d87ccb47283","observation_id":"38a50e74-8e1a-413a-b738-fa01f4a63aed","resolution":{"observed_at":"2026-08-07T15:37:35.932400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T14:31:03.520260Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18819","last_updated":"2025-05-24T18:26:30Z","snapshot_observed_at":"2026-08-07T14:22:46.295549Z","submitted_at":"2025-05-24T18:26:30Z","title":"Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:03.520260Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2505.18819"},"observation_digest":"sha256:025213488f8f80fc9130e328671fff005de76c778ee0c610a8e6f47becdeeefe","observation_id":"a0a6ad1d-e84c-4249-8d2c-30989aefec82","resolution":{"observed_at":"2026-08-07T14:31:03.520260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T12:56:02.389077Z","title":"Ast: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23132","last_updated":"2025-05-29T06:08:05Z","snapshot_observed_at":"2026-08-08T11:34:01.516231Z","submitted_at":"2025-05-29T06:08:05Z","title":"Patient Domain Supervised Contrastive Learning for Lung Sound Classification Using Mobile Phone","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:02.389077Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2505.23132"},"observation_digest":"sha256:58a65b9b6368d44fd15f64c62ba97c2c001328ad33b315cf857e652a6dcb963c","observation_id":"97f0c727-3582-48f2-a390-b9c466e8895d","resolution":{"observed_at":"2026-08-07T12:56:02.389077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T12:52:38.367740Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23298","last_updated":"2025-05-29T09:50:07Z","snapshot_observed_at":"2026-08-08T11:33:58.526805Z","submitted_at":"2025-05-29T09:50:07Z","title":"Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.367740Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2505.23298"},"observation_digest":"sha256:4e6a58e7f77522a67be355d356348793353dcd10ff9d1fcf7b7b8cbb709378f8","observation_id":"51050fcc-6128-4bf5-9f37-6ae9629031e9","resolution":{"observed_at":"2026-08-07T12:52:38.367740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T12:41:35.511647Z","title":"& Glass, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23964","last_updated":"2025-05-29T19:41:15Z","snapshot_observed_at":"2026-08-08T11:36:08.132958Z","submitted_at":"2025-05-29T19:41:15Z","title":"Acoustic Classification of Maritime Vessels using Learnable Filterbanks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:35.511647Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2505.23964"},"observation_digest":"sha256:b4c43eea8840a668bb9632bb56e83edd6c548303a16b71cf6653e07293efd10e","observation_id":"4c04a309-fe78-440d-a9e4-e78b200334ce","resolution":{"observed_at":"2026-08-07T12:41:35.511647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T11:37:13.332193Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02091","last_updated":"2025-06-02T15:11:36Z","snapshot_observed_at":"2026-08-08T11:33:56.807878Z","submitted_at":"2025-06-02T15:11:36Z","title":"Comparison of spectrogram scaling in multi-label Music Genre Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:13.332193Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.02091"},"observation_digest":"sha256:11391bd6d5cd7bc3cb1653a98f1282162638204e4d59442d1132fd15efa5f8cb","observation_id":"2c6fa41f-8e91-4b11-9f99-2e7d678586f3","resolution":{"observed_at":"2026-08-07T11:37:13.332193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T05:20:04.438838Z","title":"AST: audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08372","last_updated":"2025-06-10T02:37:42Z","snapshot_observed_at":"2026-08-08T09:39:08.461011Z","submitted_at":"2025-06-10T02:37:42Z","title":"Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.438838Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.08372"},"observation_digest":"sha256:47b8948ef697b7d1fd43bb0bcbcc27bb890585e8535aedc1af5bb879d93d331f","observation_id":"0827d5e9-db23-479a-a2c8-f592474ded7b","resolution":{"observed_at":"2026-08-07T05:20:04.438838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T15:11:30.519671Z","title":"Gong, Y .-A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11049","last_updated":"2025-08-14T14:50:40Z","snapshot_observed_at":"2026-08-07T15:05:47.466041Z","submitted_at":"2025-05-21T21:53:19Z","title":"15,500 Seconds: Lean UAV Classification Using EfficientNet and Lightweight Fine-Tuning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:30.519671Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.11049"},"observation_digest":"sha256:ded61fa779139a78fae4c090c24caf8efff22e90d8c39160ac179069e3a9731a","observation_id":"6b9c80ef-eee0-4785-8783-162fa92a9b07","resolution":{"observed_at":"2026-08-07T15:11:30.519671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T04:33:05.434923Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11170","last_updated":"2025-08-14T05:53:15Z","snapshot_observed_at":"2026-08-07T04:25:09.516929Z","submitted_at":"2025-06-12T06:45:29Z","title":"PromptTSS: A Prompting-Based Approach for Interactive Multi-Granularity Time Series Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:05.434923Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.11170"},"observation_digest":"sha256:8b7c960c8575a9e9c9cf1fe998e89f216ea0dfd3a73ade06e32266fe69976801","observation_id":"d3dc17cb-3d4d-4633-a78d-5a05ae4ce08f","resolution":{"observed_at":"2026-08-07T04:33:05.434923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T01:05:44.293487Z","title":"AST: Audio spectrogram Transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12222","last_updated":"2025-06-13T20:48:46Z","snapshot_observed_at":"2026-08-07T05:03:50.906639Z","submitted_at":"2025-06-13T20:48:46Z","title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T01:05:44.293487Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.12222"},"observation_digest":"sha256:9c118a9751958c388ea25c54825591eb806c6e43267490173cc9e774a9b69f59","observation_id":"61012109-f531-4814-87f9-741cb0120e8d","resolution":{"observed_at":"2026-08-07T01:05:44.293487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2506.14148","last_updated":"2026-05-19T04:05:49Z","snapshot_observed_at":"2026-08-01T18:19:07.739909Z","submitted_at":"2025-06-17T03:25:38Z","title":"Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T00:18:57.564840Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.14148"},"observation_digest":"sha256:a36a00c2966e72bde18df45ffc338b8c8aebc2f975e28d6510d11a7933d7c08c","observation_id":"1224e34d-2cf2-4b69-871b-9e6e86eb0d7a","resolution":{"observed_at":"2026-05-22T00:20:49.190056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-07T00:15:18.265968Z","title":"Gong, Y .-A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14754","last_updated":"2025-06-17T17:49:16Z","snapshot_observed_at":"2026-08-07T00:07:38.797600Z","submitted_at":"2025-06-17T17:49:16Z","title":"Tactile Beyond Pixels: Multisensory Touch Representations for Robot Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:18.265968Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.14754"},"observation_digest":"sha256:bd30799e4d227bfe23642bcdc794c8f2a3db9230239eb6468ac2263811fc2506","observation_id":"11034275-b9fd-4b76-825e-0e803916ec81","resolution":{"observed_at":"2026-08-07T00:15:18.265968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T22:47:29.517169Z","title":"Ast: Audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20609","last_updated":"2025-06-25T17:00:21Z","snapshot_observed_at":"2026-08-08T11:34:02.595798Z","submitted_at":"2025-06-25T17:00:21Z","title":"Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:29.517169Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2506.20609"},"observation_digest":"sha256:116cb02d2625b6325b2f22b9b26a88442a9c9a39be43a0b0e81d966213ce9612","observation_id":"d44c70f8-fdad-4b84-9c0a-2e4aeeec1de7","resolution":{"observed_at":"2026-08-06T22:47:29.517169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T19:12:02.492655Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-07T13:56:04.875098Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:02.492655Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:86c01d346b1a43450c3c0e0abf6abb40b93a8a343e3626ac219ab2b19002b34c","observation_id":"c05c7cc8-342f-42bd-b773-1ecfc5832b33","resolution":{"observed_at":"2026-08-06T19:12:02.492655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T19:12:43.684468Z","title":"Gong, Y .-A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06481","last_updated":"2025-07-09T01:57:39Z","snapshot_observed_at":"2026-08-06T19:01:17.796720Z","submitted_at":"2025-07-09T01:57:39Z","title":"IMPACT: Industrial Machine Perception via Acoustic Cognitive Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:12:43.684468Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.06481"},"observation_digest":"sha256:421f6f5a949f4efdb1e56168df0b3202229b28ed13e438ffd49a3d860e802c8d","observation_id":"7c94d390-fc21-4de9-bc15-50679fe0be39","resolution":{"observed_at":"2026-08-06T19:12:43.684468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T18:03:03.498534Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09323","last_updated":"2025-07-12T15:45:36Z","snapshot_observed_at":"2026-08-08T11:34:00.470309Z","submitted_at":"2025-07-12T15:45:36Z","title":"Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.498534Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.09323"},"observation_digest":"sha256:cb799b1ab0ca6c403b967077cf361a81f0d767cab3a5afc9fd6d0b39b90d8049","observation_id":"8eeb24fa-c3e4-4bf2-bce0-6e3ca5a37666","resolution":{"observed_at":"2026-08-06T18:03:03.498534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T19:50:17.039560Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.039560Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:633a04adb44ef197e09fa066f60d401d388196e6e98f93350bac05cb36227974","observation_id":"c5ee46f4-7d1b-482f-8cad-1e106d61c0a3","resolution":{"observed_at":"2026-08-06T19:50:17.039560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T13:39:08.440360Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-08T11:33:57.877406Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.440360Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:d3129766ea544c48621a5dab17c184bc8c7648288028eec058333292aa1c4b9d","observation_id":"8517328c-d79c-4fe0-ab3a-4c568edbdbc9","resolution":{"observed_at":"2026-08-06T13:39:08.440360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T13:29:39.608184Z","title":"Conventional beamforming techniques,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.20651","last_updated":"2025-07-28T09:20:23Z","snapshot_observed_at":"2026-08-08T15:37:32.686919Z","submitted_at":"2025-07-28T09:20:23Z","title":"Angle-distance decomposition based on deep learning for active sonar detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:29:39.608184Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.20651"},"observation_digest":"sha256:1df2cf117675bd6d5088bd80d7b97f59a1e42500b6eb1b3f18ef4d5ceb76428b","observation_id":"3733418c-44e5-49db-9337-763e77badd5f","resolution":{"observed_at":"2026-08-06T13:29:39.608184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T12:18:26.116606Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-08T11:33:57.429111Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.116606Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:9ea28cc20358c534b8fada1c0cd19845a81b2951949e9ca786655bf10d47479b","observation_id":"187f7f20-0af3-4e6f-a632-27b512db3adc","resolution":{"observed_at":"2026-08-06T12:18:26.116606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T11:54:44.824499Z","title":"Ast: Audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.824499Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:9a2c5a40ba0614c21196ab282897de66721aea75462dc7fdf02acf4ec1ac21cd","observation_id":"ec3e673b-b559-47b2-9a43-6d0e13f0a606","resolution":{"observed_at":"2026-08-06T11:54:44.824499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T04:51:59.205438Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03764","last_updated":"2025-08-04T23:09:07Z","snapshot_observed_at":"2026-08-06T22:40:36.743726Z","submitted_at":"2025-08-04T23:09:07Z","title":"CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:51:59.205438Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2508.03764"},"observation_digest":"sha256:02a183f25628625b154c861a65337f62cc37c3546250165007b1e3f083cc98ec","observation_id":"1ebee6d5-741f-4ff4-8e8c-f667f7641f9a","resolution":{"observed_at":"2026-08-06T04:51:59.205438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T14:30:46.499751Z","title":"Ast: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21243","last_updated":"2025-08-28T22:13:20Z","snapshot_observed_at":"2026-08-07T22:19:04.688808Z","submitted_at":"2025-08-28T22:13:20Z","title":"Full-Frequency Temporal Patching and Structured Masking for Enhanced Audio Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:30:46.499751Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2508.21243"},"observation_digest":"sha256:e911ea10f656df4cfe04cef154b2b9d8430f53fd0d60990868ed482a888bf7a3","observation_id":"fe0e9cbf-465b-4124-add9-cd02e8b51251","resolution":{"observed_at":"2026-08-05T14:30:46.499751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T11:53:50.790037Z","title":"Ast: Audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02167","last_updated":"2026-06-06T12:22:03Z","snapshot_observed_at":"2026-08-07T06:17:54.475837Z","submitted_at":"2025-09-02T10:20:31Z","title":"AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:53:50.790037Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2509.02167"},"observation_digest":"sha256:418673ef3bdae5f4fd67a30f32a1a70be111054e35159825b80dd998c3993946","observation_id":"f6ded1af-efc1-4f22-8969-8af1e09bab3e","resolution":{"observed_at":"2026-08-05T11:53:50.790037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-04T18:59:47.408023Z","title":"AST: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-08T11:34:41.412081Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.408023Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:2ade89f2206adcc9da250c6c41b914b46218096f240f67f23488097c8c0090b7","observation_id":"5454e27e-3978-4895-b890-ff6d4fdc329f","resolution":{"observed_at":"2026-08-04T18:59:47.408023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-03T20:49:54.329414Z","title":"Ast: Audio spectro- gram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.18421","last_updated":"2026-06-22T13:23:13Z","snapshot_observed_at":"2026-08-03T20:49:52.073370Z","submitted_at":"2025-11-23T12:19:23Z","title":"DHAuDS: A Dynamic and Heterogeneous Audio Benchmark for Test-Time Adaptation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:49:54.329414Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2511.18421"},"observation_digest":"sha256:4bfe966ea46b80ab973845e5ee3365ae1f3368682e78e12d3c5c3fb5af9daf43","observation_id":"0c8f2938-b5ec-4e79-bc31-69f1150fe6ea","resolution":{"observed_at":"2026-08-03T20:49:54.329414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-03T17:16:38.554983Z","title":"Ast: Audio spectrogram transformer.arXiv:2104.01778, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:38.554983Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:3ee8a3c056fc60282d7947e637af0f30ef5534ac217be1bd64ae2788e4af6aa7","observation_id":"dd600482-91dc-4516-812f-d3d1c422a6a9","resolution":{"observed_at":"2026-08-03T17:16:38.554983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-02T18:35:50.568237Z","title":"Ast: Audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.08173","last_updated":"2026-07-18T12:50:12Z","snapshot_observed_at":"2026-08-07T18:54:26.046430Z","submitted_at":"2026-03-09T09:53:05Z","title":"Evolution Strategy-Based Calibration for Low-Bit Quantization of Speech Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:35:50.568237Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2603.08173"},"observation_digest":"sha256:92f6bd12aa5f1e1bd6c1cf914be28213fd6beb2ff284713e6cdf04d1e5336409","observation_id":"9b53fdc8-ce7d-4013-8433-d8ec055fe305","resolution":{"observed_at":"2026-08-02T18:35:50.568237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-02T18:21:58.032767Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.13415","last_updated":"2026-07-31T01:47:44Z","snapshot_observed_at":"2026-08-06T09:27:44.898863Z","submitted_at":"2026-03-12T15:33:17Z","title":"Distance-aware Soft Prompt Guidance for Multimodal Valence-Arousal Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:21:58.032767Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2603.13415"},"observation_digest":"sha256:2c0d328c102745f35138109f4a8fbd5100fd64672f1c577ee2d5aa5c0e0d1df1","observation_id":"27691a8d-3392-447b-a95e-8ae39e8c515f","resolution":{"observed_at":"2026-08-02T18:21:58.032767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-03T02:33:51.775100Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.13415","last_updated":"2026-07-31T01:47:44Z","snapshot_observed_at":"2026-08-06T09:27:44.898863Z","submitted_at":"2026-03-12T15:33:17Z","title":"Distance-aware Soft Prompt Guidance for Multimodal Valence-Arousal Estimation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:51.775100Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2603.13415"},"observation_digest":"sha256:4857dc76fa6da7ba6a634fdeb37cad69c277ec250fd9c3e4f31f6bf1263b1c64","observation_id":"58e6f0ec-2300-4524-a115-a6013ed7cf5b","resolution":{"observed_at":"2026-08-03T02:33:51.775100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2603.15995","last_updated":"2026-03-16T23:11:38Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T23:11:38Z","title":"AILive Mixer: A Deep Learning based Zero Latency Automatic Music Mixer for Live Music Performances","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T10:01:42.570418Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2603.15995"},"observation_digest":"sha256:40e187c458814072bb81b25951a401566017885de1183f55143557bee97e19dc","observation_id":"7249a03e-1374-4c98-999a-5bff152da504","resolution":{"observed_at":"2026-05-15T10:05:26.307268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2603.26842","last_updated":"2026-07-16T02:13:26Z","snapshot_observed_at":"2026-08-04T15:43:29.711522Z","submitted_at":"2026-03-27T08:48:59Z","title":"VAN-AD: Visual Masked Autoencoder with Normalizing Flow For Time Series Anomaly Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T00:04:05.071623Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2603.26842"},"observation_digest":"sha256:f48644c83511558c22b0dce345b237c33f34121b7e1c2ba48cdf552a1677fb56","observation_id":"8e2cb717-2ed5-47e2-b512-a7ae3193f5e6","resolution":{"observed_at":"2026-05-15T00:08:21.799091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-02T17:22:59.839713Z","title":"Ast: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26842","last_updated":"2026-07-16T02:13:26Z","snapshot_observed_at":"2026-08-04T15:43:29.711522Z","submitted_at":"2026-03-27T08:48:59Z","title":"VAN-AD: Visual Masked Autoencoder with Normalizing Flow For Time Series Anomaly Detection","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T17:22:59.839713Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2603.26842"},"observation_digest":"sha256:dcb356a536563ab694431c58543e5129f2d3a81a52381cdfd9256af6fe4a6f27","observation_id":"f019eacc-3ae5-417e-a3fb-14bb7a65e392","resolution":{"observed_at":"2026-08-02T17:22:59.839713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2604.05954","last_updated":"2026-04-07T14:46:55Z","snapshot_observed_at":"2026-08-02T16:32:10.228075Z","submitted_at":"2026-04-07T14:46:55Z","title":"You're Pushing My Buttons: Instrumented Learning of Gentle Button Presses","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:48:22.314443Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2604.05954"},"observation_digest":"sha256:681235d8f1f1e0767002d689f837f9d5d969adcc5c0514b6da6577a4497fc902","observation_id":"b742e924-0625-4fa9-b903-0304ceeb93ef","resolution":{"observed_at":"2026-05-10T23:55:50.774524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2604.06702","last_updated":"2026-04-08T05:42:03Z","snapshot_observed_at":"2026-07-06T22:55:06.424752Z","submitted_at":"2026-04-08T05:42:03Z","title":"ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:30:30.431777Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2604.06702"},"observation_digest":"sha256:aaa26b395a8a7aa211a1749e691d502d51aa9890d3be3a7497af1f119a8b6305","observation_id":"9b2ae9ef-aa66-4908-9297-0e7607a3ce8a","resolution":{"observed_at":"2026-05-11T00:30:50.823026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2604.12733","last_updated":"2026-04-14T13:47:41Z","snapshot_observed_at":"2026-07-06T23:00:51.385974Z","submitted_at":"2026-04-14T13:47:41Z","title":"Transformer Based Machine Fault Detection From Audio Input","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:14:31.344676Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2604.12733"},"observation_digest":"sha256:7fb92694c607be53dc496469dd273513c80fd87073f102e1855bfde735b3e3c9","observation_id":"577f6175-6b60-4cc5-8c72-478535f98a1e","resolution":{"observed_at":"2026-05-10T14:15:28.279930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2604.16445","last_updated":"2026-05-12T09:43:45Z","snapshot_observed_at":"2026-07-17T23:18:02.221839Z","submitted_at":"2026-04-07T13:24:13Z","title":"SAND: The Challenge on Speech Analysis for Neurodegenerative Disease Assessment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:48.363579Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2604.16445"},"observation_digest":"sha256:6e746715957c70bd7bdae7f10c407cd74ae13d8a28bfc301eae246cb9822004b","observation_id":"53aa65a0-6c2c-4ed2-8ded-2b61b1ae3e86","resolution":{"observed_at":"2026-05-11T00:10:51.105148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2604.16445","last_updated":"2026-05-12T09:43:45Z","snapshot_observed_at":"2026-07-17T23:18:02.221839Z","submitted_at":"2026-04-07T13:24:13Z","title":"SAND: The Challenge on Speech Analysis for Neurodegenerative Disease Assessment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:55:39.622962Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2604.16445"},"observation_digest":"sha256:f3e1aa6adf4b68e8aa2f0d3ac98899aa1ddb5ea3ff575f65e5c303b5d21412d9","observation_id":"b13af13b-949f-42cd-886b-cd2a1549b568","resolution":{"observed_at":"2026-05-13T07:57:31.415288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.00434","last_updated":"2026-05-01T06:11:42Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:11:42Z","title":"LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T20:17:24.090467Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.00434"},"observation_digest":"sha256:d21f7a157dbcb2050bc85e5f7d7958d4291faf50aa740c3c9f6ed4c1ec9c2ca8","observation_id":"48a6654c-096e-4e0f-b0c3-5aedb84ecdd6","resolution":{"observed_at":"2026-05-11T15:21:06.060998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.00963","last_updated":"2026-05-01T15:04:53Z","snapshot_observed_at":"2026-08-04T09:50:45.017468Z","submitted_at":"2026-05-01T15:04:53Z","title":"Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T18:37:32.865795Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.00963"},"observation_digest":"sha256:715d1d13c0a3d9806d22a23a9ce8f4f1d85d137293c98e03c47756dd67c8f234","observation_id":"1e947acc-fc63-438d-920b-2950bf62b7eb","resolution":{"observed_at":"2026-05-11T16:11:08.290066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.08945","last_updated":"2026-06-22T08:53:33Z","snapshot_observed_at":"2026-08-03T11:36:13.403110Z","submitted_at":"2026-05-09T13:33:16Z","title":"MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:04.350174Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.08945"},"observation_digest":"sha256:23e409967c36640184f432f4fb4379dea3d4dbfeb74b8104adff72c364b2abda","observation_id":"16c3a374-396b-43d0-afd0-12522711e9af","resolution":{"observed_at":"2026-05-12T02:31:16.920533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.08945","last_updated":"2026-06-22T08:53:33Z","snapshot_observed_at":"2026-08-03T11:36:13.403110Z","submitted_at":"2026-05-09T13:33:16Z","title":"MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T23:08:22.923816Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.08945"},"observation_digest":"sha256:557b4c7dee687f4c76cbf29f6ae44a912cfa20f9a7fce19427b948cf2ebdef13","observation_id":"ce36f806-6d6a-4147-9279-af992c73bede","resolution":{"observed_at":"2026-07-01T13:35:45.783412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.09152","last_updated":"2026-05-09T20:30:15Z","snapshot_observed_at":"2026-08-02T12:54:52.595546Z","submitted_at":"2026-05-09T20:30:15Z","title":"Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T04:02:23.847187Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.09152"},"observation_digest":"sha256:63ad523e620042a0218a7c99e648e8b37e19b3d24eb6355348ae6e5ae819cef8","observation_id":"8a56aa81-c172-4261-a63a-ec81575ad4a6","resolution":{"observed_at":"2026-05-12T06:41:43.803126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.13672","last_updated":"2026-05-13T15:32:57Z","snapshot_observed_at":"2026-08-02T22:33:46.962628Z","submitted_at":"2026-05-13T15:32:57Z","title":"SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:49.239866Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.13672"},"observation_digest":"sha256:b0b332866c775feea5cdaea359f0febb6b918ab7254eb8e63b243587044b6ee5","observation_id":"57381c1c-f06f-466c-8c3d-67561f8eafb9","resolution":{"observed_at":"2026-05-14T20:32:57.049037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.18194","last_updated":"2026-05-18T10:32:56Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:32:56Z","title":"Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T10:10:31.059095Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.18194"},"observation_digest":"sha256:7808afce7b74ca4833497120b23020f3677e652286ea6b8f43f50d8c0be68896","observation_id":"1dd84bca-75b8-46e6-9ebe-53b37d67df03","resolution":{"observed_at":"2026-05-20T10:13:11.922566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.19632","last_updated":"2026-05-19T10:15:58Z","snapshot_observed_at":"2026-07-06T23:30:21.283826Z","submitted_at":"2026-05-19T10:15:58Z","title":"Executable Boundary Contracts for Sound Event Traces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T02:08:44.066554Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.19632"},"observation_digest":"sha256:96ba42c21cc1e0f8fb3a482c837448165b9a3755aa49ab8acaf56cd12b0b4f17","observation_id":"4249f01b-8d80-4e25-b6e2-b183a8d2247b","resolution":{"observed_at":"2026-05-20T02:12:58.522782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.20853","last_updated":"2026-05-20T07:44:39Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:39Z","title":"SEABAD: A Tropical Bird Activity Detection Dataset for Passive Acoustic Monitoring","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-21T02:15:41.816523Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.20853"},"observation_digest":"sha256:8b0f397d2309faaad7bbb6a930bd10dafde6156e9d0ee9ab2c97e08a75ad5d68","observation_id":"3745e5c3-2267-41b5-85fd-29383faed294","resolution":{"observed_at":"2026-05-21T02:19:25.442210Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2605.31177","last_updated":"2026-05-29T11:47:02Z","snapshot_observed_at":"2026-08-08T11:55:59.827362Z","submitted_at":"2026-05-29T11:47:02Z","title":"Vanilla ViT for Automotive Point Cloud Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:40.495590Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2605.31177"},"observation_digest":"sha256:1654c10e87fbccbf644de86e77b6bc3e9ac30818819e8a67cbf74a3cd067fd10","observation_id":"1f230ac2-e242-4201-aaec-2785f9371ea4","resolution":{"observed_at":"2026-06-28T22:42:47.102000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2606.06074","last_updated":"2026-06-04T12:12:35Z","snapshot_observed_at":"2026-08-04T12:31:15.855835Z","submitted_at":"2026-06-04T12:12:35Z","title":"VZCrash: A Large-Scale IMU Dataset of Ego-Vehicle Crashes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:02:57.151031Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2606.06074"},"observation_digest":"sha256:ec2c533efd38f756936917569f72ebdb0e8f64848e0a4f404fed3c8d038b49f6","observation_id":"79a0c5a1-e41e-4da2-a7b9-76439e90c096","resolution":{"observed_at":"2026-07-02T12:36:56.430386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2606.10738","last_updated":"2026-06-09T11:50:06Z","snapshot_observed_at":"2026-08-02T05:33:24.003170Z","submitted_at":"2026-06-09T11:50:06Z","title":"Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:52:47.948163Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2606.10738"},"observation_digest":"sha256:bab9be4e1a32f6d9b889e26d70ad94fdee67ae27592bf74fb0c83cc769ece3a8","observation_id":"38c1f98c-db25-4100-97e8-37d637422426","resolution":{"observed_at":"2026-07-03T07:47:44.503408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2606.20893","last_updated":"2026-06-18T19:40:46Z","snapshot_observed_at":"2026-08-06T16:11:59.883192Z","submitted_at":"2026-06-18T19:40:46Z","title":"Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:38.141342Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2606.20893"},"observation_digest":"sha256:ee6ddbf72cd4b1b212ac9d96a09893a40ca8885c85f0ebbb501f98e56ab70cd8","observation_id":"2f5c5f4d-f89e-4efb-84c6-3ca6ead98307","resolution":{"observed_at":"2026-07-04T05:49:36.694812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2606.29570","last_updated":"2026-06-28T19:22:40Z","snapshot_observed_at":"2026-07-07T00:03:31.715960Z","submitted_at":"2026-06-28T19:22:40Z","title":"Hierarchical Policy Learning via Spectral Decomposition","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-30T06:54:29.971971Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2606.29570"},"observation_digest":"sha256:9f9ae499826da012799a5b2a02b815a331162900dbc1089e864c575d889fa269","observation_id":"1e8a4258-05c4-496c-a285-fc7292e5f1a8","resolution":{"observed_at":"2026-06-30T07:14:21.977403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:b89fa90ba094eab1c71e6dfbdf19e57f06c280abc46ccbf14e5aadeba504d266","observation_id":"8376e35f-5aeb-4bfc-aea8-66cf16962f44","resolution":{"observed_at":"2026-07-02T05:56:39.820388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2607.00530","last_updated":"2026-07-01T07:19:00Z","snapshot_observed_at":"2026-08-08T03:48:04.260054Z","submitted_at":"2026-07-01T07:19:00Z","title":"From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-02T11:49:28.247486Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.00530"},"observation_digest":"sha256:297f2723fe322f9c5816673d1e3eaa9be9705f149baa6dc1d130a3db7f0dd302","observation_id":"72ec0e18-affb-4907-b025-eab7b13a238f","resolution":{"observed_at":"2026-07-02T11:56:54.940058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-07-12T05:57:52.610916Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02938","last_updated":"2026-07-03T04:21:19Z","snapshot_observed_at":"2026-08-02T19:43:48.491842Z","submitted_at":"2026-07-03T04:21:19Z","title":"Missingness as Signal: Channel-Independent Spectrogram Learning for Clinical Time Series Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T05:57:52.610916Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.02938"},"observation_digest":"sha256:f1be96ce861806a0ff5226c4bbb7db8588ec67e7dccea8af9d578db15e31583b","observation_id":"5007d59f-a0c7-47ef-895d-12c7941baa41","resolution":{"observed_at":"2026-07-12T05:57:52.610916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-07-12T03:24:13.814557Z","title":"https://doi.org/10.48550/arXiv.2104.01778, http://arxiv.org/abs/2104","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03304","last_updated":"2026-07-03T13:16:30Z","snapshot_observed_at":"2026-08-06T16:38:09.160220Z","submitted_at":"2026-07-03T13:16:30Z","title":"Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T03:24:13.814557Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.03304"},"observation_digest":"sha256:65eae73a49ea55d760ddbf040001c3fc0990a4fd52666792f3611083e63b9115","observation_id":"c833f037-7ac7-4bb4-bdba-b8fa6319ee30","resolution":{"observed_at":"2026-07-12T03:24:13.814557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-07-11T19:34:49.358453Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04383","last_updated":"2026-07-29T12:04:35Z","snapshot_observed_at":"2026-08-08T13:11:08.588561Z","submitted_at":"2026-07-05T16:22:14Z","title":"Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T19:34:49.358453Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.04383"},"observation_digest":"sha256:4627de4865d8535759320e4392281a5c442c4443ed8f4eb4358b9f67c96b9e5d","observation_id":"8ff1e287-e2f7-45a9-be69-aa56a79d659c","resolution":{"observed_at":"2026-07-11T19:34:49.358453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-02T08:43:33.527769Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04383","last_updated":"2026-07-29T12:04:35Z","snapshot_observed_at":"2026-08-08T13:11:08.588561Z","submitted_at":"2026-07-05T16:22:14Z","title":"Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T08:43:33.527769Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.04383"},"observation_digest":"sha256:95c03d792bcb27e6ba3c748d26ab3f83c73d78a5ea4d0ab8c7d1f9a03a9992df","observation_id":"63db0a09-07e1-4d4e-ab3c-737933b8431d","resolution":{"observed_at":"2026-08-02T08:43:33.527769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-08T14:15:13.834590Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":275,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:5fd310a0ad7c88788c0dafe69d0488dadeb64ea31ccc6f32bdcff38e060ba825","observation_id":"df60abc3-6fc7-4117-b82c-f3d56fab2cd9","resolution":{"observed_at":"2026-07-08T00:04:22.431427Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2104.01778 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-08T14:15:13.834590Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":275,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:7993c813e90ca7595dbbb96606a2e7eaba81f5ee20f0c21b0c1dabb3bb41d474","observation_id":"96f767a6-a5e6-4d7e-af2a-07e0867fffd4","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-02T03:29:29.704719Z","title":"arXiv preprint arXiv:2104.01778 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14182","last_updated":"2026-07-15T14:24:00Z","snapshot_observed_at":"2026-08-08T04:00:33.499198Z","submitted_at":"2026-07-15T14:24:00Z","title":"Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:29:29.704719Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.14182"},"observation_digest":"sha256:1f1f423d3cf08f4e856adfc42b6eedb10a2a6f80175124e6b5f4823869be5c6a","observation_id":"f5d7c464-179b-4235-9533-b249f0dc72fc","resolution":{"observed_at":"2026-08-02T03:29:29.704719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-02T02:03:38.740837Z","title":"doi:10.21437/Interspeech.2021-698 , archiveprefix =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14474","last_updated":"2026-07-16T01:37:39Z","snapshot_observed_at":"2026-08-08T13:45:48.611646Z","submitted_at":"2026-07-16T01:37:39Z","title":"Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T02:03:38.740837Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.14474"},"observation_digest":"sha256:3b37dc95d8485daaaca313e8b93854baaecb57eb62ab2518fde882227dc77ebc","observation_id":"8c258ffe-b7ea-4d76-b567-bc9840e800a3","resolution":{"observed_at":"2026-08-02T02:03:38.740837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-01T03:12:06.459273Z","title":"AST: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25197","last_updated":"2026-07-28T02:04:00Z","snapshot_observed_at":"2026-08-08T11:34:00.014616Z","submitted_at":"2026-07-28T02:04:00Z","title":"LGFNet: A CTC-Guided Local-Global Fusion Framework for Single-Channel Sleep Staging","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:12:06.459273Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.25197"},"observation_digest":"sha256:4af1bad8cc7149a1ae7054f67bfad2b021602f67b76f9e7c1a116679c10c233f","observation_id":"54d88d1b-54d3-4e2b-9bf3-ca5ac6e69a09","resolution":{"observed_at":"2026-08-01T03:12:06.459273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-01T01:14:26.281716Z","title":"AST: Audio Spectrogram Transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25887","last_updated":"2026-07-28T15:47:37Z","snapshot_observed_at":"2026-08-06T12:12:59.117195Z","submitted_at":"2026-07-28T15:47:37Z","title":"Device Invariance using Domain Adaptation on Acoustic Scene Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:14:26.281716Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.25887"},"observation_digest":"sha256:26503e29449a546779fe077d84de7f8870e598922435bd33f60ec2ba59119ca3","observation_id":"2e37716a-9121-400b-9b27-1e5fa08dee4d","resolution":{"observed_at":"2026-08-01T01:14:26.281716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.01778/citation-record","integrity":"/paper/2104.01778/integrity","json":"/paper/2104.01778/citation-record.json","paper":"/paper/2104.01778"},"outbound":[],"paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 67 inbound Pith citation observations for arXiv:2104.01778."}