{"as_of":"2026-08-08T04:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:161c49faae5cb326493d38c516975fb86823a7ddef52a312408f74326db335b9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:05.080883Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.466366Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:d528f1345131ff89a84236baa357864e490f54588ff8ada8cbbcd11a57d248ca","observation_id":"0fd8edf6-6bcf-447c-a786-d6886f7d1814","resolution":{"observed_at":"2026-05-11T08:52:31.926052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:05:15.772955Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.772955Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d253ad5c81656ead06e0059ef74903391166238bee700d07abde73029e6ba482","observation_id":"7beb06ff-c36e-4a0f-a60f-e687ac17af26","resolution":{"observed_at":"2026-08-07T15:05:15.772955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:43:05.080883Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.080883Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:c88d153c5fe1e6fa5816969673186a85315681ca7ec14092f88df830427271f2","observation_id":"44c14ae2-aab0-4e07-b60d-3d12d1b66ed7","resolution":{"observed_at":"2026-08-07T15:43:05.080883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:19:10.885941Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-07T15:12:15.780318Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.885941Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:5b9adae549bd0de951898ef914d04a734b31220cb65cac31e251445afa4d637c","observation_id":"4df0c23c-75af-4104-9e04-af14abb2e49d","resolution":{"observed_at":"2026-08-07T15:19:10.885941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T14:33:48.281447Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-07T14:27:58.432196Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:48.281447Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.18517"},"observation_digest":"sha256:82b4b0a955f222152337d8f96ef4bf8922dea937d2a5eb3dca1108738457ec2c","observation_id":"e0ee79de-2d55-4c4a-9c8b-f63aba10c8d7","resolution":{"observed_at":"2026-08-07T14:33:48.281447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T13:46:40.632711Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20961","last_updated":"2025-05-27T09:56:16Z","snapshot_observed_at":"2026-08-07T13:40:33.127032Z","submitted_at":"2025-05-27T09:56:16Z","title":"Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.632711Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.20961"},"observation_digest":"sha256:04b7589afeb86085a57028708ba48cc7c7896f1eebfa65d551d277943614d1e0","observation_id":"1c2b0f6c-cf99-4bb2-b38e-37f4ea4a29c6","resolution":{"observed_at":"2026-08-07T13:46:40.632711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T23:41:49.677614Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-07T18:45:57.210896Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.677614Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:0a585368a5fbcd60997731e923c00bbb0ba015bf714706a1335b46b5a3b40be3","observation_id":"d39d2e9c-6acf-4e67-9491-54518e61f564","resolution":{"observed_at":"2026-08-06T23:41:49.677614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T19:46:10.747215Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-07T01:19:10.776990Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:10.747215Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:1b9df269bf0fdb6354a33925d83f827f647d9886a7a78b22b0dfe6327ee21db4","observation_id":"9917f026-aa6d-414f-b692-c025fa093fe7","resolution":{"observed_at":"2026-08-06T19:46:10.747215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T17:46:13.348025Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.348025Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a21bbdbee37c457c352cabc3d044036c326d67e9043fbe22ab493c54a98de960","observation_id":"e6801440-a98a-4f92-acfd-75a1da97f3bc","resolution":{"observed_at":"2026-08-06T17:46:13.348025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T16:47:34.333552Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-07T05:00:37.140037Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.333552Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:e78d32dee4c273a63f4a454b79b2a3c53a5f4c5b638bc2bfa17bf985524b5623","observation_id":"043fba0e-52af-41da-b7cc-98f402ff4421","resolution":{"observed_at":"2026-08-06T16:47:34.333552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:217c6603a78b010251d22f260acec03d78a9e5ee3477ad106d96f0d5ec63fe61","observation_id":"cc072def-b9ec-4f42-bd4c-f70984df4af5","resolution":{"observed_at":"2026-05-16T05:59:50.976241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T05:02:24.509860Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-08T01:53:05.709859Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.509860Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6bd8e23c529cdae7660b41110c5f5d1d8d8d5cf6601457cdfa0972928db8765d","observation_id":"d32b479c-3c7f-4f03-9026-72d988877b7b","resolution":{"observed_at":"2026-08-06T05:02:24.509860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:51:29.678062Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.678062Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:b374ae91d624a1246d5430ecc82833a7b2b79dbbf3af896c8359acf4083cb535","observation_id":"f7251430-0160-4158-b836-a7496021ba59","resolution":{"observed_at":"2026-08-06T00:51:29.678062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:01:17.525381Z","title":"In AAAI, volume 39, 15567–15575","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-06T10:35:42.926353Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:01:17.525381Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04416"},"observation_digest":"sha256:2b7f6b3db0dd7bdbd559447aa912ec715a01d1e163f2ea585c1fe224b8fb2a08","observation_id":"0fc7d1e3-6c86-42ca-a4ee-6686936fc6ae","resolution":{"observed_at":"2026-08-06T00:01:17.525381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:04:54.793915Z","title":"In AAAI, volume 39, 15567–15575","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04418","last_updated":"2025-08-06T13:05:09Z","snapshot_observed_at":"2026-08-07T15:28:01.237780Z","submitted_at":"2025-08-06T13:05:09Z","title":"Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:04:54.793915Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04418"},"observation_digest":"sha256:28098c739ae5adadd1a7b9cdf4065bef4f0ea7a441150666411c4e70a9ea3e2c","observation_id":"22662b78-6232-4296-82c8-475b2160c9ad","resolution":{"observed_at":"2026-08-06T00:04:54.793915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T23:32:18.136571Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-06T10:35:41.875223Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.136571Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:b002206f0d46d1383a2daea7d49285dbdd4286f2d9af61c2d5ec3baf7130f763","observation_id":"9463a595-eb51-4039-85fc-e466eb461fa9","resolution":{"observed_at":"2026-08-05T23:32:18.136571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T17:57:32.271114Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15429","last_updated":"2025-08-21T10:30:01Z","snapshot_observed_at":"2026-08-07T06:19:10.166447Z","submitted_at":"2025-08-21T10:30:01Z","title":"AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:57:32.271114Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.15429"},"observation_digest":"sha256:0dd6de199f5d136989cc0f100a853bd870406fd2374e77da00859c4f1170833f","observation_id":"4d40ba64-a9e4-4823-8020-9045121195db","resolution":{"observed_at":"2026-08-05T17:57:32.271114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T11:17:54.443943Z","title":"Beats: Au- dio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02969","last_updated":"2025-09-03T03:14:23Z","snapshot_observed_at":"2026-08-06T10:35:44.561005Z","submitted_at":"2025-09-03T03:14:23Z","title":"VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:17:54.443943Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2509.02969"},"observation_digest":"sha256:82f6be5ff41c0f7700e243f478439697ee1e72f3c6579946f4ab2a1979b7e61f","observation_id":"88a4edce-cff7-4396-89c3-402c0ff4e7df","resolution":{"observed_at":"2026-08-05T11:17:54.443943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-04T11:29:30.654795Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.654795Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:596b3d0c85fb503c0a6c913c9d620aaf6ab908037c6b526b0573d3947b49244a","observation_id":"be8b3450-5551-4e9d-97c3-ecd45d3e549a","resolution":{"observed_at":"2026-08-04T11:29:30.654795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-04T00:29:45.976102Z","title":"Beats: Audio pre-training with acoustic tokenizers, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05550","last_updated":"2026-05-26T23:40:49Z","snapshot_observed_at":"2026-08-05T14:57:28.629677Z","submitted_at":"2025-11-02T18:08:26Z","title":"Assessing Factual Music Comprehension in Large Audio Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T00:29:45.976102Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2511.05550"},"observation_digest":"sha256:c26906f216775a8ed25563092917e9d9fd417dbd3ecaabbec580962fb5e36531","observation_id":"dc38e2c6-390a-4c8f-b3a3-9680f939ff1f","resolution":{"observed_at":"2026-08-04T00:29:45.976102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T21:42:47.142235Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-06T18:33:53.894178Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:47.142235Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:bdddb2d81fd9c0826d7007f39836dd0ecbe3dd88f5e826ce939b23aaf07dfae1","observation_id":"560dcc23-698d-4244-813f-07ce1600afe7","resolution":{"observed_at":"2026-08-03T21:42:47.142235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T17:16:36.790900Z","title":"Beats: Audio pre- training with acoustic tokenizers.arXiv:2212.09058, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:36.790900Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:63e6a7b3b1caeeab209da0bed2d76d3bdbdd3bccaa6de547f32795815fc4c5dc","observation_id":"3e716b4b-02e4-436e-8cbf-b5b1995e2786","resolution":{"observed_at":"2026-08-03T17:16:36.790900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T10:53:15.264765Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.08480","last_updated":"2026-06-30T06:17:39Z","snapshot_observed_at":"2026-08-07T22:08:02.763541Z","submitted_at":"2026-01-13T12:12:29Z","title":"Quantitative Analysis of Proxy Tasks for Anomalous Sound Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T10:53:15.264765Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2601.08480"},"observation_digest":"sha256:0c016d2eaf327bc6d982ed9a7d8b5f6c05b58586247ecd02ea17478bdf4dc918","observation_id":"0ee47b9f-1b44-48b2-b38b-b9af80c234d7","resolution":{"observed_at":"2026-08-03T10:53:15.264765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.06702","last_updated":"2026-04-08T05:42:03Z","snapshot_observed_at":"2026-07-06T22:55:06.424752Z","submitted_at":"2026-04-08T05:42:03Z","title":"ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:30:30.431777Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.06702"},"observation_digest":"sha256:d8af81f8869eaa4da8eae261db7407d19ee632cbf033b8f7183a9f1100acdccf","observation_id":"e8c87b1f-9aa7-4e45-826a-1b53a4dda16e","resolution":{"observed_at":"2026-05-11T00:30:50.864486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.14129","last_updated":"2026-04-15T17:51:28Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:51:28Z","title":"Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:57:47.356373Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.14129"},"observation_digest":"sha256:6082190ae639afb7ff141f319a02503b035ae0f7bd7436360a6bedfec5c3728b","observation_id":"f0e867ad-df14-4bcb-a331-78aa73ff8341","resolution":{"observed_at":"2026-05-10T14:00:28.946896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.15849","last_updated":"2026-04-17T08:57:44Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:57:44Z","title":"TinyMU: A Compact Audio-Language Model for Music Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T08:17:23.740979Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.15849"},"observation_digest":"sha256:1d33b2c46e33e15434d6c4594df817163f8081d445706a99814f01ac38f1939b","observation_id":"bc82c1a8-7dd8-41eb-ae7c-23fcade130d1","resolution":{"observed_at":"2026-05-10T08:17:36.935059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.15929","last_updated":"2026-05-18T12:22:43Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:39:01Z","title":"MUSCAT: MUltilingual, SCientific ConversATion Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:22.200577Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.15929"},"observation_digest":"sha256:20aaa130b2955f7d04260ad4041e1030844eefdd2464518c1b4d3f8d9aa33fd8","observation_id":"b07ddca6-efdf-41f7-bd4e-e639700fdbb5","resolution":{"observed_at":"2026-05-10T09:23:37.191807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.15929","last_updated":"2026-05-18T12:22:43Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:39:01Z","title":"MUSCAT: MUltilingual, SCientific ConversATion Benchmark","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T00:45:01.115573Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.15929"},"observation_digest":"sha256:24ba4faa53571526e05c04f08dc0232d40c2855663a701fafe5039a97c32b8e1","observation_id":"a0570288-70ac-4bfc-8f51-75240f384f19","resolution":{"observed_at":"2026-05-21T00:49:19.547770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.18460","last_updated":"2026-04-20T16:16:36Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T16:16:36Z","title":"Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective","version":1},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-05-10T04:32:29.428080Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.18460"},"observation_digest":"sha256:3a59adf854a01cf5229067b708ed516a7a22e5e48a9ff8957057ed594ef79990","observation_id":"c413f0d0-e26d-49e0-803b-013725d60ad6","resolution":{"observed_at":"2026-05-11T11:51:03.124351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2605.06357","last_updated":"2026-05-07T14:35:04Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:35:04Z","title":"Memory Efficient Full-gradient Attacks (MEFA) Framework for Adversarial Defense Evaluations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:53:11.185208Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2605.06357"},"observation_digest":"sha256:dac89104525b7c189f06c4b871ba209d521e2c53f316d218aa92975e3564df86","observation_id":"5721e150-1e14-4978-a682-d84a42bec402","resolution":{"observed_at":"2026-05-11T19:01:18.489162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2605.13672","last_updated":"2026-05-13T15:32:57Z","snapshot_observed_at":"2026-08-02T22:33:46.962628Z","submitted_at":"2026-05-13T15:32:57Z","title":"SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:49.239866Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2605.13672"},"observation_digest":"sha256:e4760ea7b575c0e4cac9fd7d534abbc2dc86675e25652dbad933738b977ef67a","observation_id":"137c5f66-8d64-444b-85bf-8641c9512bbe","resolution":{"observed_at":"2026-05-14T20:32:57.059110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2605.26641","last_updated":"2026-05-26T07:26:23Z","snapshot_observed_at":"2026-08-06T17:24:19.284916Z","submitted_at":"2026-05-26T07:26:23Z","title":"OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T18:08:50.574960Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2605.26641"},"observation_digest":"sha256:e7a9d4f3d666845e714baa1204e27e8078867450441ab4aff2e4795b1427632a","observation_id":"bd003016-04bf-488f-a810-4d272627b8f3","resolution":{"observed_at":"2026-06-29T18:13:48.563590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2606.03821","last_updated":"2026-06-30T13:17:03Z","snapshot_observed_at":"2026-08-01T16:26:57.690975Z","submitted_at":"2026-06-02T16:01:22Z","title":"Finding Needles in the Haystack: Transductive Active Labeling in Ecology","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T10:52:23.274642Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2606.03821"},"observation_digest":"sha256:ad72679c86bfe80b6b2de8eab34ebc93211dc61378639af1ddee8e8e565673e7","observation_id":"87328366-cfcc-4fad-a0ae-6cf828e5d1b3","resolution":{"observed_at":"2026-07-02T02:26:27.405444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2606.03821","last_updated":"2026-06-30T13:17:03Z","snapshot_observed_at":"2026-08-01T16:26:57.690975Z","submitted_at":"2026-06-02T16:01:22Z","title":"Finding Needles in the Haystack: Transductive Active Labeling in Ecology","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T07:48:01.274555Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2606.03821"},"observation_digest":"sha256:ee1f1f2d6850b16b21d65835263ed752e22b6072961f7e04282293f4b1587719","observation_id":"2dcc5b3f-0b7e-46cd-947b-6663208e311c","resolution":{"observed_at":"2026-07-01T07:55:31.231791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:dab265bb63c570aed43be745627be70a58364497d66ae99065d2252a5b0fcc85","observation_id":"f7a930f7-f2ed-43c5-8098-c40fa06e921e","resolution":{"observed_at":"2026-07-02T05:56:39.917414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-12T03:24:13.814557Z","title":"https://doi.org/10.48550/ arXiv.2212.09058, http://arxiv.org/abs/2212.09058, arXiv:2212.09058 [eess]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03304","last_updated":"2026-07-03T13:16:30Z","snapshot_observed_at":"2026-08-06T16:38:09.160220Z","submitted_at":"2026-07-03T13:16:30Z","title":"Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T03:24:13.814557Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.03304"},"observation_digest":"sha256:dbadf3938ce159b873207baf082e528fe4e9b7362e1ee8f85658171e27699941","observation_id":"e9834dc0-8da9-4b02-8df1-75ca93cd477b","resolution":{"observed_at":"2026-07-12T03:24:13.814557Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:ee7578eb19268591386a5f35012e7d191a12943ad7d93287636ea7fbe3486450","observation_id":"5ea85c91-d981-4e74-9f00-cad0e7b98f56","resolution":{"observed_at":"2026-07-08T00:04:22.467634Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2212.09058 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:3bc3697ac5a38a86b2de70e09513cf46c7d903d31cda738c35979b40f9e06924","observation_id":"fb69bebd-0691-40d1-99ec-d89a0164e2c9","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:041cf4877d36ec7db83bea1364c4efb81b745ad1bfdff40f94493d39bf312af4","observation_id":"35666e69-0923-4e17-9b60-173abe7283e8","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-02T02:03:37.761113Z","title":"Proceedings of the 40th","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14474","last_updated":"2026-07-16T01:37:39Z","snapshot_observed_at":"2026-08-07T23:10:02.408114Z","submitted_at":"2026-07-16T01:37:39Z","title":"Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T02:03:37.761113Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.14474"},"observation_digest":"sha256:999d26d36286f89edfe87bd84e18d66ff36dcb25b1b6f5a80193fed7e597c475","observation_id":"11f819c1-a7d3-476d-9f32-67771820b54c","resolution":{"observed_at":"2026-08-02T02:03:37.761113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-30T10:35:03.133791Z","title":"BEATs: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-08T02:35:10.036718Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T10:35:03.133791Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:d4b4f521ddf19a11cdbfb1b807e9dad4d65e73678939293e2e46813387a369a4","observation_id":"9b447bf8-04ab-4d19-b867-a62cfef7b3a3","resolution":{"observed_at":"2026-07-30T10:35:03.133791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T01:51:00.418732Z","title":"BEATs: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-08T02:35:10.036718Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.418732Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:366ed1ccbb490be10a8f8c717ff11af0d6beac50ae435da54bd49a5f3c4b3a4f","observation_id":"3cdad4a4-601b-452a-afb4-4458397ec441","resolution":{"observed_at":"2026-08-03T01:51:00.418732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T00:54:45.434431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00493","last_updated":"2026-08-01T07:32:54Z","snapshot_observed_at":"2026-08-08T02:53:16.735340Z","submitted_at":"2026-08-01T07:32:54Z","title":"Hidden-Domain Routing for All-Type Audio Deepfake Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:45.434431Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2608.00493"},"observation_digest":"sha256:7679cb6af1f266d3a13b84a963a01f19f0e652c31a166d75bf014269420f5939","observation_id":"6b1606f0-2d5d-4d48-9dd8-a5d38a722a5e","resolution":{"observed_at":"2026-08-05T00:54:45.434431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.09058/citation-record","integrity":"/paper/2212.09058/integrity","json":"/paper/2212.09058/citation-record.json","paper":"/paper/2212.09058"},"outbound":[],"paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2212.09058."}