{"as_of":"2026-08-07T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f21a9a263f2d4c05a2b2fb418a27a3f24f753bd959b732a573e70a0322f6cf19","coverage":[{"denominator":166,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T05:52:55.818877Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.00387/citation-record","integrity":"/paper/2607.00387/integrity","json":"/paper/2607.00387/citation-record.json","paper":"/paper/2607.00387"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.353261Z","title":"Deep learning","venue":null,"work_id":"a131ba06-e6ab-4eef-9f34-0104140eb416","year":2015},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:2808fe782ad6ce2afd8dec4fa0de89496073eeafba4c5f2896f6317cb149ad3c","observation_id":"15fb7307-b67c-45a7-a1d2-53679810ab05","resolution":{"observed_at":"2026-07-06T06:52:04.354732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.355342Z","title":"Deep learning for audio signal processing,","venue":null,"work_id":"4beee2de-f476-44f4-8a43-44ca5c13eb68","year":2019},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:fbed820d7424b96f0a40c15400e0d89a817cc7c1afc41fe180d10bc3dad3f306","observation_id":"b09b9182-b6bc-4a2d-bb4d-4c52cbef2beb","resolution":{"observed_at":"2026-07-06T06:52:04.356882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.256251Z","title":"Audio signal processing in the 21st century: The important outcomes of the past 25 years,","venue":null,"work_id":"fa67478b-ea5d-4c6c-a865-39cb8eb09c80","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:a9e246ef08b749b901f6753e7f77b6c15b8d23700e41cb91ef8357daef015cd8","observation_id":"5d8eb1d8-ca86-4937-9f54-136a52d8dde2","resolution":{"observed_at":"2026-07-06T06:52:04.257547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.219066Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"bc805b98-ffb6-4bb1-96cc-e743e51e409d","year":2017},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:57db7fede0414f53c456f45f7cdde2d6a9070facc96e4c9ccbd382fc447eb0a4","observation_id":"d54d9a1c-6fde-49e0-89a0-2fca90ccf7d1","resolution":{"observed_at":"2026-07-06T06:52:04.220665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08673","last_updated":"2024-08-19T07:11:39Z","snapshot_observed_at":"2026-07-06T19:01:32.237848Z","submitted_at":"2024-08-16T11:33:16Z","title":"MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection","version":2},"cited_work":{"arxiv_id":"2408.08673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08673","snapshot_observed_at":"2026-07-02T05:56:39.883392Z","title":"Mat-sed: A masked audio transformer with masked-reconstruction based pre- training for sound event detection,","venue":null,"work_id":"df0672ca-0ee5-4170-ad36-744b9abc1ecb","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2408.08673","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:5daf79d7ad6295fd3b776358640b478167f5ad09fdec4263746f6e33feafad26","observation_id":"f5a27b21-9c24-4a90-9855-b47d18d45180","resolution":{"observed_at":"2026-07-02T05:56:39.884944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.235563Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":"5ca3bb60-2484-4095-84a5-3ef88c174261","year":2026},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:cc4541b071a438f5ceb0f123b398263d68c7459c5cf90f8b4025d8e943c42d78","observation_id":"bc9d630a-b491-456a-bbe1-b662b2733a51","resolution":{"observed_at":"2026-07-06T06:52:04.237091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.357447Z","title":"Deep convolutional neural networks and data augmentation for environmental sound classification,","venue":null,"work_id":"100aaa01-3737-4ea0-8c86-982fc8117c2c","year":2017},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:886992b2312ea8bfea9ab48f64b6660720d68cedef78de525b39756ae2079971","observation_id":"d9698c30-4990-4f27-ad34-fff468b6eebb","resolution":{"observed_at":"2026-07-06T06:52:04.359039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02056","last_updated":"2025-03-12T00:25:08Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T22:05:36Z","title":"Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data","version":2},"cited_work":{"arxiv_id":"2410.02056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02056","snapshot_observed_at":"2026-07-02T05:56:39.880405Z","title":"Synthio: Augmenting small-scale audio classification datasets with synthetic data,","venue":null,"work_id":"930be338-97f0-4746-a833-ecd0657a0549","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2410.02056","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:7c4d74c5061501578f004e8e2d4cf1ede443f5420d83be05ce6c940708c973fe","observation_id":"1f28c6f7-96b4-4c15-93cf-7e9832a83473","resolution":{"observed_at":"2026-07-02T05:56:39.881972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":"1412.6572","doi":"10.48550/arxiv.1412.6572","metadata_source":"pith","pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explaining and Harnessing Adversarial Examples","venue":"stat.ML","work_id":"2cedf8f6-7539-4c49-8136-f42a20487146","year":2014},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:c716e81de7874b88be2c4161f23dff706312c3383e9b8d62b6282eabaaad70fc","observation_id":"c0593eb1-4fd6-4ead-8a07-8034fbfc99eb","resolution":{"observed_at":"2026-07-02T05:56:39.887680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":"1312.6199","doi":"10.48550/arxiv.1312.6199","metadata_source":"pith","pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Intriguing properties of neural networks","venue":"cs.CV","work_id":"7bcd9f41-780c-4b4b-9a08-830d4177cdd8","year":2013},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:377a8b36178384cd9039f4aae51a9bb4613e1928f0252b4caf0766ce90e6c830","observation_id":"f3e5354a-08f0-4a63-ba49-0c7f789b9133","resolution":{"observed_at":"2026-07-02T05:56:39.876297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":"1611.03530","doi":"10.48550/arxiv.1611.03530","metadata_source":"pith","pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding deep learning requires rethinking generalization","venue":"cs.LG","work_id":"b260f96a-16f6-4936-8f3b-440917a19b34","year":2016},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:21aaf0567891c1f3da32f1c94725e757514730131d189f61fbde5509d783f6c0","observation_id":"2ea35bd5-ebd5-4fd9-adea-31c56068fcaa","resolution":{"observed_at":"2026-07-02T05:56:39.922586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:49:49.910618+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:585ad36b1e99c78254dbfc49941273a7e3cdf29b51fbe33e1efe27dc1f55366a","observation_id":"d26ce9db-c44b-433a-8ffc-a124754bf397","resolution":{"observed_at":"2026-07-02T05:56:39.839281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-04T08:35:21.943076Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":"1904.08779","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-07-08T01:44:25.918448Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition","venue":"eess.AS","work_id":"85ab3db6-965f-4a9a-b1de-5b099126c87b","year":2019},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:8926829886cbafcf9aeb2f61ab8a8872a73cc2838acdfe0e4048854d6dba69ae","observation_id":"7c5a3410-c7d9-4c56-ae47-80359d2b001c","resolution":{"observed_at":"2026-07-02T05:56:39.865166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.366854Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"28ff674f-aa70-41ad-baac-3dbc3a8f758b","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:ee98f679bf3013932745b95161bb17882d0fce282573d3648b06c757c83adef4","observation_id":"9db5be48-9abe-4f4d-a24f-f9960962f9f0","resolution":{"observed_at":"2026-07-06T06:52:04.370879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:37:35.025367Z","title":"Musical genre classification of audio signals,","venue":null,"work_id":"fc3d75c9-62a1-456c-be87-e0592e99168e","year":2002},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:0684cd3f0470486366dc774338b137af22b963ae3ec9ac505133f46c0f312072","observation_id":"7e034ff8-c32f-4c80-a6c5-71d03422ef6f","resolution":{"observed_at":"2026-07-06T06:52:04.201772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.239830Z","title":"Dynamic attention-asymmetric perceptron network for overlapping sound event detection,","venue":null,"work_id":"92be520d-538a-463c-bd2c-6a960a0ce18c","year":2026},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:f7145ed83375492e6db9f04c64b5fc19778b29a92dd76af3117e89d4a36d78fa","observation_id":"c71a135f-dc0e-43d6-803c-67325fd54f4e","resolution":{"observed_at":"2026-07-06T06:52:04.241172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25955","last_updated":"2026-06-22T12:55:18Z","snapshot_observed_at":"2026-08-04T07:27:03.980917Z","submitted_at":"2025-10-29T20:53:12Z","title":"SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations","version":4},"cited_work":{"arxiv_id":"2510.25955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.25955","snapshot_observed_at":"2026-07-04T17:09:58.602413Z","title":"SPEAR: A unified ssl framework for learning speech and audio representations.arXiv preprint arXiv:2510.25955","venue":"eess.AS","work_id":"6b5f07c2-d4aa-4e2b-8435-70737f1335eb","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2510.25955","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:230387c50e645589ce1f9368d36574e4785b87050e6c9d11da37fa43bbf5f5f4","observation_id":"e3ba9944-2a80-4eff-95bd-156255123b72","resolution":{"observed_at":"2026-07-02T05:56:39.893677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":"2406.06992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-07-04T07:39:39.522452Z","title":"Available: https://arxiv.org/abs/2406.06992","venue":null,"work_id":"242887a0-7c46-4728-a65b-8627575db050","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:dfc17b57f2255e567a4dc751c89801bb7118376efb337d1e74216ebcd0a2ea21","observation_id":"fe046f72-72e3-4569-a496-4df20a5c0450","resolution":{"observed_at":"2026-07-02T05:56:39.845086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.170961Z","title":"A survey on contrastive self-supervised learning,","venue":null,"work_id":"ec504df8-fecb-41db-b314-d209b862a3e2","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:32003f1644082c2f3d1c085f5b2b3ce2073ffb47b4b48529f87e14573fa094e5","observation_id":"481eff0a-cddb-4d9e-84a4-70be59d97455","resolution":{"observed_at":"2026-07-06T06:52:04.172411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.301897Z","title":"Audio self-supervised learning: A survey","venue":null,"work_id":"bdebf7c0-605c-40a4-8309-10c8cd5e56c9","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:837c4c3e084d6536811fa59245db512cbeba169c610bcc051aec5fe97f8bb565","observation_id":"f1b9320e-9f57-4860-9cb3-00449f42f143","resolution":{"observed_at":"2026-07-06T06:52:04.223855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.233525Z","title":"Scaling bioacoustic signal pre-training with million samples via mask- modeling,","venue":null,"work_id":"5bfacb5b-aea4-4d12-aeee-3fd0ddd7a8fe","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:c42f23ce8797d22d87f6015942de5f35915dc6e67423aef1a4e09b59f87bdcd6","observation_id":"4a149a3f-1bf0-4a07-ad24-a4cf9d6518a0","resolution":{"observed_at":"2026-07-06T06:52:04.234892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T05:56:39.911990Z","title":"Hearsay benchmark: Do audio llms leak what they hear?","venue":null,"work_id":"27589ebd-1532-4e5c-b395-9e5f3097c0ac","year":2026},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:0ad70f9382e3b591bd0e4624c186a6e7cf4cac050ca3d372424b31f40f85115c","observation_id":"72e0138e-a7e1-4d02-b026-8ba09aaee080","resolution":{"observed_at":"2026-07-02T05:56:39.913510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.177770Z","title":"A survey on self-supervised learning: Algorithms, applications, and future trends","venue":null,"work_id":"6084f89d-c10c-4754-9175-52f8c745340a","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:bc1885c8bd73eb49ba719393690f768f24a5ef6af9005ed02c3fbf51f4d7f99b","observation_id":"81fd931b-6c9f-4d44-942a-f7d388e79ac4","resolution":{"observed_at":"2026-07-06T06:52:04.180032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.296267Z","title":"Self-supervised speech representation learning: A review","venue":null,"work_id":"2490870d-7d5c-4794-a031-fd48af7be202","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:b35d74acaced31aec0c7b77b3806c8cbb09729a5a99c2b5e7d6d8041ec83d6b9","observation_id":"347f6342-5f94-4917-9acb-daf95f526d97","resolution":{"observed_at":"2026-07-06T06:52:04.156645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.169104Z","title":"Ssast: Self- supervised audio spectrogram transformer,","venue":null,"work_id":"80ed7733-3f17-4ec6-a1c6-63f58a467e94","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:0874bb1b71b9281c7fbb2a77bb9c5130f68d5ebade913bf9bb57307b80703496","observation_id":"22ebae97-e555-4fdd-88c2-754292e57721","resolution":{"observed_at":"2026-07-06T06:52:04.170725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.246118Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"6bf93f51-80ad-436d-9467-dc1a45bda9a7","year":2018},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:3dbe826df2ead8639e29dc8f982f15ba8f6c58b9ed6c8709780096a86d625cde","observation_id":"84be8aab-8c1e-49b8-8a5a-32cf5c7c9888","resolution":{"observed_at":"2026-07-06T06:52:04.247623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.252369Z","title":"Unsupervised representation learning by predicting image rotations,","venue":null,"work_id":"fdacd6f1-7adb-4df8-b0a2-2f40f51f2b55","year":2018},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:15b623725c07e4932851c14d8ae52528a0d0f3635eb348b97fed1fe843783c0b","observation_id":"0bd43875-1f31-4841-88c4-bd1ee41e19b3","resolution":{"observed_at":"2026-07-06T06:52:04.253621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.226862Z","title":"Unsupervised learning of visual representa- tions by solving jigsaw puzzles,","venue":null,"work_id":"beab74a5-2b64-455c-8d72-fb4128d9df3e","year":2016},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:f68882460a2303d0d7489abf23a6a243b7efc0d63c9f1d76df12f9ef25b462e0","observation_id":"e9dad6be-bad1-42f4-9e46-3f2e68bad82b","resolution":{"observed_at":"2026-07-06T06:52:04.228459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.426180Z","title":"A simple frame- work for contrastive learning of visual representations,","venue":null,"work_id":"784851a5-5526-431f-9f90-1d3b91d9a77e","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:d5799fc66f7544c420d0a62f294b78c15c39adb3df5afaf96b0b9c821b25985f","observation_id":"21ce1088-e49d-4434-96c7-172ec12c59b3","resolution":{"observed_at":"2026-07-06T06:52:04.428012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.423746Z","title":"Contrastive learning of general-purpose audio representations","venue":null,"work_id":"12e7da56-2e59-4509-bff5-8def17ca3e08","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:92643ea69a6eb09ed624bb93ab51124afa7d78ec11541cc247b468a6f15b6f50","observation_id":"7ffbe064-3445-4cc0-9618-82661c251fa2","resolution":{"observed_at":"2026-07-06T06:52:04.425492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:32:48.038151Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"23a19f52-833f-4385-a893-cba047433888","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:336840a65ee7764ad3f494b1a045dfd28a98f7fa79dc48fa605a4f70cc5dee0e","observation_id":"e94cc65b-c540-4630-8523-ea79a20a5e46","resolution":{"observed_at":"2026-07-06T06:52:04.430050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.439842Z","title":"Masked autoencoders that listen,","venue":null,"work_id":"3d4d9565-8cea-439a-bf21-dcb03033dda4","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:29a185d4018ff794ceeccb39e89d2d0c03916b0c735831669286fd17dc3a1a2b","observation_id":"be3db07c-2e93-427c-b69e-798f0e3653a7","resolution":{"observed_at":"2026-07-06T06:52:04.441242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.359698Z","title":"Masked spectrogram prediction for self-supervised audio pre-training,","venue":null,"work_id":"d712e104-4924-4841-b34e-1e4b0b6b56fc","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:534defbbece4fd44ce353d9ff7956438465a82971e7fa4455dd06b3cdc470712","observation_id":"ec4b0e66-dafe-453b-bfad-19c16677cfa4","resolution":{"observed_at":"2026-07-06T06:52:04.361149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.453353Z","title":"Recent advances in discrete speech tokens: A review","venue":null,"work_id":"3289dae4-4591-40df-8a83-76ebb63b1571","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:099213949897953139a2b553618f974bdadf99f1b822071278f69bcd54cc7ffd","observation_id":"7447cbed-c823-463c-8491-8f2ee74bfad9","resolution":{"observed_at":"2026-07-06T06:52:04.454836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-06T10:35:16.608201Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:7099b7ab1d922d998f69bd85143f1da0adc31d36e49bcbe8c110c6013325a6d7","observation_id":"f7a930f7-f2ed-43c5-8098-c40fa06e921e","resolution":{"observed_at":"2026-07-02T05:56:39.917414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.413425Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"99146768-67ff-45d4-bd08-95dde9f34cbb","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:929967ada995c4711b6a5eac0909a14206c5d6db2e771194ce2af5491f136eed","observation_id":"c37c3c9a-4f24-469b-9b7d-13e2f7b3faf3","resolution":{"observed_at":"2026-07-06T06:52:04.415039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.450876Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text,","venue":null,"work_id":"bb8d5b9b-afe8-4498-b87a-946ddc4905f7","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:e0eb20894c49315e921436af65f8ddeb7f4dd3b89bfd8434cc0312b11303fa1d","observation_id":"4de403c4-307c-4cdc-9964-1f5a62be1a00","resolution":{"observed_at":"2026-07-06T06:52:04.452408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.441815Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"97533604-21c1-45de-8142-1105b889afa7","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:fcc9a8e2f2b6ae2360b66f6f900127946c9315e668483e01614c513c8fe5c020","observation_id":"e32121c7-b816-4b15-a5be-086d5824a4ef","resolution":{"observed_at":"2026-07-06T06:52:04.443320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.405343Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"2b9e5e20-765e-4b16-8454-55fbb2a9f201","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:333413c3350674dec69d446ef6a1c5b58af77a7d8b78f61e23f117f3276c5eba","observation_id":"e99942a6-4d46-4b9d-9083-5efb883c2094","resolution":{"observed_at":"2026-07-06T06:52:04.407150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.435575Z","title":"Pre-training audio representations with self-supervision,","venue":null,"work_id":"7f1fb780-053e-4d24-9258-e11479568153","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:e06d7bfe0fe25b126e8704c3d1fa25e70e44e36e3e92115cf518e4859f99f8fc","observation_id":"f5d8c9f3-b88a-4343-96dc-dc6752ba8468","resolution":{"observed_at":"2026-07-06T06:52:04.437006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.437724Z","title":"Shuffle and learn: unsupervised learning using temporal order verification,","venue":null,"work_id":"062bfbf0-1c6c-49d5-9edb-fe2da5af50f5","year":2016},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:b894217dacbb00eb9a58cfa87e29ae01cbbdecc2a030cd2a97ce4d2db12e2ec6","observation_id":"94c3c24e-d8b9-4854-abb9-db81a73bc0cb","resolution":{"observed_at":"2026-07-06T06:52:04.439193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.398707Z","title":"Self-supervised learning of audio representations from permutations with differentiable ranking,","venue":null,"work_id":"1bced52d-d979-4b38-979d-498172bf1016","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:c1385cc0946d87bdbc07e8f80d454bd8f0829ec6d2fd7f0c7ba5be89cf30c867","observation_id":"950485b2-41d6-4fe1-83b8-9a37ce1cdcdf","resolution":{"observed_at":"2026-07-06T06:52:04.400585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03416","last_updated":"2019-04-06T10:51:25Z","snapshot_observed_at":"2026-07-06T07:44:19.552249Z","submitted_at":"2019-04-06T10:51:25Z","title":"Learning Problem-agnostic Speech Representations from Multiple Self-supervised Tasks","version":1},"cited_work":{"arxiv_id":"1904.03416","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.03416","snapshot_observed_at":"2026-07-02T05:56:39.894926Z","title":"Learning Problem-agnostic Speech Representations from Multiple Self-supervised Tasks","venue":"cs.LG","work_id":"9044e9a6-a899-4b23-aeaa-2a5e9f74381c","year":2019},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1904.03416","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:a76d0d737ee32c9e38569b861603710b76f697e150e05adee28e5a1218071201","observation_id":"2e338edc-21fc-4abc-9e48-9aeed74f2cd7","resolution":{"observed_at":"2026-07-02T05:56:39.896395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.402397Z","title":"Multi-task self-supervised learning for robust speech recognition,","venue":null,"work_id":"2f9c258d-caca-42d5-8598-fdc175f67ec8","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:5553e1e6ee865197851b692d5c69483e64906692748e133433b63ecc5b4333b4","observation_id":"539ae367-2a03-44ff-b666-3652f12aa5f4","resolution":{"observed_at":"2026-07-06T06:52:04.404619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.384627Z","title":"Clar: Contrastive learning of auditory representations,","venue":null,"work_id":"c7161ab0-d142-476c-b656-e6da275fb0c7","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:38cf355ffdcffb9bea99d89796010fe7a416d166f3a93f139b002689b153bdd5","observation_id":"c2f634c1-db28-4357-94bc-91db13fe66b9","resolution":{"observed_at":"2026-07-06T06:52:04.386271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.391581Z","title":"Byol for audio: Exploring pre-trained general-purpose audio repre- 22 sentations,","venue":null,"work_id":"7471e90b-38c8-4432-b6de-35031bcf8bb0","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:98896ec8304ee217262b513510ef27f730d12752fdfd2e255ce9c699e0c8cb77","observation_id":"f331f772-8796-44e9-9838-cb4b07a675d5","resolution":{"observed_at":"2026-07-06T06:52:04.393585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:00e8078a24832f105c83d7563abcf8b95e1f0d558311bfb7e22865a7018c2d27","observation_id":"e4679cb1-8c95-49ee-a2be-dcbcd1130fe5","resolution":{"observed_at":"2026-07-02T05:56:39.898991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.446271Z","title":"Byol for audio: Self-supervised learning for general-purpose audio representation,","venue":null,"work_id":"f22bf4e7-4749-43b1-bed5-b49ae15325bf","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:dcfe5c59f31b984c4379055b70549fea8e93b74eb2ef6e519e492abb808943c1","observation_id":"39855e98-1e4a-4296-814b-5edd9143696e","resolution":{"observed_at":"2026-07-06T06:52:04.447668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03240","last_updated":"2019-06-19T03:27:39Z","snapshot_observed_at":"2026-08-04T14:17:33.504498Z","submitted_at":"2019-04-05T19:04:19Z","title":"An Unsupervised Autoregressive Model for Speech Representation Learning","version":2},"cited_work":{"arxiv_id":"1904.03240","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.03240","snapshot_observed_at":"2026-07-02T05:56:39.907902Z","title":"An Unsupervised Autoregressive Model for Speech Representation Learning","venue":"cs.CL","work_id":"2722c623-65c2-4534-b39e-832de2551244","year":2019},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1904.03240","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:3135cb069efb8972c7c02de20af1db230e03dc3c35640c57874f93eb52d42079","observation_id":"c28c2cd5-21e4-4a01-bcb2-a7bed13bdfa9","resolution":{"observed_at":"2026-07-02T05:56:39.910790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.382126Z","title":"Mockingjay: Unsupervised speech representation learning with deep bidirectional transformer encoders,","venue":null,"work_id":"a3f2ca0f-5b8a-40cb-a608-63c84bc97d8b","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:fc7ced060c54f832b07e09923269c4093ada55fd16dbf458435723ed232e93b0","observation_id":"4526c40a-3467-4301-b3a9-b326e4f8b846","resolution":{"observed_at":"2026-07-06T06:52:04.383858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.407885Z","title":"Audio albert: A lite bert for self-supervised learning of audio representation,","venue":null,"work_id":"f180cde6-2653-42ff-b4fe-59212bc36bdc","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:9e5eb03c252fdcfdb995d18ef87270d6cb46f92ff274d303fa3597fbcae5d2c6","observation_id":"8ab2afd9-9ca3-4e50-acd4-93ffb9e8f98d","resolution":{"observed_at":"2026-07-06T06:52:04.409863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.243741Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":"ebf73eaf-8c83-44e5-b1eb-a956b7fd9ded","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:7aae5e9b95c6bf9c39e5a23e4996e48bcd91131f758f3dcbcba15af509335696","observation_id":"5e014b4c-f80e-49d0-b73c-8c65e9531226","resolution":{"observed_at":"2026-07-06T06:52:04.417838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:ba942e2b551c439650105860571fc65defc36cb3c997f0b9dd54bb841663c521","observation_id":"418d0736-613b-4ee4-98d4-f3e77d558404","resolution":{"observed_at":"2026-07-02T05:56:39.856520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.455557Z","title":"w2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":"6a2a35b9-d75a-4ec3-b15f-475b81a72704","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:72e16dd7f00f7dc6649e6cb81d4db0f860b10f86b481a8ec5b0ed2934cc13de4","observation_id":"184b1b0b-25c5-4db5-84e2-06b255d85cd3","resolution":{"observed_at":"2026-07-06T06:52:04.457041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.918403Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing","venue":null,"work_id":"2520f0fc-fb5e-4d3d-bd23-a4d85fc4a9ec","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:837874748747d894df4a50ab1719702cc71b994ce3a131d641e611d378b91a81","observation_id":"8671d9b6-11af-48d1-9654-13eb951fece5","resolution":{"observed_at":"2026-07-06T06:52:04.366138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10274","doi":"10.48550/arxiv.2506.10274","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Discrete audio tokens: More than a survey!","venue":"ArXiv.org","work_id":"c89ef171-a1ea-49a1-8800-b9d5ef2dc175","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:91caeaf3fd1e6c0173b3189345a4b4e7941d981356a7053ce6a83fcba6d83726","observation_id":"7a747007-214b-4571-a80e-cf14747836e4","resolution":{"observed_at":"2026-07-02T05:56:39.932308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.371511Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":"a9a2c42e-042a-469e-bab6-834c2da394be","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:d2acc87cca571cd55ffc9cd00f9237ecb896baf0560744d938058a45f6b686cd","observation_id":"c58dfbec-4b83-49b6-89fb-1b284891cad0","resolution":{"observed_at":"2026-07-06T06:52:04.373133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03497","last_updated":"2024-01-07T14:31:27Z","snapshot_observed_at":"2026-08-06T11:45:23.129204Z","submitted_at":"2024-01-07T14:31:27Z","title":"EAT: Self-Supervised Pre-Training with Efficient Audio Transformer","version":1},"cited_work":{"arxiv_id":"2401.03497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.03497","snapshot_observed_at":"2026-07-02T05:56:39.914751Z","title":"Eat: Self-supervised pre-training with efficient audio transformer","venue":null,"work_id":"b148e0b8-0dd6-4966-aa02-8ce405d2f959","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2401.03497","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:6c8a41d99e9eeff220534a44766d4c13fc6fbbfad29e48864739aa568df07150","observation_id":"afd95574-7c8f-41cb-a244-7bbfc574dbc3","resolution":{"observed_at":"2026-07-02T05:56:39.916640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.361880Z","title":"Look, listen and learn","venue":null,"work_id":"1dd84f81-ee03-413e-ab98-c36a40d12f57","year":2017},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:d157a851ea30b9a3a1d9d4f412a42adaf24a3fc35d037bd6acea384bb4566bbf","observation_id":"9d8dd83f-1272-4b98-b238-0291ef7e9ef2","resolution":{"observed_at":"2026-07-06T06:52:04.363660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.373718Z","title":"Soundnet: Learning sound representations from unlabeled video,","venue":null,"work_id":"75b2e6d0-15e8-4c1b-b16c-7e0fb3b2815b","year":2016},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:b8dba16812e27b5988b9bb3363715f19aa4f1171393811e6a4de5131ac8128a0","observation_id":"b0f5883d-5eb2-45b7-9102-60fa7b250c75","resolution":{"observed_at":"2026-07-06T06:52:04.376544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.349088Z","title":"Robust audio-visual in- stance discrimination,","venue":null,"work_id":"52688590-0c5e-4456-b2ab-c1c5dcb8b91b","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:2c23d862a85785b602121c061380b05bf73b65807e02cc5c324d1046ecdc0c92","observation_id":"e4c916b3-53db-4971-a3ad-ddf3decbcb74","resolution":{"observed_at":"2026-07-06T06:52:04.350626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.214447Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"b404a654-6df8-44e1-bb9e-ae60978347eb","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:cfc3ce8ea557129f13ec6a1eefe8eadcfb0cfd774926eca2e86211318982be58","observation_id":"4b9c210a-1092-4f56-b8dc-72802efc662c","resolution":{"observed_at":"2026-07-06T06:52:04.217968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.346662Z","title":"Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,","venue":null,"work_id":"e76c6b9b-5896-4847-9ef3-5cf8f6a1e249","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:8e2aa06c537abfb5783f4d5d4025c746e127da0e45316973362ce8e0e8b2e6f4","observation_id":"ab04c334-86a2-4bfd-ba50-c9208a35e265","resolution":{"observed_at":"2026-07-06T06:52:04.348438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02178","last_updated":"2024-06-07T18:41:28Z","snapshot_observed_at":"2026-07-06T18:25:05.750197Z","submitted_at":"2024-06-04T10:19:14Z","title":"Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations","version":2},"cited_work":{"arxiv_id":"2406.02178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02178","snapshot_observed_at":"2026-07-02T05:56:39.796140Z","title":"Audio mamba: Selective state spaces for self- supervised audio representations,","venue":null,"work_id":"04a728f0-bccc-496c-9b05-ce55c97ad429","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2406.02178","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:3686f0c9cfb6150941182c5211c617c4240f5824d78c9c512f1b1a8b709f6914","observation_id":"7d8c8085-3369-4f67-a2a9-ff65d861caf5","resolution":{"observed_at":"2026-07-02T05:56:39.798062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11831","last_updated":"2025-02-04T22:29:08Z","snapshot_observed_at":"2026-07-06T18:16:37.476614Z","submitted_at":"2024-05-20T06:58:47Z","title":"SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model","version":2},"cited_work":{"arxiv_id":"2405.11831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.11831","snapshot_observed_at":"2026-07-02T05:56:39.813240Z","title":"SSAMBA: Self- supervised audio representation learning with mamba state space model","venue":null,"work_id":"b171171c-b2b0-4ce7-a0a6-fad136f882f4","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2405.11831","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:ac67ee0596747f332603d33adca0ac01eeccdb3e7cdabd0e9378a54e7ff24fe5","observation_id":"f73f66d7-732d-4d73-a7eb-0f6c06f869d7","resolution":{"observed_at":"2026-07-02T05:56:39.815085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.351268Z","title":"Mamba in speech: Towards an alternative to self-attention,","venue":null,"work_id":"0191bf9f-04cf-482b-b0f4-a5ccecd8b06f","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:85b8d6c6cd9da4ba7651d576a49fb96816312e1ca812f0be3634f52ec2425839","observation_id":"f5ab6965-481c-4113-8987-115d97b9ebb1","resolution":{"observed_at":"2026-07-06T06:52:04.352668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.195066Z","title":"xlstm: Extended long short-term memory,","venue":null,"work_id":"50b3b0e9-a760-4d35-973f-2d13f743ee76","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:8080b6c610abe9ae356594bd070d0e57441c45042546708243c2e5ea84cbf3e7","observation_id":"5c283c3e-87ff-46fc-9488-c38df3c319e1","resolution":{"observed_at":"2026-07-06T06:52:04.198951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16568","last_updated":"2025-08-19T08:24:41Z","snapshot_observed_at":"2026-07-06T19:07:42.360338Z","submitted_at":"2024-08-29T14:35:56Z","title":"AxLSTMs: learning self-supervised audio representations with xLSTMs","version":4},"cited_work":{"arxiv_id":"2408.16568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.16568","snapshot_observed_at":"2026-07-02T05:56:39.836270Z","title":"Axlstms: learning self-supervised audio representations with xlstms,","venue":null,"work_id":"3c31dc37-e4e3-41d3-8079-9c531e1c0aa2","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2408.16568","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:bd05bb8de4ec816bf11f139f3ec9d6de5a661ec79ffc2ff365c4e6ae45ce4794","observation_id":"8ba750ba-0085-46ab-a873-33fd755affa7","resolution":{"observed_at":"2026-07-02T05:56:39.837872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.410613Z","title":"Tera: Self-supervised learning of transformer encoder representation for speech","venue":null,"work_id":"88e9d865-a068-490f-9e91-52b5810cacbc","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:41546b2c571db318d528ec7000908d9d751b3c3a0dcc8cd7847e224ab926a463","observation_id":"03da306f-1914-42f7-991a-538d5156499a","resolution":{"observed_at":"2026-07-06T06:52:04.412584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-03T23:00:35.904734Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:55e0b5db8c8b0e251bbd355559de09d515149af843488483158124687f1c92d9","observation_id":"8376e35f-5aeb-4bfc-aea8-66cf16962f44","resolution":{"observed_at":"2026-07-02T05:56:39.820388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03637","last_updated":"2026-05-14T08:51:32Z","snapshot_observed_at":"2026-08-05T08:01:55.575534Z","submitted_at":"2025-12-03T10:17:35Z","title":"AaSP: Aliasing-aware Self-Supervised Pre-Training for Audio Spectrogram Transformers","version":2},"cited_work":{"arxiv_id":"2512.03637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.03637","snapshot_observed_at":"2026-07-02T05:56:39.904373Z","title":"AaSP: Aliasing-aware Self-Supervised Pre-Training for Audio Spectrogram Transformers","venue":"cs.SD","work_id":"c367b690-d769-4e6e-b5c1-b3cc1ecaaa74","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2512.03637","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:091cddf74549514958bda6ca404c8a388bd1fff0ae8743e3df95bf7ad537a034","observation_id":"8d77ddb9-f659-4438-ba77-924dbc38be1f","resolution":{"observed_at":"2026-07-02T05:56:39.906436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.433239Z","title":"Bigssl: Exploring the frontier of large-scale semi-supervised learning for automatic speech recognition,","venue":null,"work_id":"a39a6297-b1f4-4053-b035-ff4c54bbe2a4","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:4e56d400ee5a75ceff52757de62b6298eb12e7547d700c77a1e1a9865118c808","observation_id":"4ca4d881-c727-4479-a123-a09b332b838b","resolution":{"observed_at":"2026-07-06T06:52:04.434677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18281","last_updated":"2023-05-29T17:53:04Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:53:04Z","title":"HyperConformer: Multi-head HyperMixer for Efficient Speech Recognition","version":1},"cited_work":{"arxiv_id":"2305.18281","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18281","snapshot_observed_at":"2026-07-02T05:56:39.810339Z","title":"Hypercon- former: Multi-head hypermixer for efficient speech recognition,","venue":null,"work_id":"51159f36-dbcc-4431-b0b9-3bf36e0d9e8d","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2305.18281","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:84bfc6e5ff9b6e729bbe9788dcb56804cbdefb5b3f3b4fe2dd85a4d03f20a267","observation_id":"880f7438-026d-4164-9e5e-bd9f6409e7a1","resolution":{"observed_at":"2026-07-02T05:56:39.812037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.341656Z","title":"Branchformer: Parallel mlp-attention architectures to capture local and global context for speech recognition and understanding,","venue":null,"work_id":"8422a2a5-c774-4887-8de3-523415ee07d6","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:4145e99908b42c172946cf70902b007a700a3586c840f7962f3d67b48a373593","observation_id":"33e22351-0061-4fd2-9fa8-035764780e79","resolution":{"observed_at":"2026-07-06T06:52:04.343513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.334542Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":"f548b836-7e35-4d87-a92e-494349bca9b4","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:e0f9b544058d58341046ba4d179462190fce9e807bdead8745c712a0c954c49d","observation_id":"55f5ba7c-e139-448d-aa7a-3c92c36ddc1b","resolution":{"observed_at":"2026-07-06T06:52:04.336962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":"2310.11230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-07-02T05:56:39.900954Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":"ef2e444f-839f-4725-aa60-cbef599dfc5d","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:3d0f3db51fee4b33acc93bb4137eba46bd8b003e697d071f678e1824a6eae45c","observation_id":"b2610e2d-264d-4edb-aa02-8b362b035575","resolution":{"observed_at":"2026-07-02T05:56:39.902887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.266575Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":"b273520d-69a6-469b-bcc5-ac5e0d1e19cc","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:c99922c24b4384b8ce38fe064b626f5983b50aa14640c04dbad1930ac7e93831","observation_id":"370cd1fc-f671-4e2f-a54f-28e9d9802468","resolution":{"observed_at":"2026-07-06T06:52:04.267939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.330257Z","title":"Joint semantic knowl- edge distillation and masked acoustic modeling for full-band speech restoration with improved intelligibility,","venue":null,"work_id":"7dbb6835-5730-4701-ab3b-04844f39ad16","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:3f678436e369550537b8daf144ff3434feccdf2bc632b76398afe41182b05c9c","observation_id":"1231c773-ab75-4841-b562-f728bf34f504","resolution":{"observed_at":"2026-07-06T06:52:04.331578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.332193Z","title":"Distilhubert: Speech represen- tation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"ceebc5ac-5e45-4906-bb12-21a26d3410ff","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:a0e8a353df0a9a428c9e2bb80fb74a65a1efa18e9910e616764503377502951a","observation_id":"50d28ddc-3d53-4abd-90f2-5ecee7f34da7","resolution":{"observed_at":"2026-07-06T06:52:04.333547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.322459Z","title":"Skill: Similarity-aware knowledge distillation for speech self-supervised learning,","venue":null,"work_id":"88d58b70-777e-4a94-a8f7-aea304985011","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:d5af5f79eae4a0972ad2106dccab259855c8e1444e60696f2e5519a96aed8fd1","observation_id":"d88e755e-0abe-4657-ab26-18f59f406fc8","resolution":{"observed_at":"2026-07-06T06:52:04.323664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T10:42:17.200139Z","title":"Semanticodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":"bcc2414c-5692-45cf-a3e1-dd1e229f25ab","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:ad65ca4401afa3437407f78bee01121c6d453c7d47c245b4b5a3c7aa3d2ed320","observation_id":"de188346-7ff0-4192-880b-24806483e9be","resolution":{"observed_at":"2026-07-06T06:52:04.461040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-07-06T19:07:37.761860Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":"2408.16532","doi":"10.48550/arxiv.2408.16532","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":"arXiv (Cornell University)","work_id":"741e6211-2d3b-4919-9f16-69a36a37a1df","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:a5d767ea675a96bb71bce3b42a532148f9c29bcab003185ee7d5c9738162ff46","observation_id":"738c50fb-c616-4bae-9ec5-c8addfe11d27","resolution":{"observed_at":"2026-07-02T05:56:39.919713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-06T16:16:34.606158Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":"2306.00107","doi":"10.48550/arxiv.2306.00107","metadata_source":"pith","pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training","venue":"cs.SD","work_id":"8ca81655-3a26-4090-9e0e-9dd15160c862","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:5474856b047fb4c02c8d2f813d09e00abaccbc9850df37300473747f5f05e122","observation_id":"5fbd5ea8-fb63-4e40-b732-416492efbf74","resolution":{"observed_at":"2026-07-02T05:56:39.890564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.421129Z","title":"Codecfake-omni: A large-scale codec- based deepfake speech dataset,","venue":null,"work_id":"c47fc3a6-2497-4c5a-8e1b-1954f53ce6b5","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:84f0753856e8313b4b24824aa03bbe74f921373cfe705e7423421d06450ddc62","observation_id":"729e9ef5-03f7-422c-862e-e34ec139aba4","resolution":{"observed_at":"2026-07-06T06:52:04.422988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-06T16:58:49.935180Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":"2411.18803","doi":"10.48550/arxiv.2411.18803","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"E., and Li, J","venue":"arXiv (Cornell University)","work_id":"2c14cc98-5e4e-4345-bcff-84f8d27c040a","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:9aa178ede4625260be5cc0883c2b6f18fbd228a4ea8d03d10b189987b222a523","observation_id":"9bf6d11c-0b5f-4a07-9949-777d777b2bfd","resolution":{"observed_at":"2026-07-02T05:56:39.854827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.320576Z","title":"Fast- hubert: an efficient training framework for self-supervised speech representation learning,","venue":null,"work_id":"577490e3-5cc2-4e41-bf02-ff66b0948ae2","year":2023},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:66280e647291c532cc42793a91ef66f331176f84251cb3cee95a2bad18abc556","observation_id":"707f8a58-c63c-46b7-b60e-1c704da53897","resolution":{"observed_at":"2026-07-06T06:52:04.321801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.260051Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"ca5de544-f967-438d-aa10-7586da303229","year":2017},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:c898131ac181154ec9922522918c91c8c0735f06a0a6aa8b9f3deb509db7a474","observation_id":"81a34224-e9bc-45ea-9f3a-77d0da107583","resolution":{"observed_at":"2026-07-06T06:52:04.261383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:42.309750Z","title":"Long short-term memory","venue":null,"work_id":"907ceddc-90b3-4a1b-949d-86b07efe30ca","year":1997},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:78fb287ad38a59a38d6ff97021d1724d2ab8401184d6a9c493a8e80a403e2391","observation_id":"d8255aa3-9af7-4e4f-aaca-05ad8ab16334","resolution":{"observed_at":"2026-07-06T06:52:04.320048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:06:20.146531Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":"bb24df99-6053-4040-9b46-b8b10cf38d19","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:af2a5cdc4974c5fb13112787de3ecaf4260c839be7156b4b6ef8435b37b36b59","observation_id":"9af83738-121c-4722-92c4-444b91b4a13a","resolution":{"observed_at":"2026-07-06T06:52:04.327389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.339572Z","title":"Attention is all you need,","venue":null,"work_id":"f0665d8e-7803-4cda-b5bc-d3ec9f0b9a24","year":2017},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:f32e30eb4d572590f6a4475075749e084743dddbfc9e8cd351bf2202d5060ac8","observation_id":"759a09c5-31ee-4f15-9663-88093c3b3e71","resolution":{"observed_at":"2026-07-06T06:52:04.340711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.796260Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"30f50a34-e474-4860-bfae-9c929a6f1e51","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:9c1e2a336977b37d0c885805f9874ee9013b7f5e62ae7086309db48bdb40a587","observation_id":"3c7bc2a3-01ec-425f-a7c0-b6088e83b0ec","resolution":{"observed_at":"2026-07-06T06:52:04.297771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2005.08100","doi":"10.48550/arxiv.2005.08100","metadata_source":"pith","pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Parmar, N., Zhang, Y., Yu, J","venue":"eess.AS","work_id":"ea82ef7a-cc1e-489b-8704-4732b4801696","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:e2b9ecc94832b7afbcd7e59a7dbce5fc032c7a5f4a636d9a7f3ef56a7de90793","observation_id":"9268124b-a2f4-4f8d-aea6-3087f0b1c290","resolution":{"observed_at":"2026-07-02T05:56:39.897175Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":"2111.09296","doi":"10.48550/arxiv.2111.09296","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"XLS-R: Self-supervised cross-lingual speech represen- tation learning at scale","venue":"arXiv (Cornell University)","work_id":"c6922371-271e-4ae1-99f4-da2e47c9ed0b","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:e2b0cf8882f5bc697a67276eae4287d47a3a60edfc22424920172302032b44f6","observation_id":"abbf0d63-cf32-495b-a9cb-570350d25ac4","resolution":{"observed_at":"2026-07-02T05:56:39.846458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.312246Z","title":"Investigating self-supervised learning-based front-end for multi-channel replay attack detection,","venue":null,"work_id":"abc656b5-99e0-4b5f-b5b1-140b0fac94b4","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:6ab26d17cb052ffbf73a3ef610e6295dea0ef997641993a1cdc9844cbc70b145","observation_id":"379becd0-0e5e-4527-8962-460a79b8042a","resolution":{"observed_at":"2026-07-06T06:52:04.313603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12222","last_updated":"2025-06-13T20:48:46Z","snapshot_observed_at":"2026-08-07T05:03:50.906639Z","submitted_at":"2025-06-13T20:48:46Z","title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","version":1},"cited_work":{"arxiv_id":"2506.12222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12222","snapshot_observed_at":"2026-07-02T05:56:39.910208Z","title":"Sslam: Enhancing self-supervised models with audio mixtures for polyphonic soundscapes","venue":null,"work_id":"37ad0f61-a107-470e-8ddb-24629620e685","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2506.12222","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:023a4f2e80cb3e97d31bdd9d85ca249790064a855eab5d86f0323a7a29c20fdf","observation_id":"2fc140d0-23bd-4548-9c8a-8b924dd0d98c","resolution":{"observed_at":"2026-07-02T05:56:39.911902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11364","last_updated":"2024-06-17T09:37:29Z","snapshot_observed_at":"2026-08-06T07:28:02.395625Z","submitted_at":"2024-06-17T09:37:29Z","title":"AnoPatch: Towards Better Consistency in Machine Anomalous Sound Detection","version":1},"cited_work":{"arxiv_id":"2406.11364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11364","snapshot_observed_at":"2026-07-02T05:56:39.828855Z","title":"Anopatch: Towards better consistency in machine anomalous sound detection,","venue":null,"work_id":"bd466bbe-9bb6-4d15-90e9-9886e2c06e76","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2406.11364","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:c5e76cee4005f96dbbf212ce265a3f3105426a905ed1d614aec63868d5f7c9e6","observation_id":"833c88ef-6e09-4824-93f5-67ef7b9c71eb","resolution":{"observed_at":"2026-07-02T05:56:39.830382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.316674Z","title":"Dp- mae: A dual-path masked autoencoder based self-supervised learning method for anomalous sound detection,","venue":null,"work_id":"2afb0423-0536-42f3-8a6c-e87d8abed5ce","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:1c54f0962d073df878872f46bfbd412bad4ecdb47fb4edc3d40a3bda6f76ab34","observation_id":"4fadf425-000d-4db8-af5b-f1363027a95c","resolution":{"observed_at":"2026-07-06T06:52:04.318215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.262037Z","title":"Muq: Self-supervised music representation learning with mel residual vector quantization,","venue":null,"work_id":"3c9b8225-ea5d-410d-977d-745ffd5578e3","year":2025},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:6bda01e06a6a024d93814711717959b4e21f285a478af58bd0289b529bb387b8","observation_id":"60b87f4c-1ab5-45d9-afd8-2cf0790c4242","resolution":{"observed_at":"2026-07-06T06:52:04.263379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.263973Z","title":"A foundation model for music informatics,","venue":null,"work_id":"6fd207e8-150e-4d90-97b8-6356703c3a98","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:ea6f912faa0800d8dafa2e8781a2b25779d1eb01c0037bc552e517cb68ed0abd","observation_id":"d102e475-e100-4d7d-a099-c6fffd12f62b","resolution":{"observed_at":"2026-07-06T06:52:04.265159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:52:04.258237Z","title":"Unsupervised sound separation using mixture invariant training,","venue":null,"work_id":"aab6bd58-4ae6-4f51-b804-6aabdd684137","year":2020},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:a0931814da0c2c10b9f8694b4ef5db0dfdc14e63c733c884cdc2673399877b47","observation_id":"4beb6b9c-57a5-4b25-b726-5ce93408a548","resolution":{"observed_at":"2026-07-06T06:52:04.259505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":27,"verified_fuzzy":69},"total_outbound_references":166},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 166 outbound references and 0 inbound Pith citation observations for arXiv:2607.00387."}