{"as_of":"2026-08-08T18:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:986e0747a01d2b4881ede0b7835d926e4a9e7f96a40a7190d7dcf02fd5e659d5","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:56:46.342431Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:44:33.047406Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:50:12.629815Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-02T18:11:35.194361Z","title":"Audio-JEPA : Joint-embedding predictive architecture for audio representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15553","last_updated":"2026-07-27T17:51:19Z","snapshot_observed_at":"2026-08-06T19:44:18.918530Z","submitted_at":"2026-03-16T17:13:27Z","title":"Self-Distillation of Hidden Layers for Self-Supervised Representation Learning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T18:11:35.194361Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2603.15553"},"observation_digest":"sha256:ef6006d8c721ba051a2668506168d87fa46abb5bb372baabc82ddb437623ea00","observation_id":"72f1a689-e70f-43c9-9a42-817712dc2b54","resolution":{"observed_at":"2026-08-02T18:11:35.194361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-07-04T20:50:12.629815Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning,","venue":null,"work_id":"d8d4cd77-16f7-4f1f-92d1-fd74b650aad8","year":2025},"citing_paper":{"arxiv_id":"2606.01909","last_updated":"2026-06-01T08:46:11Z","snapshot_observed_at":"2026-08-07T00:42:12.924284Z","submitted_at":"2026-06-01T08:46:11Z","title":"Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T12:54:49.511047Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2606.01909"},"observation_digest":"sha256:006a0658c94c7089d20daf3ac590cfa2be9b0962c0d26310bad58abdd40803bc","observation_id":"27c28636-ee95-4fc2-9ef2-e1271c8ca576","resolution":{"observed_at":"2026-07-02T01:06:23.815592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-07-04T20:50:12.629815Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning,","venue":null,"work_id":"d8d4cd77-16f7-4f1f-92d1-fd74b650aad8","year":2025},"citing_paper":{"arxiv_id":"2606.25713","last_updated":"2026-06-29T06:39:51Z","snapshot_observed_at":"2026-07-30T02:44:48.967696Z","submitted_at":"2026-06-24T11:26:38Z","title":"Frequency-Aware Self-Supervised Music Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-25T19:25:54.322923Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2606.25713"},"observation_digest":"sha256:ae3f901983fad64d90ddb707998235a94a5f74b8be931fa71e05be93f8252844","observation_id":"d5760ae9-19fb-428a-aad5-0ae7642e0cc4","resolution":{"observed_at":"2026-07-04T20:50:12.631693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":"2507.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-07-04T20:50:12.629815Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning,","venue":null,"work_id":"d8d4cd77-16f7-4f1f-92d1-fd74b650aad8","year":2025},"citing_paper":{"arxiv_id":"2606.25713","last_updated":"2026-06-29T06:39:51Z","snapshot_observed_at":"2026-07-30T02:44:48.967696Z","submitted_at":"2026-06-24T11:26:38Z","title":"Frequency-Aware Self-Supervised Music Representation Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T10:04:11.233115Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2606.25713"},"observation_digest":"sha256:6290bb39d389ac54fcb98ee78e8fd152a01a28bd101632bee1ad5e3ad74d8b16","observation_id":"1bb2d02d-8af9-44e5-8425-e017f2a60551","resolution":{"observed_at":"2026-06-30T10:04:35.643472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-01T22:46:06.299864Z","title":"Audio-JEPA: Joint-Embedding Predic- tive Architecture for Audio Representation Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16350","last_updated":"2026-07-17T05:28:22Z","snapshot_observed_at":"2026-08-06T03:44:39.386608Z","submitted_at":"2026-07-17T05:28:22Z","title":"Joint-Embedding Predictive Architecture for Sensor-based Activity Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T22:46:06.299864Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2607.16350"},"observation_digest":"sha256:8d2b38d4f11919eb883c220208b945a45cb4ea98a697026ac4cc797592659257","observation_id":"8b7c4702-41a1-4256-b744-ec10d5d77758","resolution":{"observed_at":"2026-08-01T22:46:06.299864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-01T06:12:42.365990Z","title":"Audio-jepa: Joint-embedding predictive archi- tecture for audio representation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22000","last_updated":"2026-07-24T05:59:30Z","snapshot_observed_at":"2026-08-06T10:32:52.528089Z","submitted_at":"2026-07-24T05:59:30Z","title":"Music-JEPA: Learning a World Model of Sound from Action","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:12:42.365990Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2607.22000"},"observation_digest":"sha256:7d171831a1975d25f894f63762957ca3c0963e21ff3025cab6689c6239d5e685","observation_id":"163f1b05-700e-4916-8794-06d0bdd0842c","resolution":{"observed_at":"2026-08-01T06:12:42.365990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-06T00:40:22.852047Z","title":"Proceedings of the IEEE International Conference on Multimedia and Expo (ICME) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01049","last_updated":"2026-08-02T07:32:46Z","snapshot_observed_at":"2026-08-08T09:34:45.217094Z","submitted_at":"2026-08-02T07:32:46Z","title":"FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-06T00:40:22.852047Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2608.01049"},"observation_digest":"sha256:3830f39e8f666b9708ec548050a6ef58e97465b17f98536ce17d3101007fe3a2","observation_id":"d67cc45a-d8e6-42ec-9e0e-eab62d207d31","resolution":{"observed_at":"2026-08-06T00:40:22.852047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02915","snapshot_observed_at":"2026-08-07T15:44:33.047406Z","title":"arXiv preprint arXiv:2507.02915 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06062","last_updated":"2026-08-06T14:07:26Z","snapshot_observed_at":"2026-08-08T18:16:30.131858Z","submitted_at":"2026-08-06T14:07:26Z","title":"Bar-JEPA: Extracting Values from Bar Chart with Joint-Embedding Predictive Architecture","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:44:33.047406Z"},"links":{"cited_paper":"/paper/2507.02915","citing_paper":"/paper/2608.06062"},"observation_digest":"sha256:427cf6268886a03d92d541aaf687ef1689634d0f980868f6a8602ea6991305bb","observation_id":"1c325d45-a496-43b1-8277-e3b12ce316d7","resolution":{"observed_at":"2026-08-07T15:44:33.047406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02915/citation-record","integrity":"/paper/2507.02915/integrity","json":"/paper/2507.02915/citation-record.json","paper":"/paper/2507.02915"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-08T09:38:45.288574Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-06T22:56:46.224028Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.224028Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:01732f5672e81a56fd10351c7dc30232691362a54c004b4a18a7d2c4a1065e54","observation_id":"2f1a916e-e772-4f3d-8282-a493595b354f","resolution":{"observed_at":"2026-08-06T22:56:46.224028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11957","last_updated":"2023-09-08T02:31:24Z","snapshot_observed_at":"2026-08-03T09:07:15.996590Z","submitted_at":"2023-08-23T06:57:00Z","title":"CED: Consistent ensemble distillation for audio tagging","version":2},"cited_work":{"arxiv_id":"2308.11957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.11957","snapshot_observed_at":"2026-08-06T22:56:47.263424Z","title":"CED: Consistent ensemble distillation for audio tagging","venue":"cs.SD","work_id":"add87fbb-4402-4e6f-8723-46baafc2873c","year":2023},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.227882Z"},"links":{"cited_paper":"/paper/2308.11957","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:6f1079ce5947586a2981fe3d550c30a98ccee5af934c7643b24b9b124cc9c632","observation_id":"9ceb76b9-7dbc-4c05-9baa-86471b24b068","resolution":{"observed_at":"2026-08-06T22:56:47.266196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-06T22:56:46.230938Z","title":"Scaling up masked audio encoder learning for general audio classifi- cation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.230938Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:bdb5b75da5f1fe3313cd66f32c1e5b15f3b8f9ec5d6a1ee877de64bf4fe4c472","observation_id":"b46a13a5-5276-415c-a05e-6a163b4ef094","resolution":{"observed_at":"2026-08-06T22:56:46.230938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06095","last_updated":"2024-04-09T07:57:08Z","snapshot_observed_at":"2026-08-07T00:42:22.022720Z","submitted_at":"2024-04-09T07:57:08Z","title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","version":1},"cited_work":{"arxiv_id":"2404.06095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.06095","snapshot_observed_at":"2026-08-06T22:56:47.247617Z","title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Framework","venue":"eess.AS","work_id":"69a078fd-1f2a-4481-91b3-c594a0d0ed71","year":2024},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.234160Z"},"links":{"cited_paper":"/paper/2404.06095","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:6b16912576f9ddef5e2cf49168f88d61a9f874edbea49066872f386f2da1470b","observation_id":"79718107-558b-4fc2-916e-de189db3939b","resolution":{"observed_at":"2026-08-06T22:56:47.251153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-07T05:13:16.889179Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-06T22:56:46.237565Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representa- tions","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.237565Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:78aba7ae6253a7aba74ca7681a0b25d30636c9c18c9c6015d5bad04978f9183a","observation_id":"fb09b00d-30d2-47af-9ac9-1eb9bb433875","resolution":{"observed_at":"2026-08-06T22:56:46.237565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.241459Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.241459Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:8a39787c18538ebd13b03d65641811d022bcc0fa2f4c9c262fdff4dc24ae3883","observation_id":"8461dad3-f481-4f9a-8785-b4b94006be8c","resolution":{"observed_at":"2026-08-06T22:56:46.241459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-06T22:56:46.244140Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.244140Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:851f2defde1a16629b818474179f00caaeec61d804edc63876246d6434b3b239","observation_id":"4615b1ab-4aa0-48a8-b010-a13417829438","resolution":{"observed_at":"2026-08-06T22:56:46.244140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.336621Z","title":"Efficient Self-super- vised Learning with Contextualized Target Representations for Vision, Speech and Language","venue":null,"work_id":"70c9ce3d-d204-4455-82e9-06dd32f91c95","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.247277Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:4bbae0ef666334f6b5baa3ce33221eec749f319baf9fb1cba4ececbe000a8a58","observation_id":"148ab8b8-5667-4689-ba24-ac83137fca14","resolution":{"observed_at":"2026-08-06T22:56:47.339338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.329428Z","title":"A Path Towards Autonomous Machine Intelligence Version 0.9.2, 2022-06-27,","venue":null,"work_id":"06a5405b-1343-45ad-a9c9-13fe65ed50ea","year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.249998Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:f03874efa8d8e8b6251c5afc729647f9e5ae3e0d41c5972c91eef3622a966a0a","observation_id":"e1896868-56f7-43f6-85f3-e72bd47c4294","resolution":{"observed_at":"2026-08-06T22:56:47.332558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-04T14:08:53.444823Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-06T22:56:46.252958Z","title":"Self-Supervised Learning from Images with a Joint- Embedding Predictive Architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.252958Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:dab4e99e2591277de66bc76160cf70bdb56a149baa7cb99d6ca7448d48e5ee9d","observation_id":"02ad345b-f45c-48aa-a64c-c36c78f35ebb","resolution":{"observed_at":"2026-08-06T22:56:46.252958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-06T22:56:46.256060Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.256060Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:3f948e960ad2662d6672e862a3d349cbd1e9391bbedc77dc522d31aca57cce5c","observation_id":"ba276dbc-f849-4046-b967-aaad6c0b2f1f","resolution":{"observed_at":"2026-08-06T22:56:46.256060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.322230Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","venue":null,"work_id":"e1a825b5-afb6-46d3-95dc-19ad119a1815","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.259155Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:4a457a5c38bcfd71a13072d3dd8d57e2449ea795677d19e2f9071a5a76fd3c1c","observation_id":"0220be99-caa1-4cc6-aafe-1062babe05ec","resolution":{"observed_at":"2026-08-06T22:56:47.325028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02514","last_updated":"2024-08-05T14:34:40Z","snapshot_observed_at":"2026-08-08T09:41:58.611266Z","submitted_at":"2024-08-05T14:34:40Z","title":"Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation","version":1},"cited_work":{"arxiv_id":"2408.02514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02514","snapshot_observed_at":"2026-08-06T22:56:47.133363Z","title":"Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation","venue":"cs.SD","work_id":"052b8ddd-a4f0-4cf6-a526-c1bdc3d6ebf2","year":2024},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.261794Z"},"links":{"cited_paper":"/paper/2408.02514","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:bf6408487c117bf9ccadd886f645e3d332cfb2c5568170ee33e64e1d84a70c56","observation_id":"4346d857-951e-48c1-a778-886ee9227d0c","resolution":{"observed_at":"2026-08-06T22:56:47.136557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-06T22:56:46.264640Z","title":"Masked Autoencoders that Listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.264640Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:acf7fda4d149b6ac0423f84922686e2ae9c6ae5951154b9b37f6e42fa4981248","observation_id":"f0292ae4-b77a-4c7d-af57-a5001062a6ac","resolution":{"observed_at":"2026-08-06T22:56:46.264640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.267285Z","title":"A Dataset and Taxonomy for Urban Sound Research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.267285Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:4268534fc30a43b182b4828e4d2671d5a1011a45f5af87f84da66608205a90fa","observation_id":"c7a8b073-5e16-4d78-8d5c-3c06e9d4e34a","resolution":{"observed_at":"2026-08-06T22:56:46.267285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.270842Z","title":"VoxCeleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.270842Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:92b0e991c1739a0e6087f516b0ca7fd535e6254f55161ab6ee773cc838d2cb5c","observation_id":"3f63ad7f-c74a-4ac1-9f15-6748b3153b20","resolution":{"observed_at":"2026-08-06T22:56:46.270842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.273343Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.273343Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:752cd810c0b8a2cba7212852be8d02abd43bb63440922d8c8cd86035ff57e7e1","observation_id":"2c3fbb49-5d1e-4fb5-8a87-4c07d3fb9534","resolution":{"observed_at":"2026-08-06T22:56:46.273343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.314030Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","venue":null,"work_id":"e69bfe77-2a11-4139-bb21-7d99d8eb1bec","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.276048Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:262dde605aeebf844aeb3794a8a5b6d449f82d63fbb1f468420140bb441e1f9b","observation_id":"48c91fef-02c3-4ea6-b197-ebc56a608317","resolution":{"observed_at":"2026-08-06T22:56:47.317711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06380","last_updated":"2025-03-09T01:34:28Z","snapshot_observed_at":"2026-08-07T17:19:38.981590Z","submitted_at":"2025-03-09T01:34:28Z","title":"TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems","version":1},"cited_work":{"arxiv_id":"2503.06380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06380","snapshot_observed_at":"2026-08-06T22:56:46.985746Z","title":"TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems","venue":"cs.CV","work_id":"ccee505b-775a-49f0-aa88-26d1c2d8ad88","year":2025},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.278586Z"},"links":{"cited_paper":"/paper/2503.06380","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:2c897fd70ff06ff403492e023463c28dbb84e67c1301c99f39c6ebb4c2e7f5f0","observation_id":"7e524576-c9a8-49e3-b7e4-fb065bb0e736","resolution":{"observed_at":"2026-08-06T22:56:46.989062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05774","last_updated":"2025-02-25T22:03:28Z","snapshot_observed_at":"2026-08-07T17:48:51.783295Z","submitted_at":"2025-02-25T22:03:28Z","title":"GeoJEPA: Towards Eliminating Augmentation- and Sampling Bias in Multimodal Geospatial Learning","version":1},"cited_work":{"arxiv_id":"2503.05774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05774","snapshot_observed_at":"2026-08-06T22:56:46.972707Z","title":"GeoJEPA: Towards Eliminating Augmentation- and Sampling Bias in Multimodal Geospatial Learning","venue":"cs.LG","work_id":"7ff493ef-e60e-46ad-bc0f-83f0f44ca6ab","year":2025},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.282310Z"},"links":{"cited_paper":"/paper/2503.05774","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:47e4d8baa7a2d3f7bffffddf71a7d0903d836618d1ecd212c48d142e8abe496f","observation_id":"6463c55d-7c7d-4db6-932f-8ac0213d3ecf","resolution":{"observed_at":"2026-08-06T22:56:46.976297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.306560Z","title":"Bootstrap your own latent: A new approach to self- supervised Learning","venue":null,"work_id":"dc473bab-b7aa-4ca6-9ee2-a8a6ee832831","year":2006},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.284987Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:0e8f62812bd6f33d872abdc01f36b9fb0ed917d4e3d8e6155e951c3feb3e998a","observation_id":"62a306d7-63fc-405c-8557-b8c1a04d2a8a","resolution":{"observed_at":"2026-08-06T22:56:47.309278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T22:56:46.287631Z","title":"Decoupled Weight Decay Regulariza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.287631Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:74ae074aca009f25d717f9c7f89c58298d9211b7197d1e4092f5d0d870e354c6","observation_id":"a7d97c8e-cda5-4076-80b0-a38f88d9d71d","resolution":{"observed_at":"2026-08-06T22:56:46.287631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.299614Z","title":null,"venue":null,"work_id":"5aaa0aec-6866-479a-84a1-f35ac7dbae50","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.290010Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:4cb377cced8e9af117cbac24b1460a672ba5e12967a291a9b869bf26e08b2459","observation_id":"43fa2dff-f79e-4711-a5f3-4176d3548695","resolution":{"observed_at":"2026-08-06T22:56:47.302159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09387","last_updated":"2019-10-21T14:06:01Z","snapshot_observed_at":"2026-08-05T15:28:22.296479Z","submitted_at":"2019-10-21T14:06:01Z","title":"Clotho: An Audio Captioning Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09387","snapshot_observed_at":"2026-08-06T22:56:46.295352Z","title":"Clotho: An Audio Captioning Dataset","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.295352Z"},"links":{"cited_paper":"/paper/1910.09387","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:1f60bdb80b1f2929ec68de44563ae0b13bed1a0ad09961b210d5fc9efc808c98","observation_id":"84372658-ed8d-4e29-b5b9-d66d883a3b6b","resolution":{"observed_at":"2026-08-06T22:56:46.295352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.298919Z","title":"CREMA-D: Crowd-sourced Emotional Multimodal Actors Dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.298919Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:06822be18d0abb94aa7cb81a8504a60cf055081bed7af1f4e707f6b092b590e6","observation_id":"0365b6ed-a8e6-48e8-a8ea-880de64dcfe8","resolution":{"observed_at":"2026-08-06T22:56:46.298919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3758/s13428-014-0464-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.360839Z","title":"Generating an item pool for translational social cognition research: methodology and initial validation,","venue":null,"work_id":"9a1b74c1-45cf-4f14-8a1e-30e3d0901823","year":2015},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.301331Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:fcfef6bf7b984f05d7a965d7289e79527b81269a8872080882153a18eccf12d4","observation_id":"eaef854a-9b7d-40d9-9227-e85ca872837c","resolution":{"observed_at":"2026-08-06T22:56:46.365463Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.284281Z","title":"Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":"f980b153-7a7e-4be6-a880-407458697be9","year":2019},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.304258Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:90ca37d85a99257df1bf0fe205630dcceac94d8bc25ca0d4ac9a56953a876e42","observation_id":"2c57c113-8cee-43b9-b57c-71e60fb42b58","resolution":{"observed_at":"2026-08-06T22:56:47.287063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.276992Z","title":"Sound event detection in synthetic domestic environments,","venue":null,"work_id":"7775a091-2ad6-45e5-b9a6-ef1497542e32","year":2020},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.306811Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:bd51512ae88476bfda0d27dd6629b4c71a53165a328ddc3ec76afb1ed58cb9a4","observation_id":"ad610024-4d77-49cf-a3ca-defdbfe393ad","resolution":{"observed_at":"2026-08-06T22:56:47.279730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.309460Z","title":"ESC: Dataset for Environmental Sound Classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.309460Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:2a288fef8438f3da50c0ed6b3df2fcb590f4450594305b42781dc0dc463e96dc","observation_id":"971823ec-6826-4d3f-b24e-acbbf1fad5a3","resolution":{"observed_at":"2026-08-06T22:56:46.309460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-06T22:56:46.311880Z","title":"FMA: A Dataset For Music Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.311880Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:2ba73147e9e9478c2d4267947567488b28e15d7d473a781280c41f392745020a","observation_id":"9226004b-7c4c-4480-ba4e-5aa60fa31cbb","resolution":{"observed_at":"2026-08-06T22:56:46.311880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-07-06T06:52:21.185384Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-06T22:56:46.314564Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.314564Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:036e889ac9ee4da6d22ca736a95d21689cdc6036e0001280f00c795c39f50ad6","observation_id":"6e457330-e699-4686-be90-3df5856309b2","resolution":{"observed_at":"2026-08-06T22:56:46.314564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-02T22:15:33.611696Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-06T22:56:46.317985Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.317985Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:650100980cf34573b414b8f628a585cc87d93c391d1d71afec818a1740303fc2","observation_id":"bee0be84-1bd7-4e1e-a8d3-fcb2c2b3ce93","resolution":{"observed_at":"2026-08-06T22:56:46.317985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1216072","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.815122Z","title":"LibriCount, a dataset for speaker count estimation","venue":null,"work_id":"f2ef92d7-32c8-45ca-8647-4647bb7cc34f","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.321292Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:70cc86127d296bb585647074a4fdf15c82918e8b59ec0d7708e88b6d936c8f76","observation_id":"2d5917d5-1fd9-460d-9a4a-134bdf7d73b6","resolution":{"observed_at":"2026-08-06T22:56:46.821091Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.323549Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.323549Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:3071b75e473be091786d6832ac5398c3643a4334759b4547e44627ad82e991a7","observation_id":"e17815ff-6608-4292-9d68-a67f2e4f04ae","resolution":{"observed_at":"2026-08-06T22:56:46.323549Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.01279","last_updated":"2017-04-05T06:34:22Z","snapshot_observed_at":"2026-08-02T21:47:02.126634Z","submitted_at":"2017-04-05T06:34:22Z","title":"Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.01279","snapshot_observed_at":"2026-08-06T22:56:46.327119Z","title":"Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.327119Z"},"links":{"cited_paper":"/paper/1704.01279","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:401c5744c89c94a4ccaedeb362d6595d285667cdeafa4d84ce3f703f0a6dc164","observation_id":"f75daadd-0aeb-4571-a049-2a7d46df962b","resolution":{"observed_at":"2026-08-06T22:56:46.327119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1188976","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.700175Z","title":"The Ryerson Audio-Visual Database of Emotional Speech and Song (RA VDESS)","venue":null,"work_id":"0d8bd3ae-6e86-4d28-a2e9-1ecd90c405a3","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.329589Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:2406c451502c33a55aad9de4244e5f4d249fb75f8ee6981cf368319376ed6e3e","observation_id":"25bd55ea-7fa6-40bd-8e6e-ed354dceb3b8","resolution":{"observed_at":"2026-08-06T22:56:46.703751Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1340763","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.619884Z","title":"Vocal Imitation Set v1.1.3 : Thousands of vocal imitations of hundreds of sounds from the AudioSet ontology","venue":null,"work_id":"7d99f6d5-1289-4e06-9be2-51e9fc80f84f","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.332120Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:9d5b6fedf8fc9453432279249b78a15376671e892a12470801136af115894e86","observation_id":"32864c85-9e8c-409f-8116-41152284d54f","resolution":{"observed_at":"2026-08-06T22:56:46.623337Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.334390Z","title":"Vocalsound: A Dataset for Im- proving Human Vocal Sounds Recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.334390Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:03f22a6756088ff70655409703b1e52a346861480e81f46af985dd60c88a869b","observation_id":"614e6a51-cad4-40d4-b9bc-255abbffd4eb","resolution":{"observed_at":"2026-08-06T22:56:46.334390Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1472379","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:46.482926Z","title":"voxlingua33 in WebDataset Format","venue":null,"work_id":"013a2f7b-b6c3-47d2-a6e7-f48c89f5fc78","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.336713Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:6371639b1852f82a3544b8328a4a98d7e22cd5f846d98e789389de3c75829b13","observation_id":"26837dd3-70f9-4a23-89b5-4790b3d9fb14","resolution":{"observed_at":"2026-08-06T22:56:46.486803Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05674","last_updated":"2023-09-09T02:18:17Z","snapshot_observed_at":"2026-07-06T16:17:04.004519Z","submitted_at":"2023-09-09T02:18:17Z","title":"ConvFormer: Plug-and-Play CNN-Style Transformers for Improving Medical Image Segmentation","version":1},"cited_work":{"arxiv_id":"2309.05674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05674","snapshot_observed_at":"2026-08-06T22:56:46.388234Z","title":"ConvFormer: Plug-and-Play CNN-Style Transformers for Improving Medical Image Segmentation","venue":"eess.IV","work_id":"f8ba9fb0-e465-413f-85a6-adafa2ba1011","year":2023},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.338990Z"},"links":{"cited_paper":"/paper/2309.05674","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:a147a0af3259953a3a83893fcef84cc315bc4bed5a20ce12bc8f03b5ade83b92","observation_id":"ab31d341-a210-4f98-a294-fbf0fd3e9782","resolution":{"observed_at":"2026-08-06T22:56:46.392405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13452","last_updated":"2024-12-01T05:55:44Z","snapshot_observed_at":"2026-08-08T04:37:11.138459Z","submitted_at":"2022-10-24T17:59:57Z","title":"MetaFormer Baselines for Vision","version":4},"cited_work":{"arxiv_id":"2210.13452","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.13452","snapshot_observed_at":"2026-08-06T22:56:46.378061Z","title":"MetaFormer Baselines for Vision","venue":"cs.CV","work_id":"4db43e60-6e1d-4789-9d66-dc23e434544e","year":2022},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.342431Z"},"links":{"cited_paper":"/paper/2210.13452","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:d8066518a7f982421228412543c472fcb087893c0f043a149f1848c96c41f43d","observation_id":"dbd8b5b8-6aed-4331-a344-773037ffc781","resolution":{"observed_at":"2026-08-06T22:56:46.381208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:47.291638Z","title":"Available: https://datashare.ed.ac.uk/handle/ 10283/853","venue":null,"work_id":"0bc0afda-0d76-43d4-a4e3-5db1b0aa9302","year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.292291Z"},"links":{"citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:dd3b2b7b8b1ca3ecd520cd39db9823758924de371f6a48692fcdd49383f76d02","observation_id":"b4a2ae34-ed58-4a95-8c26-9d91d823260f","resolution":{"observed_at":"2026-08-06T22:56:47.294245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":12,"verified_fuzzy":8},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 8 inbound Pith citation observations for arXiv:2507.02915."}