{"as_of":"2026-08-09T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c80bb6df45e45e7c82b995580171bcf24ce07c55e6e64d3095bc995485c0e867","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T05:37:12.972599Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08545/citation-record","integrity":"/paper/2607.08545/integrity","json":"/paper/2607.08545/citation-record.json","paper":"/paper/2607.08545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:53.090970Z","title":"Joan Bruna and Stéphane Mallat","venue":null,"work_id":"e0dfd6c6-a84f-4455-baba-25ba92d14957","year":2023},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:fd5b4d47b79b2686e63251fbe579c7b5d14601d6c641c1e52ebb5776fee45a8f","observation_id":"cb681333-9881-4c3f-808f-8f4b77517c94","resolution":{"observed_at":"2026-07-10T06:36:53.092153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05011","last_updated":"2021-12-15T16:42:14Z","snapshot_observed_at":"2026-07-06T12:06:48.719887Z","submitted_at":"2021-11-09T09:07:30Z","title":"RAVE: A variational autoencoder for fast and high-quality neural audio synthesis","version":2},"cited_work":{"arxiv_id":"2111.05011","doi":"10.48550/arxiv.2111.05011","metadata_source":"pith","pith_arxiv_id":"2111.05011","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rave:Avariationalautoencoderforfastandhigh-qualityneuralaudiosynthesis","venue":"cs.LG","work_id":"2d804fa4-dd5d-4461-9fc3-71a5243d0d44","year":2021},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2111.05011","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:cf3b83918c80259da36c7d120632e083c12c1ad71500b011fe814bffac98f145","observation_id":"ac75d854-52a2-4660-a6a8-43dca1258c85","resolution":{"observed_at":"2026-07-10T05:46:50.385905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:f5a6e9c2959f9f580e30e3854f790d562133056c8cabc85cce750db23caee13c","observation_id":"bd9cdf6b-2d0b-4013-b5c8-9889a457b6f1","resolution":{"observed_at":"2026-07-10T05:46:50.396849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.00298","last_updated":"2016-06-01T14:18:08Z","snapshot_observed_at":"2026-08-07T14:33:06.607361Z","submitted_at":"2016-06-01T14:18:08Z","title":"Automatic tagging using deep convolutional neural networks","version":1},"cited_work":{"arxiv_id":"1606.00298","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.00298","snapshot_observed_at":"2026-07-10T05:46:50.387488Z","title":"Automatic tagging using deep convolutional neural networks","venue":"cs.SD","work_id":"e8fb8c34-4fcf-49e2-b056-e8c898262d28","year":2016},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/1606.00298","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:f9704c8d133f19174283f0b9413b54ab6b40dc46df2ab58287333617779aa29a","observation_id":"d7b95a9b-1778-422b-ac45-8633ac3cbdbb","resolution":{"observed_at":"2026-07-10T05:46:50.391342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:49b5dd30dce207b9005c93e806c6eaaf40096a380f55cb2eba363defe8889b79","observation_id":"23891189-eea5-4c17-a06c-4742e4e69b50","resolution":{"observed_at":"2026-07-10T05:46:50.399308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":"2005.00341","doi":"10.48550/arxiv.2005.00341","metadata_source":"pith","pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jukebox: A Generative Model for Music","venue":"eess.AS","work_id":"aeb5293c-aee5-4e2d-ae57-668eb930893e","year":2020},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:8fa377756638a279bc89b24e061c7f12bb5bf3c56c512e965b7980be83809398","observation_id":"ac4e08de-0670-4d54-9ae8-7981688116d7","resolution":{"observed_at":"2026-07-10T05:46:50.405710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":"2209.10652","doi":"10.48550/arxiv.2209.10652","metadata_source":"pith","pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toy Models of Superposition","venue":"cs.LG","work_id":"43875dbe-bc2d-4ab5-af63-744411533ff7","year":2022},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:897a14ea920a3df709de6f0809d82056adff0a41250b6bcab68fde46e2748dd6","observation_id":"1b0d4698-97b0-4343-ad7d-e639753b2c9c","resolution":{"observed_at":"2026-07-10T05:46:50.401621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:53.092675Z","title":"Stable audio open","venue":null,"work_id":"0f6310b3-f71f-43c0-a6ce-486d3943a3da","year":2025},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:2851ddebe96d70500ebc88a38a07f3b5c8ba476360c8ad9fe857d069962b6d3f","observation_id":"67909668-c113-4f89-b2c4-ea95a8d770cb","resolution":{"observed_at":"2026-07-10T06:36:53.093743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00866","last_updated":"2017-12-04T00:58:58Z","snapshot_observed_at":"2026-08-05T07:19:16.271337Z","submitted_at":"2017-12-04T00:58:58Z","title":"Raw Waveform-based Audio Classification Using Sample-level CNN Architectures","version":1},"cited_work":{"arxiv_id":"1712.00866","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00866","snapshot_observed_at":"2026-07-10T05:46:50.411609Z","title":"Raw Waveform-based Audio Classification Using Sample-level CNN Architectures","venue":"cs.SD","work_id":"07cee434-d8b2-4887-bd0a-99bff07da70e","year":2017},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/1712.00866","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:e8f3fb3b034f4581f7d09d824bbc83062a48e0430ec46d6fe1de83be109c1af2","observation_id":"ed8b2a2f-aee6-48db-b6e4-8d92f28c410a","resolution":{"observed_at":"2026-07-10T05:46:50.412789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09725","last_updated":"2019-08-09T16:09:38Z","snapshot_observed_at":"2026-08-06T17:41:40.696644Z","submitted_at":"2018-11-23T23:13:09Z","title":"Interpretable Convolutional Filters with SincNet","version":2},"cited_work":{"arxiv_id":"1811.09725","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.09725","snapshot_observed_at":"2026-07-10T05:46:50.409306Z","title":"Interpretable Convolutional Filters with SincNet","venue":"eess.AS","work_id":"2024ad1f-3cfb-46ea-9c8c-a5634e0e1ed6","year":2018},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/1811.09725","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:2c15a79d462297a457bdc1cd64de1c25094bd65e37f3e1b0e1d93eaa5e72d199","observation_id":"e539545f-bd73-440f-b909-ac5a22f02a2b","resolution":{"observed_at":"2026-07-10T05:46:50.410516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18186","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:46:50.413937Z","title":"Nikhil Singh, Manuel Cherep, and Pattie Maes","venue":null,"work_id":"44df370f-4ad1-4d6d-8c08-9e754cec75f6","year":null},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:28830230e542b768df0dd5f7f560478b8706d8ae3d1af7eadb6e261b25661820","observation_id":"40b1afab-dca4-47bd-9d9d-5847514756d2","resolution":{"observed_at":"2026-07-10T05:46:50.415576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01815","last_updated":"2024-05-03T02:24:27Z","snapshot_observed_at":"2026-07-06T18:09:08.963593Z","submitted_at":"2024-05-03T02:24:27Z","title":"Toward end-to-end interpretable convolutional neural networks for waveform signals","version":1},"cited_work":{"arxiv_id":"2405.01815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01815","snapshot_observed_at":"2026-07-10T05:46:50.416733Z","title":"Toward end-to-end interpretable convolutional neural networks for waveform signals","venue":"cs.SD","work_id":"03e43130-f480-49fd-88b5-0dd28b565e85","year":2024},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2405.01815","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:7f3bd70d4f6c0d021bc55e9b8a2591c0a26b99bb8e4278e4008c55dd1fc0a812","observation_id":"c484e704-e722-49b0-9463-609adf9f0ba8","resolution":{"observed_at":"2026-07-10T05:46:50.417917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08596","last_updated":"2021-01-21T13:25:58Z","snapshot_observed_at":"2026-08-09T03:24:26.863757Z","submitted_at":"2021-01-21T13:25:58Z","title":"LEAF: A Learnable Frontend for Audio Classification","version":1},"cited_work":{"arxiv_id":"2101.08596","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.08596","snapshot_observed_at":"2026-07-10T05:46:50.406824Z","title":"ArXiv abs/2101.08596","venue":"cs.SD","work_id":"1152c054-8de4-46e7-8c12-cc832c355f17","year":2021},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"cited_paper":"/paper/2101.08596","citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:c8a811f9aed951b1eae32b1ca3acd9ffb0254767651a3df42a34590b9f001866","observation_id":"333a0ad0-78b7-49c6-961c-47c55c45858d","resolution":{"observed_at":"2026-07-10T05:46:50.408023Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:36:53.089108Z","title":"Correct F0 transfer direction is achieved in 97.3% of pairs","venue":null,"work_id":"c6c0de0e-1c82-4232-925d-a81417a45704","year":2017},"citing_paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T05:37:12.972599Z"},"links":{"citing_paper":"/paper/2607.08545"},"observation_digest":"sha256:fd45964272a27039365de6d5b7f46fa1d4ff6b1aaaec594cb8fda24bcee2345e","observation_id":"a49aed5a-7b1a-4922-82f9-6b492e7e7694","resolution":{"observed_at":"2026-07-10T06:36:53.090429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08545","last_updated":"2026-07-09T14:38:16Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-12T23:18:50.564044Z","submitted_at":"2026-07-09T14:38:16Z","title":"Structural Bottlenecks on Frequency Representation in End-to-End Audio Models"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2607.08545."}