{"as_of":"2026-08-23T22:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54782bc0392dc292d1eebcde38740300c0116350ee74eb851088e70b90f8fc13","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:15:01.455087Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11403/citation-record","integrity":"/paper/2506.11403/integrity","json":"/paper/2506.11403/citation-record.json","paper":"/paper/2506.11403"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.156561Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.156561Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:178b66a9308c85e00ddffe4ae5faced2c5c1afba72e9d8595dcb7e9af4603264","observation_id":"23f07254-95fd-4690-bac9-132bd20a43c8","resolution":{"observed_at":"2026-08-07T04:15:01.156561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.452338Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training,","venue":null,"work_id":"4bdc36c6-fc8c-4950-8382-a6847e6e2187","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.163223Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:b1801ad580955aca0d570c59ef6e5de68140baa286600376b7996b42261e771b","observation_id":"2ecec1e2-4533-48e7-b747-f4df5b9160a3","resolution":{"observed_at":"2026-08-07T04:15:02.458789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.429790Z","title":"Distilling a speech and music encoder with task arithmetic,","venue":null,"work_id":"52a11f51-0d27-4489-8545-63d0326b8fe2","year":2025},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.168953Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:0db9cede6d0ce43a4267cb7fbda87ceddf33b051659b605d663934595de1407d","observation_id":"925d4b30-c9e3-47db-824a-678e0ff9e29a","resolution":{"observed_at":"2026-08-07T04:15:02.437285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.407104Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"aa7b67b9-d355-415b-b39a-0110333f4afc","year":2025},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.174736Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:f307edc90b53c9b000afbf50f5b27e4a49e7c148452b2a2ed47d22b660814a47","observation_id":"fa1e36e3-4c56-47d5-bcbc-c247807dc44a","resolution":{"observed_at":"2026-08-07T04:15:02.414953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.386643Z","title":"Efficient training of self-supervised speech foundation models on a compute budget,","venue":null,"work_id":"78c0b1e9-0bcd-4526-aee0-24486149e0a3","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.181041Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:d73a96d2253adec25d661c739036f6fe1d68ee1daeba7f9fc4f92f057b81d198","observation_id":"0fb699c1-e2df-4741-ac10-fa69ff40eb16","resolution":{"observed_at":"2026-08-07T04:15:02.392583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.365171Z","title":"Editing models with task arithmetic,","venue":null,"work_id":"36762247-bbd8-4135-ae2d-45724b2adf6e","year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.187332Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:df43ce86a5b1c9bb0df83fb31c397c858893a3d858c6d81bc1ac5f73f5ce0ad6","observation_id":"e347ce4a-fc4c-4061-8d04-305d5dc06db1","resolution":{"observed_at":"2026-08-07T04:15:02.370694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.345701Z","title":"Ties- merging: Resolving interference when merging models,","venue":null,"work_id":"dab79ce0-a98a-4ea3-b24b-df6c467f4e39","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.194940Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:35e1fd13c2cc6be5c235b3afe990dcacc31fd856139310ae9b594159079f0c9e","observation_id":"31ce02c1-116c-4d41-977a-4b159db1ebae","resolution":{"observed_at":"2026-08-07T04:15:02.352170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.325750Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch,","venue":null,"work_id":"46aefce9-91f2-4da7-a250-eea07858d9e6","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.200890Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:c98fddfa5a90b0510203b0143eebf54985317fa05393ab2daca27cdcc3983ab5","observation_id":"ff9cdcb2-1537-45dd-84ff-485f10254fdc","resolution":{"observed_at":"2026-08-07T04:15:02.333094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11274","last_updated":"2025-07-29T13:37:58Z","snapshot_observed_at":"2026-08-18T22:02:25.737944Z","submitted_at":"2024-09-17T15:25:11Z","title":"Task Arithmetic for Language Expansion in Speech Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11274","snapshot_observed_at":"2026-08-07T04:15:01.207513Z","title":"Task arithmetic for language expansion in speech translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.207513Z"},"links":{"cited_paper":"/paper/2409.11274","citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:8aa2c7dfbea0797d9d042ba9fe035310dce68812b2f3f2cb76c5881068f3c764","observation_id":"481f6512-6c9f-4fc0-8257-10ab01cf241b","resolution":{"observed_at":"2026-08-07T04:15:01.207513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.306175Z","title":"Task arithmetic can mitigate synthetic-to-real gap in automatic speech recognition,","venue":null,"work_id":"3fb592d9-2812-42b0-bd9f-f0b2085dad08","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.213279Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:d8066673d016d4d710b9c22cff7f8372003e55ab9a6bb8839412a0b271b58270","observation_id":"6f741e74-5083-4c61-a9d9-559671814c46","resolution":{"observed_at":"2026-08-07T04:15:02.312854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.283582Z","title":"An attribute interpolation method in speech synthesis by model merging,","venue":null,"work_id":"473c8de8-4b25-4924-8692-10d2bfcddeb4","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.222887Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:2ae58d2980b1d332b62384301993a36464401253e71f4b55ced9d80f42fa965f","observation_id":"363be976-ff10-4657-b692-2fb883bd4972","resolution":{"observed_at":"2026-08-07T04:15:02.291059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.260277Z","title":"Selective attention merging for low resource tasks: A case study of child asr,","venue":null,"work_id":"4a22a867-4cf8-4487-bb6f-cb0b0f55141c","year":2025},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.229773Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:bd48c5a1b1ad29ae7682d7ced4ba89c63ee84883ffb295071921173cbc79fe55","observation_id":"207029b4-fe7a-412f-ac53-e9e328f82209","resolution":{"observed_at":"2026-08-07T04:15:02.266596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.236218Z","title":"The role of permutation invariance in linear mode connectivity of neural networks,","venue":null,"work_id":"bbc2dcb7-a769-4a87-ae39-c0b147e44bc8","year":2022},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.238117Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:9d0513713c332c85ebbd6523818fd7f69a53abf31b62de40770c7041f0be719c","observation_id":"09e76107-1b55-4c78-b1a9-c45d0fa2f46a","resolution":{"observed_at":"2026-08-07T04:15:02.242624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.216203Z","title":"Git re-basin: Merging models modulo permutation symmetries,","venue":null,"work_id":"65480df3-c28c-4847-bb97-ddd7d6ec905e","year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.243491Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:be0ec4c40f1d9b9ff99731930abab53eabdd2052ebd7e4e402d6ec5d39143c35","observation_id":"d8c18ff6-5598-4501-8ab5-084d9733e0b9","resolution":{"observed_at":"2026-08-07T04:15:02.222551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.197809Z","title":"Zipit! merging models from different tasks without training,","venue":null,"work_id":"9da34abe-b9a5-425e-917f-ab7c0559d026","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.248191Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:8972e8869e7a5bdb5b80f08f718af8bf7603a400c38632199b2155295e944feb","observation_id":"c9d2efd0-a698-4f22-ba51-511aba8fd80d","resolution":{"observed_at":"2026-08-07T04:15:02.203641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.178801Z","title":"Merging text transformer models from different initializations,","venue":null,"work_id":"e15d9b95-8794-42a2-8100-86c2250bec37","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.252993Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:94b94ed63f4ac4b4d1b340788c32df5a93136ce9426613e049d0b4e61ec836bf","observation_id":"97977581-5019-4bc4-a8ae-faf6d76b56fc","resolution":{"observed_at":"2026-08-07T04:15:02.185357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.159962Z","title":"Attention is all you need,","venue":null,"work_id":"8564c3d7-b3be-4925-92ee-ea43cac09bd1","year":2017},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.258224Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:7b6421986415a0cbe3350edb113633b30fa5956d33308a063874339ff9b2e033","observation_id":"865a654f-4914-48d9-9761-28fe99651102","resolution":{"observed_at":"2026-08-07T04:15:02.166295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.264036Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.264036Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:52fe6d7020c44cdfd1589eb9872b3a0c91bd070648ccdab1afc53d153c879729","observation_id":"171f9a72-db79-4b60-99a7-a0eb78a3a808","resolution":{"observed_at":"2026-08-07T04:15:01.264036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.124295Z","title":"Best-first model merging for hidden markov model induction,","venue":null,"work_id":"1efd7197-0bfb-41d6-84f7-1dfad36fd295","year":1994},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.270645Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:c43c5b6a6f27bd7885e49befb0fb15c99ce9e261dafb1a279152b9ec64ff6718","observation_id":"5c747d6d-f7de-4f7d-bdc6-56eab786ac87","resolution":{"observed_at":"2026-08-07T04:15:02.131237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.100566Z","title":"State-dependent phoneme-based model merging for dialectal chinese speech recognition,","venue":null,"work_id":"4ac6415d-2675-4d4a-b9d9-b1520c56bc82","year":2008},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.275764Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:3bbff58ce89aebecd5f534991e06f13137efbc09157f2b8564a2f0178d5786fa","observation_id":"2412e2a7-e172-49df-b487-032af7672a1d","resolution":{"observed_at":"2026-08-07T04:15:02.107394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.077586Z","title":"A post-processing system to yield reduced word error rates: Recognizer output voting error reduction (rover),","venue":null,"work_id":"b22cfd86-febb-46cb-ad87-12a5f23b8f31","year":1997},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.281172Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:5c982dde1bc18dce5b8d1a2a647f7ad10bd33857fe52ca4956b0a3ba7264410d","observation_id":"4c509502-f547-4b17-8335-9ca41f430883","resolution":{"observed_at":"2026-08-07T04:15:02.084506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.051791Z","title":"Speech recognition system combination for machine translation,","venue":null,"work_id":"7e48707f-67d5-43b5-8227-e7eb7be0dd0c","year":2007},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.286149Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:f5eef9c62d1a04566cd16e122602f62c4331a91811f32196c4dd420b81d95c4e","observation_id":"ecc039d5-c27d-4009-bda3-98016e207a31","resolution":{"observed_at":"2026-08-07T04:15:02.061821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.027967Z","title":"Combination of end-to-end and hybrid models for speech recognition","venue":null,"work_id":"0570654c-d729-4dc7-8621-50e26f0eea87","year":2020},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.292081Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:4127fe6d3c3f09e2f318c1f536a505aad5608c9086242cde205f9d9ec15b9e6e","observation_id":"8063e08c-61da-41ee-a27f-407a0787fe06","resolution":{"observed_at":"2026-08-07T04:15:02.033729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:02.001770Z","title":"Ensembles of hybrid and end-to-end speech recognition","venue":null,"work_id":"4b5a2e28-bca8-4717-a65d-ec158e41fa9e","year":2024},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.298126Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:0a6f9c1e1d671e5ce9fc70c3d502764f25df1abbc215e1344920311ca37e16dc","observation_id":"77c412fa-05e1-49f9-bf8a-333a9be7390f","resolution":{"observed_at":"2026-08-07T04:15:02.010629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.980977Z","title":"Combining multiple speech recognizers using voting and language model information,","venue":null,"work_id":"ec4bb018-2759-4d07-97e3-759cc8b150ce","year":2000},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.303752Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:6163bdc535bfaa3275f32017e75fb43cf38bd3cf81d2805bfc1235bd4ea02a11","observation_id":"22bbc3cd-c660-4e34-bf10-fff9714df8f3","resolution":{"observed_at":"2026-08-07T04:15:01.986563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.963423Z","title":"Neural network ensembles,","venue":null,"work_id":"4b6db8d7-50e3-4474-b75e-f09842e578bc","year":1990},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.309039Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:fc0555bb1af8b932f50910b41c8c428288b5eb918c7312b9b0b3ff267fbd00d2","observation_id":"6f4eacf5-6e5e-49a8-ad50-c8e2e709d8fc","resolution":{"observed_at":"2026-08-07T04:15:01.968685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03282","last_updated":"2017-10-09T19:38:26Z","snapshot_observed_at":"2026-08-18T07:28:16.320614Z","submitted_at":"2017-10-09T19:38:26Z","title":"Checkpoint Ensembles: Ensemble Methods from a Single Training Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03282","snapshot_observed_at":"2026-08-07T04:15:01.314213Z","title":"Checkpoint ensembles: En- semble methods from a single training process","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.314213Z"},"links":{"cited_paper":"/paper/1710.03282","citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:0d7b1bad2d902c22162aa1e3a1e21d5380009af50efd6daae274c31e83e519c9","observation_id":"20f72016-28a5-4550-b96f-45f970de1159","resolution":{"observed_at":"2026-08-07T04:15:01.314213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.943584Z","title":"What is being transferred in transfer learning?","venue":null,"work_id":"a47c41ac-8d85-40d6-8aa5-29d8416f8b7a","year":2020},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.320105Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:c1a9f61b5df55ce05b0107b4c482249dd7e4012aa33a407d10957cbd0595ae56","observation_id":"3c1f9e62-7448-47a1-9552-fb87d7781f82","resolution":{"observed_at":"2026-08-07T04:15:01.950059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.922075Z","title":"On implementing 2d rectangular assignment algorithms,","venue":null,"work_id":"f931df3a-cd05-4822-b539-7ad91687a916","year":2016},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.325999Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:402f70ada53b556dac85441935a3fcb1dc653cac7dbee3ccd6b70066ee592118","observation_id":"be314a8f-6165-4e47-9773-753978703a7d","resolution":{"observed_at":"2026-08-07T04:15:01.930260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.896621Z","title":"Group normalization,","venue":null,"work_id":"5728d0f0-40af-49e6-990d-9fb82584b12b","year":2018},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.331712Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:fadd801378fca25837249301922bd329934ff37a992785861b20f02a12e60555","observation_id":"43eb6427-d3c6-4d63-b5ef-221749b1790e","resolution":{"observed_at":"2026-08-07T04:15:01.903909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.337540Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.337540Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:af555fc84de6978c0a443117df0223dc833dc0a7fb023bca908c732a92c2718e","observation_id":"ee3a2218-4f84-4c74-ae3c-ac23386db681","resolution":{"observed_at":"2026-08-07T04:15:01.337540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.862047Z","title":"What does BERT look at? An analysis of BERT’s attention,","venue":null,"work_id":"e4037324-f745-4159-881c-0f174770e377","year":2019},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.344819Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:f2b2da84ea9bb7a5b1cf394a71c197868ac044e6c3d12e09f6e820bcca500108","observation_id":"eb4c65ef-cc00-4c7b-b98e-cf96585d3726","resolution":{"observed_at":"2026-08-07T04:15:01.867562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.838881Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned,","venue":null,"work_id":"3999b058-012e-4bba-a1b1-2e3693fbe586","year":2019},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.350355Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:2087b750a7854b182ea7cc9000c282900c7f2ffb862c17b04edb947e0ae96e03","observation_id":"dd8ad618-35e5-4714-a1f4-0d3e569dc9f6","resolution":{"observed_at":"2026-08-07T04:15:01.845302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.819876Z","title":"Music4all: A new music database and its applications,","venue":null,"work_id":"3fd6379a-7d8f-44ea-9f7d-88e29f9fca09","year":2020},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.357332Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:fd917a135537cee93bf030e9e9bdd6bbad2a7753137d1d9aa6ef36dbfc061d43","observation_id":"b3dac64c-3a3c-4afa-b249-d1ac51262977","resolution":{"observed_at":"2026-08-07T04:15:01.825327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.800379Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"9d92fb42-6585-429a-96f5-a2fca627c39c","year":2015},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.363299Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:76fd397b9ac26a24755cdf898fdbbb8802e0d85ee76fd3edb1754d9d8b6ca35b","observation_id":"100f3bbf-d30b-45af-bd89-0ad441b042ba","resolution":{"observed_at":"2026-08-07T04:15:01.807079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.778542Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":"57aaa1f6-7571-4a78-8a45-df0e0b011b27","year":2021},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.368898Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:24121450c940787c7f21e8853d4cf8cc5edcaa65f4880247a24784a0f9b8cb0f","observation_id":"f15fb308-f27c-469f-8932-71ffeb283011","resolution":{"observed_at":"2026-08-07T04:15:01.784662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.760816Z","title":"Marble: Music audio representation benchmark for universal evaluation,","venue":null,"work_id":"0c55acab-080c-46d7-81bf-2665feb60b67","year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.374402Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:2de76c4377243b2cc096b22349e01feaa74966621cc58def741db34e68664689","observation_id":"32ded617-74b3-45f9-8489-ffba5371dab8","resolution":{"observed_at":"2026-08-07T04:15:01.766591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.740938Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":"3ef49f83-ab5c-4254-addd-43b8445229b3","year":2018},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.380081Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:f53870314f72493f514aaea1547e496b0e1e9034e306d2d750ac77bb64af8deb","observation_id":"7c8f8bec-ba25-4414-a19d-31bce8c30042","resolution":{"observed_at":"2026-08-07T04:15:01.748650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.722733Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":"efdab60f-ab5e-449d-a7b1-7f1cb3372f3d","year":2019},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.388280Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:ea42b6d8606d2bf90c89f6f27f7bfbaa7f4e68d2ed29c1a06c0473a208532844","observation_id":"c5892b85-fb0e-4edc-8456-5e20c022a6d2","resolution":{"observed_at":"2026-08-07T04:15:01.728407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.700596Z","title":"V oxceleb: Large- scale speaker verification in the wild,","venue":null,"work_id":"a14697ab-b7d6-4c9c-9104-7406bbaacfcf","year":2020},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.396770Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:af796dc605d1201a7febffb484dd8a6eed48c06774917555a2e2481b501b6f31","observation_id":"b4771c92-1777-4e8d-bfb7-a9ca89e668a0","resolution":{"observed_at":"2026-08-07T04:15:01.708465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.406138Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.406138Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:d2179b1b397b3f7fc2d8145d7ccbcfa2433b1e59524cd48851679f594cc1a45c","observation_id":"9f643714-2dfd-4a2f-85c7-56db470cd50e","resolution":{"observed_at":"2026-08-07T04:15:01.406138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.411434Z","title":"V ocalset: A singing voice dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.411434Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:5669bdb6396be021069422b9bf7aba38365f8ee9e1e784601256c302b642d772","observation_id":"72bde471-acc0-4b30-9d79-abc1fd212844","resolution":{"observed_at":"2026-08-07T04:15:01.411434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.417544Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.417544Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:41837b9105b365640c9174dc8c8c21d648661dd40d094b2733130e04670ddb64","observation_id":"7613527d-219a-4dcf-92e5-8614ee19bc2b","resolution":{"observed_at":"2026-08-07T04:15:01.417544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.423820Z","title":"Musical genre classification of audio signals,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.423820Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:8529ec271980fc71ccf9e064ddc86358c2dce80a4fb062f8d8eb6afe3513eb45","observation_id":"b273cf48-e11a-4226-aee5-a87d7fbe8546","resolution":{"observed_at":"2026-08-07T04:15:01.423820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.633253Z","title":"ESC: Dataset for Environmental Sound Classification,","venue":null,"work_id":"921402af-c83b-4870-b36a-85f2c1570856","year":2015},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.432263Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:517f29907fbe01e588a2ae24a63c8f0d57ba89ab30acd731131877d2d33c8496","observation_id":"8a4058a2-92ec-4e4f-9fe1-009f20efadb7","resolution":{"observed_at":"2026-08-07T04:15:01.639505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.612926Z","title":"Ml-superb: Multi- lingual speech universal performance benchmark,","venue":null,"work_id":"98cb07c3-7a70-4cf0-ab75-e3cdc896d252","year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.439600Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:5344dd33ed49acfbf00030d73632550e2574e8676513cb334b946dd32c5789cf","observation_id":"c04c316e-ce36-462e-8220-b5c312456b65","resolution":{"observed_at":"2026-08-07T04:15:01.619122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.591705Z","title":"Layer-wise analysis of a self- supervised speech representation model,","venue":null,"work_id":"241a281f-d119-4592-8847-87e3c9bff00b","year":2021},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.447659Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:eb24a27c21fd0b56cee3bd196bbe42e0335fd3f7eb20d9b5068b3e55ac915298","observation_id":"9db27d17-efdc-4e8d-801c-f8c4fa5fe9b3","resolution":{"observed_at":"2026-08-07T04:15:01.597380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:01.564625Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":"d45b894c-949d-431f-a2e4-fd07f9e7ee26","year":2023},"citing_paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:01.455087Z"},"links":{"citing_paper":"/paper/2506.11403"},"observation_digest":"sha256:6daf39369535f273f9d50fab84b039a060d469b866f90ad0cc9e508f81258871","observation_id":"1bf2b38b-3f76-4610-88f9-43967b2ff431","resolution":{"observed_at":"2026-08-07T04:15:01.574900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11403","last_updated":"2025-06-13T02:04:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T06:50:23.944880Z","submitted_at":"2025-06-13T02:04:33Z","title":"A correlation-permutation approach for speech-music encoders model merging"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2506.11403."}