{"as_of":"2026-08-08T10:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6917c11cd43af977c1175bc256f4e10c6e934a7a052fc52f6ac18ac314e8554","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:10.917974Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:08.307554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:01:29.067292Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02499","snapshot_observed_at":"2026-08-07T11:26:08.307554Z","title":"Typically, this task defines speech, music, and effects as the exclusive target stems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.307554Z"},"links":{"cited_paper":"/paper/2506.02499","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a8cb1c54c728df5616306d70f95f30ebca5651b82705bb9dadb477bea6635843","observation_id":"4bc3b4e2-93ef-4f46-ba8b-e6b2a40ac92e","resolution":{"observed_at":"2026-08-07T11:26:08.307554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"cited_work":{"arxiv_id":"2506.02499","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02499","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dnr-nonverbal: Cinematic audio source separation dataset containing non-verbal sounds","venue":null,"work_id":"b97d9fec-a715-4cce-a83a-a2cad3c260c4","year":2025},"citing_paper":{"arxiv_id":"2604.27403","last_updated":"2026-07-08T04:19:16Z","snapshot_observed_at":"2026-08-02T15:09:56.130206Z","submitted_at":"2026-04-30T04:14:58Z","title":"A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T08:16:56.671345Z"},"links":{"cited_paper":"/paper/2506.02499","citing_paper":"/paper/2604.27403"},"observation_digest":"sha256:04d0217d645de2714f93a173a2314203307950d38aec83b0794236a9bd8a37b6","observation_id":"caee2fc7-fefb-4d55-bb43-363e3ab0548b","resolution":{"observed_at":"2026-05-12T10:01:29.070570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02499/citation-record","integrity":"/paper/2506.02499/integrity","json":"/paper/2506.02499/citation-record.json","paper":"/paper/2506.02499"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02499","snapshot_observed_at":"2026-08-07T11:26:08.307554Z","title":"Typically, this task defines speech, music, and effects as the exclusive target stems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.307554Z"},"links":{"cited_paper":"/paper/2506.02499","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a8cb1c54c728df5616306d70f95f30ebca5651b82705bb9dadb477bea6635843","observation_id":"4bc3b4e2-93ef-4f46-ba8b-e6b2a40ac92e","resolution":{"observed_at":"2026-08-07T11:26:08.307554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.663524Z","title":null,"venue":null,"work_id":"691b6bef-1b6d-4127-a159-4246e4a2648d","year":null},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.397233Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:ff5361b4fdb6546a6f71dda878c08fffaa16822f6401d62375f72aee8f9223d6","observation_id":"477113ed-8c3a-4570-9f59-53ac54726830","resolution":{"observed_at":"2026-08-07T11:26:13.691594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.627617Z","title":"Motivation In the actual movie audio, we can decomposex s as follows: xs =x v +x n,(2) wherex v andx n correspond to the waveforms of verbal and non-verbal sounds, respectively","venue":null,"work_id":"6a8d255f-8572-4e3e-a2a2-6a08105c2ec1","year":1968},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.494147Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:29574a91117df096f469ee1ecb2657a0a15deffc82b2d73e834bae6af2a51d0b","observation_id":"240f02a4-00a8-467e-85ed-205cb400a7a6","resolution":{"observed_at":"2026-08-07T11:26:13.633367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.607983Z","title":"Settings To evaluate the effectiveness of the proposed dataset, we con- ducted CASS experiments","venue":null,"work_id":"c21af749-dbc7-4f18-88ab-af5449524395","year":null},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.559016Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:5ffa8f041740d15bbfa9e50eef6cc00c09cc19ab52f3d9360cde68bbeee23a9f","observation_id":"863e12a4-1327-4f5c-9934-ab957207a5b1","resolution":{"observed_at":"2026-08-07T11:26:13.612512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.590035Z","title":"To address this issue, we built a new dataset containing non-verbal sounds namedDnR- nonverbal","venue":null,"work_id":"4980aadf-f9bb-4333-a20f-c519b5a4dd21","year":null},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.675340Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:ed3cdcf07f6b907e1640ea1c2221b2fa3764fb83e6f8a27b50b297dcc2c47768","observation_id":"3b355aea-c3fd-4d79-9704-b58a086f8e51","resolution":{"observed_at":"2026-08-07T11:26:13.596545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.573387Z","title":"The sound demixing challenge 2023-cinematic demixing track,","venue":null,"work_id":"d9bd7663-7fe3-485b-921c-6414b139c433","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.754633Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:37b8676df0646bec82d641d3b7297db9cfd86fd11d189138e68a34ca878b06c7","observation_id":"5260f1eb-e6ad-44bd-9c9d-4ddd636f6c02","resolution":{"observed_at":"2026-08-07T11:26:13.579211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.555343Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":"dbcaf6ef-06fc-4a41-b188-154636baa7c6","year":2018},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.834619Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:8ce9457fdaf742bb5b1876e4f54456d1d14dd1a3d13c8bfcd6f91efa1a5bf045","observation_id":"853dc9ba-605b-4674-a8fc-b52f466a530d","resolution":{"observed_at":"2026-08-07T11:26:13.561698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.533663Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"9cac7c1c-983c-4a90-861b-cfbe9fbfd804","year":2019},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.966726Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:f08c258466cc50396faf533ee7b250608cf2bfe74fa1aa97205200994950a039","observation_id":"a6eadb68-fd61-42e2-9745-bdf983223694","resolution":{"observed_at":"2026-08-07T11:26:13.542876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:09.054261Z","title":"TF-GridNet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.054261Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:7d024604d781476be354863fb762789b1282a4b3838775607b05a768dbb2ceca","observation_id":"bbb4d0b9-de4e-40fc-88e8-c020c634f3c7","resolution":{"observed_at":"2026-08-07T11:26:09.054261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.505936Z","title":"The 2018 signal separation eval- uation campaign,","venue":null,"work_id":"a672f192-c546-4137-92ff-3965411bf1ed","year":2018},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.130709Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:fdbe94a1fca8f5ce7156026de1bcf6940df925cbe609603be078a475390684a5","observation_id":"c314b9b3-8fe4-4a57-b994-a22666d5099c","resolution":{"observed_at":"2026-08-07T11:26:13.513919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.484223Z","title":"Open- Unmix - a reference implementation for music source separation,","venue":null,"work_id":"7bf223fe-4508-4452-8876-734359e3b4da","year":2019},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.206282Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:c215fbd759ec42af5b6ec3b4a7244ff30686720b4e7fe1bcd5a5091ede6dcf48","observation_id":"08e9fa2b-41cb-4588-8611-2d27d872c9a3","resolution":{"observed_at":"2026-08-07T11:26:13.492320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.464332Z","title":"Hybrid transformers for music source separation,","venue":null,"work_id":"66d865b5-9cbc-4e36-a327-b8dbf825b5de","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.309694Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:cbf73e0b68f4bbbcf70b56438803583a2bd02647d89d39a4a45ab2f2a9bb807d","observation_id":"94ae7cea-4d47-4906-bd38-e3e254de2160","resolution":{"observed_at":"2026-08-07T11:26:13.470963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.443518Z","title":"Universal sound separation,","venue":null,"work_id":"30bb1ec4-6dc6-4124-affe-ecb1e7b81e0e","year":2019},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.391215Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:8f8be28cee2ed926be949d3fa4c1c07c3f73bf3c38bcf763657da6eb0701fd50","observation_id":"452d209e-b91f-4382-aa50-02423d4e3b70","resolution":{"observed_at":"2026-08-07T11:26:13.451787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.424687Z","title":"The cocktail fork problem: Three-stem audio separation for real- world soundtracks,","venue":null,"work_id":"f46acc24-5cbb-45f6-a787-d188ba1cba63","year":2022},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.462321Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:4ade7e7984e4d2e131ad2f6c6bcce97f40f6e6f1cadc65c35d4ff8c523e7c981","observation_id":"8841dde0-c76c-43ad-a949-2bfb315154a6","resolution":{"observed_at":"2026-08-07T11:26:13.432325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.405764Z","title":"A general- ized bandsplit neural network for cinematic audio source separa- tion,","venue":null,"work_id":"67523f5b-4c5e-4c4d-a858-fc66fa9ab84d","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.546046Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:ac9bce280f67667fb6566b7d4d0877a4eafb5822d4d584add797aab3b2ca2340","observation_id":"21b927c6-b541-4d7e-a111-79d74a476add","resolution":{"observed_at":"2026-08-07T11:26:13.413048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.384220Z","title":"Music source separation with band-split RNN,","venue":null,"work_id":"6469342c-7291-4a9b-aa7f-2bbe9c3ce647","year":1901},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.655749Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:0920097987340d65dc8764db54771623ffa91d97918aefddfb35522d78e4e066","observation_id":"b136c3a8-04ec-4a30-ac97-fbd73ea42424","resolution":{"observed_at":"2026-08-07T11:26:13.392521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.365380Z","title":"Lib- riSpeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"51fd529b-610a-4f63-8fb3-386210d27546","year":2015},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.733574Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:2c4829f01efa4c065da702f6427116878b7cf12108e1337a79390955f7f84f2b","observation_id":"ec275346-37c0-4174-9872-8a9592af11af","resolution":{"observed_at":"2026-08-07T11:26:13.369763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.273355Z","title":"FMA: A dataset for music analysis,","venue":null,"work_id":"6ba68a84-4dcb-401a-8368-960fdc66f0ac","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.819652Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a1cd55c91de96f1668ff69f21568126f6d4efdc0ccea00a65ad0290d381c8e32","observation_id":"9b6ec578-7f61-4172-9148-91bed59b0c0b","resolution":{"observed_at":"2026-08-07T11:26:13.322807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-02T22:15:33.611696Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-07T11:26:09.913604Z","title":"FSD50K: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.913604Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:6af201b0abce6b21551ca1f4da8489825325bb8de8cfd1927b9708d0045fc913","observation_id":"67de3525-a519-43b2-88af-a073a98efd70","resolution":{"observed_at":"2026-08-07T11:26:09.913604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.074123Z","title":"Remastering di- vide and remaster: A cinematic audio source separation dataset with multilingual support,","venue":null,"work_id":"d21a1dc9-5ede-43d7-95cc-86d66728242a","year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.009245Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:80f034f4c7aad454ea49ab675ce77f85f12a0a6ddf56ca4b4bec1625e4c4f366","observation_id":"188cfe9e-2344-4090-b6b5-6b75da1901db","resolution":{"observed_at":"2026-08-07T11:26:13.168035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:12.849383Z","title":"Hy- perbolic audio source separation,","venue":null,"work_id":"766561c5-2381-4dca-9b1a-43b110cc4fda","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.138699Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:f6111716eb56babcec7f1d5d69c1175c53de253a87fb17a0665e7fbc8491d4e7","observation_id":"7fff145e-f462-4997-a7c8-7e4cb70e19e4","resolution":{"observed_at":"2026-08-07T11:26:12.918502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:12.671110Z","title":"PodcastMix: A dataset for separating music and speech in podcasts,","venue":null,"work_id":"0b08f75c-947f-486e-8f0a-531fe46c0a54","year":2022},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.209784Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:19edb6d9257202095d8e96cf8a8ded954723812f2732af08f9dfbe286ef7fefe","observation_id":"e4b34b3d-ccec-44a3-a532-c59dc6312802","resolution":{"observed_at":"2026-08-07T11:26:12.830047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11275","last_updated":"2024-04-17T11:31:16Z","snapshot_observed_at":"2026-08-08T06:17:03.893613Z","submitted_at":"2024-04-17T11:31:16Z","title":"Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation","version":1},"cited_work":{"arxiv_id":"2404.11275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.11275","snapshot_observed_at":"2026-08-07T11:26:11.024932Z","title":"Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation","venue":"cs.SD","work_id":"bc6f7c29-0b78-469f-8073-4aa70dff11cd","year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.280208Z"},"links":{"cited_paper":"/paper/2404.11275","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:4269ed5ef062ab0edb9f82edae0c1844254dfe2247ee3444924952f21b61b1a7","observation_id":"bc6ca3bc-edb9-4db9-81d4-183c49c8bdc7","resolution":{"observed_at":"2026-08-07T11:26:11.116952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:12.325796Z","title":"CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":"91e7409f-2e08-4da4-b5ac-5cb94717ac89","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.372449Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:3f908afc6fe3ef24248da8a3954e85cda39f86655914e97c9f63c9765704b168","observation_id":"cfd91ca2-5a4d-4c17-a42d-6061da0cf752","resolution":{"observed_at":"2026-08-07T11:26:12.496001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.935907Z","title":"AISHELL-1: An open-source Mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"0ce2bfa6-e494-4115-9667-2bca736d09be","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.443563Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:6b868b9a82d1daef60ea7c8d60eaaaa0e561372c108c006686bc7cd1c3219e85","observation_id":"ba438656-0a9a-4d98-b8b3-3e3e0131593e","resolution":{"observed_at":"2026-08-07T11:26:12.158601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.568977Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"26862de7-84fd-45aa-a7bb-664aabf9d635","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.537215Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:8e8efa356b12c973f34344cf2fcb54308e60eea5f17e1585b93891ef6d99e029","observation_id":"da66c525-b791-4f70-b319-f46780d29c71","resolution":{"observed_at":"2026-08-07T11:26:11.749914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:26:10.608433Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.608433Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:0b197733c69dfdb59fc3b452bceff0b5d311876f26ac506e0d6f9f9410e50c07","observation_id":"2f38cb89-90c3-4efc-a684-0e9f230f34ef","resolution":{"observed_at":"2026-08-07T11:26:10.608433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.509090Z","title":"Toward a recommendation for a European standard of peak and LKFS loudness levels,","venue":null,"work_id":"9ce86138-d767-4ea1-8d22-cc36c3d306cd","year":2010},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.684202Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:15a0a321bccdf09c40e372bbe77cce068bbc27f4602a3d854a93435772fb7cde","observation_id":"2b12572a-98b7-40e1-982f-7e4a3623e13e","resolution":{"observed_at":"2026-08-07T11:26:11.515817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:10.770747Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.770747Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:30759cb96cacb7ecdd3a4dd65070c5ea64b086e591f23281394a41bf9fae590b","observation_id":"59bec6dc-e9bc-4d7a-9212-5e66caa09e6b","resolution":{"observed_at":"2026-08-07T11:26:10.770747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.363747Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"0495a5fc-3d9d-4a1a-88fc-117d7db88f2a","year":2015},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.865536Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:d7cbde301dd659c20f6c09d6cec2b2ef9b7fe3445073fbf17d3934de85f7cbbd","observation_id":"b1910e17-cd90-41d9-b1cc-604b71c8a438","resolution":{"observed_at":"2026-08-07T11:26:11.421775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.243161Z","title":"Why does music source separation benefit from cacophony?","venue":null,"work_id":"51c97b25-cdad-4c43-b07c-ba0a347b0c59","year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.917974Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:c99a9c763a9d40796fb0f24e51b3bef87e703f4fbb603c4291772453b37a28fd","observation_id":"29f827db-996a-4237-a769-64a90c6b7694","resolution":{"observed_at":"2026-08-07T11:26:11.293933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2506.02499."}