{"as_of":"2026-08-12T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40654b39c73d760e8e74342104dd30e672b4ccbd80880e4c12977a89f1b05757","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:53:44.257683Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:53:39.652813Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:53:44.519215Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"cited_work":{"arxiv_id":"2506.16020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16020","snapshot_observed_at":"2026-08-06T23:53:44.519215Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","venue":"cs.SD","work_id":"88db29d0-49b5-4886-a578-858e3090d372","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.652813Z"},"links":{"cited_paper":"/paper/2506.16020","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:4f6383802814b5445d7636b0a6cbfc8805bfdab2bb7d0d4a1bbea81a5776e034","observation_id":"ea639187-d110-4431-83f3-880b40a28e15","resolution":{"observed_at":"2026-08-06T23:53:44.614311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16020/citation-record","integrity":"/paper/2506.16020/integrity","json":"/paper/2506.16020/citation-record.json","paper":"/paper/2506.16020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:53.167644Z","title":"As the continuous development of diffusion models [6–12], the naturalness and fluency of syn- thesized singing speech have now approached those of human performances","venue":null,"work_id":"577177e1-7ae1-480e-b0a1-f1d06374c745","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.570507Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:fea93faeb452377096462444bc46d68ed06a5753ada65bf9222f27024ad640ce","observation_id":"52b214e2-5f4f-4332-a795-61f44f5b65f1","resolution":{"observed_at":"2026-08-06T23:53:53.294893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.931447Z","title":null,"venue":null,"work_id":"4fec5d11-7915-4ff8-9bb2-92dff9828548","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.747869Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:ccc4d54b97305e69d6f46c55f51ef5d8b45255a70a27746e7591ef2d1b823b96","observation_id":"1e4c4461-0d32-4f73-83e0-d8b00da30345","resolution":{"observed_at":"2026-08-06T23:53:53.052980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.670147Z","title":"test- seen","venue":null,"work_id":"6ccc916b-db27-4f1a-b1e2-c9ded99864a9","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.855427Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:373f5eb5df37643518b1a76c45cf9d87e16f16f0c5961a308cdfb59f8d3c2c59","observation_id":"506c1bba-3090-49ed-9ec5-2322f40c60c0","resolution":{"observed_at":"2026-08-06T23:53:52.830799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:51.826843Z","title":"VS-Singer consists of a modal interaction network, a decoder based on consistency Schr ¨odinger bridge and a spatially-aware feature enhancement module","venue":null,"work_id":"dc7b1fa2-ef6c-42fa-a59a-f73620b269a2","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.204764Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:302ba52059c5b2fb317469101fd4a67c8ef14acc1538f3a0ef880e263a399b33","observation_id":"277be0cc-4485-447a-a6c9-487e60bc5453","resolution":{"observed_at":"2026-08-06T23:53:51.984203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.438605Z","title":null,"venue":null,"work_id":"96f5cd38-68ad-4f04-bc4a-e91c095d8483","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.987942Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:014fd2a37d326d6ed3c74bd9e6b5168ab30427454c6a43c46636eb62929ad918","observation_id":"ab92c3dd-d228-4d7b-8c13-724f6c3a1018","resolution":{"observed_at":"2026-08-06T23:53:52.547797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.118690Z","title":"7) Sep- Stereo [35], a model that converts mono audio to binaural audio using scene images","venue":null,"work_id":"6136e303-dd57-4cba-87da-4fa8d3fa8a83","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.128440Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:9bef93b53682b534c77f5f998b98a20476dc27f8ad3e3cb11e166e23318be9ca","observation_id":"d4bddf8b-9472-435b-b305-b47b5ffe890b","resolution":{"observed_at":"2026-08-06T23:53:52.268194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:40.946806Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.946806Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:463564dc9b340a66302908e98c7421f5425db90f2b27166b8f85526751e3d495","observation_id":"52f1e380-921e-4605-b131-3406651a4f90","resolution":{"observed_at":"2026-08-06T23:53:40.946806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:51.440945Z","title":"Diffsinger: Singing voice synthesis via shallow diffusion mechanism,","venue":null,"work_id":"048bb385-e3b5-46db-91f5-f60fbaf65f23","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.290437Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:a7590c024e7ecb827efa4aee4b0f85d6a140ec1f06e0cdab66eff42753546c5f","observation_id":"d0f9af91-738f-4989-9de4-300298b27e02","resolution":{"observed_at":"2026-08-06T23:53:51.637949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.978675Z","title":"Visinger2: High-fidelity end-to-end singing voice synthesis en- hanced by digital signal processing synthesizer,","venue":null,"work_id":"543ec96e-d35b-4cf5-84bc-8968d8ae1d1d","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.400396Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:adcd1f620716e01e0553d353017846d789eb0e1b08b7ae32b4d8ce9b6fe8397d","observation_id":"d98e1918-bcd3-461b-ba9e-42dd8f65eb67","resolution":{"observed_at":"2026-08-06T23:53:51.216181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.814118Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head,","venue":null,"work_id":"82e58522-0765-4a89-9cc2-22ec023edbe7","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.478105Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:f9d24f9e59d53e34d4ec9ac2f2fc2a98b30cfd8531837d5de93880fea0982488","observation_id":"6020805f-aa77-4bcd-80b9-29d618d53d66","resolution":{"observed_at":"2026-08-06T23:53:50.874815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06307","last_updated":"2024-09-10T08:07:43Z","snapshot_observed_at":"2026-07-06T19:13:02.270190Z","submitted_at":"2024-09-10T08:07:43Z","title":"An End-to-End Approach for Chord-Conditioned Song Generation","version":1},"cited_work":{"arxiv_id":"2409.06307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.06307","snapshot_observed_at":"2026-08-06T23:53:44.395930Z","title":"An End-to-End Approach for Chord-Conditioned Song Generation","venue":"cs.SD","work_id":"a5a968d3-3844-49ab-867d-010d8e79482e","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.561586Z"},"links":{"cited_paper":"/paper/2409.06307","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:3abfa6ff21fdb9126c0d90b99394205393046733500eb37ec0d38eda410a5067","observation_id":"09c9318b-5542-4054-b79f-2687f059b699","resolution":{"observed_at":"2026-08-06T23:53:44.430171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.674168Z","title":"Unisyn: an end-to-end unified model for text-to-speech and singing voice synthesis,","venue":null,"work_id":"67d630e8-db64-4b4d-bfa6-4851925a2e45","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.663144Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:6844fe3d6ba93ff8aa400cf4b9f142c12a35b6724767ad5df14567c0d1a219a1","observation_id":"c088f08b-dec3-49b5-b3b5-ef3c8cc19328","resolution":{"observed_at":"2026-08-06T23:53:50.765455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:40.784747Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.784747Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:f2286008e67d118bfe0a6c477bb8e645b4759236db31c43c4f8eb1c866aaafec","observation_id":"773e026a-481e-4ded-9e08-7b799704bf1b","resolution":{"observed_at":"2026-08-06T23:53:40.784747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.976473Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":"230e1e5a-d683-41b8-b976-1954f839628f","year":2021},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.697669Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:317caf0923c7cf4f6b94162be9a44fb89f6140423fff85447d2c721c3ac631dc","observation_id":"f3e481f1-25ae-4764-bc6f-92bfbadd4674","resolution":{"observed_at":"2026-08-06T23:53:49.046653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.430481Z","title":"Learning the beauty in songs: Neural singing voice beautifier,","venue":null,"work_id":"0de85aa1-658f-412f-988f-eccb54642da8","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.075668Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:bdd586403086979fd968468e52f1e18c86c2a769d2d0b7fb0813fed3aaf49f81","observation_id":"c524afbb-bf39-4a08-a685-cf7d4cd61a08","resolution":{"observed_at":"2026-08-06T23:53:50.499591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.177767Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models,","venue":null,"work_id":"faaa4138-b819-4aaf-aa75-9c56941cf684","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.185792Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:4ea61c56c9e6fb01497a5c1d10778c75456ef820d0dded8fd16f0e73c16ab4c9","observation_id":"1d54c7ef-8809-4841-9688-b83bfd164986","resolution":{"observed_at":"2026-08-06T23:53:50.317937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.930709Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion,","venue":null,"work_id":"ade03273-bd0e-478d-adf0-30c5953c7580","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.315721Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:e67ed4963b9d74dd8a6a832dda5bc3f4b8d7b47e1429eddba689d227e0f6f34d","observation_id":"99d8ab57-2439-4cf3-a06a-dcfcecd73e90","resolution":{"observed_at":"2026-08-06T23:53:50.033407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.671677Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation,","venue":null,"work_id":"f4cf0992-5a83-42e5-b358-bbb5207029ef","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.409879Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:23fd5296b99db9618c67f3410f66ea2b50f5b3c702aaaf886c3e6f15bf9f3bfa","observation_id":"199a1995-ba54-4999-876c-43f6e67dbf4d","resolution":{"observed_at":"2026-08-06T23:53:49.783454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.423473Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":"cb9adbb7-e18a-46e0-8a72-a8798c3af094","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.541143Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:3b89b3c0121f74c12d70b63bf95284891c3124111468e9674c81b7db632e3e5f","observation_id":"1f057377-e4ef-48be-9bb6-1bff537e9148","resolution":{"observed_at":"2026-08-06T23:53:49.548243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.154131Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":"1cdc8732-3dd6-4c9b-9574-ecc8cf3ba8db","year":2021},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.601848Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:b834dde759742fdd20a96536ccca725fe68dc069da19f11face33c17a1c5893c","observation_id":"c9d916d6-6dcf-47b5-962b-70de28f610e6","resolution":{"observed_at":"2026-08-06T23:53:49.292215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.492140Z","title":"Novel-view acoustic synthesis,","venue":null,"work_id":"a9739765-20f1-40a8-a06e-d776553332da","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.602814Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:0576bd04b97f29b0a2f7dd8d809dbd9c3c96ba4f665eb8b437eee1e77e9c4cd4","observation_id":"953b44ab-1be8-41db-a904-2aa718c0b47f","resolution":{"observed_at":"2026-08-06T23:53:47.582153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.780381Z","title":"Como- speech: One-step speech and singing voice synthesis via consis- tency model,","venue":null,"work_id":"bca88b76-814e-4fb8-9592-ffc5c91219bc","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.831441Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:e89920f85d14231433f422e66e53df70f47dbb28c2c409cfd0359cfb35ef4f04","observation_id":"6b7b15d7-71e0-4583-aecd-21ce5fd23faa","resolution":{"observed_at":"2026-08-06T23:53:48.915571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.528652Z","title":"Consistency models,","venue":null,"work_id":"99d0b27e-5936-4a41-8f83-7eaac1935ed4","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.994604Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:cff11f0c695aadfda5efc4ef64755946f9baa96226c966656ff46c837ed0c255","observation_id":"35035fff-63ed-4215-a90d-49f5ca2bf935","resolution":{"observed_at":"2026-08-06T23:53:48.652424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"cited_work":{"arxiv_id":"2506.16020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16020","snapshot_observed_at":"2026-08-06T23:53:44.519215Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","venue":"cs.SD","work_id":"88db29d0-49b5-4886-a578-858e3090d372","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.652813Z"},"links":{"cited_paper":"/paper/2506.16020","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:4f6383802814b5445d7636b0a6cbfc8805bfdab2bb7d0d4a1bbea81a5776e034","observation_id":"ea639187-d110-4431-83f3-880b40a28e15","resolution":{"observed_at":"2026-08-06T23:53:44.614311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T23:53:42.127548Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.127548Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:c41f8b7c66b6faec0398f6d9410defff19c1ef2461af2756c9da4f3456967262","observation_id":"762799b2-c25c-48d3-be60-9f847c2a8a4d","resolution":{"observed_at":"2026-08-06T23:53:42.127548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.181161Z","title":"2.5 d visual sound,","venue":null,"work_id":"b30357fa-b856-41a0-9ac9-21e18266ca90","year":2019},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.249129Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:595ca73c8879e2837ab5b787928668a4d2eaca551f86366516cd67a531953e0e","observation_id":"66992bb6-d77c-48a6-9a8a-0f57d0865c82","resolution":{"observed_at":"2026-08-06T23:53:48.339568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.923032Z","title":"Enhancing spatial audio generation with source separation and channel panning loss,","venue":null,"work_id":"3b5dd369-358e-456e-bff6-7256709b2ff1","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.339805Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:0a95421314f8bf8028290da76d8622802324a351294965ade92c889e23679c8a","observation_id":"aafe6f73-5b3a-4638-86d2-35aef7133339","resolution":{"observed_at":"2026-08-06T23:53:48.071677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.670325Z","title":"Multi-source spatial knowledge understanding for immersive visual text-to-speech,","venue":null,"work_id":"97f83673-419b-40fc-8884-0b0e03b94f98","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.456963Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:50488315794191db1d36f8c6612948e8b9694a638370feb7fe7b42b217ab9002","observation_id":"6f054485-c628-454a-8b32-7a6c2efb7461","resolution":{"observed_at":"2026-08-06T23:53:47.807211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.228803Z","title":"Visually guided binaural audio generation with cross-modal consistency,","venue":null,"work_id":"fe256f6e-c17b-43a9-939b-b1b242b94d44","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.753463Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:ee9746b5eb58ff954d1bf9528ed0f0e628d40c142761f72ebdf5146660119102","observation_id":"be610d70-f0ab-47ef-8361-5ed037b37824","resolution":{"observed_at":"2026-08-06T23:53:47.365066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.917991Z","title":"Multi-modal and multi-scale spatial environment understanding for immersive visual text-to-speech,","venue":null,"work_id":"5bbcfe48-f415-4bee-8bf0-40029ea8f836","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.846974Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:bb0b7d1e482ce2bede1d4797e7030e07178b9e34b8579533e93f36912835487c","observation_id":"af230ae0-97c4-4739-8772-9a4b993b04f0","resolution":{"observed_at":"2026-08-06T23:53:47.055369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.720178Z","title":"Opencpop: A high-quality open source chinese popu- lar song corpus for singing voice synthesis,","venue":null,"work_id":"4affb1a1-0528-4c2c-bb62-b20279813a52","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.944905Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:0778814fdb104e99c14c2bf9ac7855a9b4a810259c4cbf12448b0671759fb9cc","observation_id":"c799f48e-d42e-4be5-9312-64db73ad783a","resolution":{"observed_at":"2026-08-06T23:53:46.792475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:43.052802Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.052802Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:803818da6f4059cde13437cf74c57a777102adfde7fe7f2f8afe38946ea70c6b","observation_id":"6a410bcf-9fb6-404e-828c-75bea8fa0ee0","resolution":{"observed_at":"2026-08-06T23:53:43.052802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.479552Z","title":"Diffusion schr¨odinger bridge matching,","venue":null,"work_id":"6bfe70bb-14f6-4682-ad93-2b13017561ed","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.170695Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:bf336c4743e0c63ae92520edc33ccc15b9263a1505ca0ab54018c5f6fec4bd03","observation_id":"e5c29d9c-fdd8-4f27-b17a-584b1dd191b9","resolution":{"observed_at":"2026-08-06T23:53:46.625428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.302759Z","title":"Likelihood training of schr ¨odinger bridge using forward-backward sdes theory,","venue":null,"work_id":"929a83df-7b9e-4d6d-b66a-0bfad595d5fa","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.271303Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:0a3ea607df1fcd5489b52971f2bd4e66458c76f0d27dd1ca7a9b2faac000091f","observation_id":"dc9a9d56-171f-4a64-914a-df7ef556c927","resolution":{"observed_at":"2026-08-06T23:53:46.384510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14623","last_updated":"2024-10-29T02:54:10Z","snapshot_observed_at":"2026-08-03T08:16:20.710004Z","submitted_at":"2024-03-21T17:59:41Z","title":"Simplified Diffusion Schr\\\"odinger Bridge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14623","snapshot_observed_at":"2026-08-06T23:53:43.454000Z","title":"Simplified dif- fusion schr\\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.454000Z"},"links":{"cited_paper":"/paper/2403.14623","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:fa809fe59a975dabb36997c48dbc7bf95b49e9899d7f16df5d38cabc8785ad38","observation_id":"1489dcf6-c11b-40ad-b9d3-f44e0dcf7b08","resolution":{"observed_at":"2026-08-06T23:53:43.454000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.086664Z","title":"I 2sb: Image-to-image schr ¨odinger bridge,","venue":null,"work_id":"8750406b-ab68-4c42-8446-f740094ac490","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.577638Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:cd018230fcef8da0cf4a093a4b512b687bea907bc20b1710c86466a4db9fcb7f","observation_id":"4713961d-e9ee-432c-b691-bece85ce1578","resolution":{"observed_at":"2026-08-06T23:53:46.162553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.858205Z","title":"The unreasonable effectiveness of deep features as a perceptual met- ric,","venue":null,"work_id":"b76eedfc-14d9-49a0-bb17-3f14ecaf8732","year":2018},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.667055Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:03587652fb94eebe8d1d70740d46656ca3683829d0a8b88b87158d41fe5d5186","observation_id":"6c5ec59b-df2f-4f53-b61d-e06d87539de2","resolution":{"observed_at":"2026-08-06T23:53:45.994718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.666831Z","title":"Visual acoustic matching,","venue":null,"work_id":"4c16389d-1094-4bfd-a523-5e9ca473d12a","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.819082Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:a96846da6036c4bee02646e134b70c14e0318b3c4e2eb3120e25b5c8668e0c2f","observation_id":"69fd5a5a-6235-4337-99af-87d15d8e698a","resolution":{"observed_at":"2026-08-06T23:53:45.754757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.395163Z","title":"Ima- genet: A large-scale hierarchical image database,","venue":null,"work_id":"3eda9f2f-c14e-4777-a8ca-4be7ba23cbc1","year":2009},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.931528Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:7b81dd74a09b3d0cd1f7d8ea73fc5169e1c1d8bab4b60e6b89a63a22932d8f73","observation_id":"82807bfe-5b9f-44c1-a1c7-768225211a68","resolution":{"observed_at":"2026-08-06T23:53:45.514262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.199091Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"83a23511-7313-4c67-8351-b5eb89c2c1cf","year":2021},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:44.050995Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:2edfb35a8dee892cd8f34294501070513bd5784c7bb0a3d4429ef2cb8aa08193","observation_id":"1ab969e2-2260-4507-92e2-0b1980acaa83","resolution":{"observed_at":"2026-08-06T23:53:45.249542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:44.958799Z","title":"Self-supervised vi- sual acoustic matching,","venue":null,"work_id":"49f31148-1fe5-410f-9c76-d49c45c3d0db","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:44.171093Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:236e60f01dfdaa0407c249aff9875537e8b074dfb24d99c2dbcd6312f3066ac0","observation_id":"2e876622-dc92-42a8-bd94-09c3e13b7a74","resolution":{"observed_at":"2026-08-06T23:53:45.071008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:44.761718Z","title":"Sep-stereo: Visu- ally guided stereophonic audio generation by associating source separation,","venue":null,"work_id":"a0c52b77-e6e6-4a16-a635-a5542b1eea54","year":2020},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:44.257683Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:c99233571487871039326571f36b58a417f772e544d87099dc9d4b5fa4484de2","observation_id":"feda8574-5c2b-480e-bd39-342582047854","resolution":{"observed_at":"2026-08-06T23:53:44.843365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T18:04:31.211802Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.16020."}