{"as_of":"2026-08-08T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cccfa6b70ae789b79b9c516b3611714080d8a51323743350495dc895595f3e0","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:10.491851Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:07.961535Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:07:10.886803Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"cited_work":{"arxiv_id":"2505.16279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16279","snapshot_observed_at":"2026-08-07T15:07:10.886803Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","venue":"cs.MM","work_id":"2e902d2d-7cf8-4801-90ae-7c820e59ecce","year":2025},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:07.961535Z"},"links":{"cited_paper":"/paper/2505.16279","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:f2a4efac0b2582b2ae846d8218fd6325bb95f46c1958767b104c8e5282fa7f7d","observation_id":"74e62b26-d73e-4307-998b-7010f449b1a2","resolution":{"observed_at":"2026-08-07T15:07:10.927698Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16279/citation-record","integrity":"/paper/2505.16279/integrity","json":"/paper/2505.16279/citation-record.json","paper":"/paper/2505.16279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.866916Z","title":"Exist- ing dubbing methods can be categorized into two groups, each focusing on learning different styles of key prior information to generate high-quality voices","venue":null,"work_id":"a07b9d77-2f9c-4bec-81bd-55a9c91e9ed2","year":null},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:07.840682Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:3c4334e7fb72fb78f660667575cd2339f8bf470d3f3f3be2a88f8d129e3b1ebb","observation_id":"c74c4cec-69f9-42aa-861a-f36edf271657","resolution":{"observed_at":"2026-08-07T15:07:13.014975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"cited_work":{"arxiv_id":"2505.16279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16279","snapshot_observed_at":"2026-08-07T15:07:10.886803Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","venue":"cs.MM","work_id":"2e902d2d-7cf8-4801-90ae-7c820e59ecce","year":2025},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:07.961535Z"},"links":{"cited_paper":"/paper/2505.16279","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:f2a4efac0b2582b2ae846d8218fd6325bb95f46c1958767b104c8e5282fa7f7d","observation_id":"74e62b26-d73e-4307-998b-7010f449b1a2","resolution":{"observed_at":"2026-08-07T15:07:10.927698Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.690747Z","title":"Datasets Emilia is a comprehensive multilingual speech generation dataset containing a total of 101,654 hours of speech data across six languages [21]","venue":null,"work_id":"02adaa51-c99c-49d6-bf75-09b64de7250c","year":null},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.031502Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:dacde5c25a488a089a857b559ce8fa4e0a18eca93c17677be656e10499bda825","observation_id":"907a7eee-cea2-48df-a5a4-d728b32c66ec","resolution":{"observed_at":"2026-08-07T15:07:12.775612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.589431Z","title":"To as- sess pronunciation accuracy, we use Word Error Rate (WER) with Whisper-V3[24] as the ASR model","venue":null,"work_id":"45bfcc42-d591-4961-a0e1-7a0b44b8a40c","year":null},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.114058Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:d2112126ecb36c5c275bae80c9afc4c41b1166d52062f7c109b27b0f56b072e5","observation_id":"375117c2-b77b-41b1-86d7-a80476fd686f","resolution":{"observed_at":"2026-08-07T15:07:12.637611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.499136Z","title":"Additionally, we have de- veloped a movie dubbing dataset with multi-type annotations to enhance movie understanding and improve dubbing quality","venue":null,"work_id":"3d11b25a-171a-475f-8dac-b47d1d8b2d45","year":null},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.198474Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:d9ddafa999fe65bac61cc3a642b8d7414fa8ff1f7b4901dc20389e923957157b","observation_id":"498d685b-d814-4216-89ac-e165952d658e","resolution":{"observed_at":"2026-08-07T15:07:12.543048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.398590Z","title":"V2c: Vi- sual voice cloning,","venue":null,"work_id":"69a5b834-8fb7-4d5c-a205-75dcdbaa6eb7","year":2022},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.292579Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:4c182ffb3cd4556c2e3c06fe3b5c725a9cf6cd8973a019cb96c9f8a5d7b6338c","observation_id":"0aea5d8d-5aee-43db-9ce9-3407e0333e0f","resolution":{"observed_at":"2026-08-07T15:07:12.439554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.287407Z","title":"More than words: In-the-wild visually-driven prosody for text-to-speech,","venue":null,"work_id":"cef5cd9e-0498-4fca-a1bb-b366b04019a5","year":2022},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.360687Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:ee0ac035c275cae9d0e47f18e15c425bd1acdd872a4ff9b567beb32268e394e3","observation_id":"fc319574-6ad6-4352-ad12-923d5cb6d196","resolution":{"observed_at":"2026-08-07T15:07:12.336180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:08.454604Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.454604Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:630556f3f3ace516e9cd21b9b642393173f3aa66554f9e4b3a2fc2cadef08f95","observation_id":"575950f6-6b37-4f81-b5a9-6886c6669eb4","resolution":{"observed_at":"2026-08-07T15:07:08.454604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.147867Z","title":"Learning to dub movies via hierarchical prosody models,","venue":null,"work_id":"6ab7ef45-360d-41c2-8b91-7f2eaf8a2cb5","year":2023},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.557957Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:8c7c7867fc00a05a1dcd19068220676fa5f169e835e51108a7ccdc9409f72d8c","observation_id":"d6475ee3-f567-450d-b6ad-8bbabb0b15de","resolution":{"observed_at":"2026-08-07T15:07:12.220221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.989721Z","title":"Neu- ral dubber: Dubbing for videos according to scripts,","venue":null,"work_id":"0eed9419-a941-437c-8425-b53286c12841","year":2021},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.676630Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:afd1a2e05667f41f3c753409fdc15d9dd75f23527c8e91c6ce851f85e6bc5bba","observation_id":"52d242fa-daf6-4206-9957-d93433bf20b2","resolution":{"observed_at":"2026-08-07T15:07:12.046317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.917247Z","title":"Imaginary voice: Face- styled diffusion model for text-to-speech,","venue":null,"work_id":"516d2281-e0ad-4069-a28d-0eb74b1a31c7","year":2023},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.818516Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:716a01894a2aa5ccc169ce1e4d8c50219701b3cdb839320cc3569767c694f3e4","observation_id":"bc5635ba-34aa-4c19-942f-ce1a908c9175","resolution":{"observed_at":"2026-08-07T15:07:11.944032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.829053Z","title":"Mcdubber: Multimodal context-aware expressive video dubbing,","venue":null,"work_id":"69c45c28-161a-465a-8866-26312b81850b","year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.943533Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:01ee7e1decad83cf33ae319d28515a68ee7c1f796f650044b0a1219f9e259c1b","observation_id":"0912692c-d95d-4188-8855-7853c0c477ef","resolution":{"observed_at":"2026-08-07T15:07:11.867601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.711938Z","title":"Audiopedia: Audio qa with knowledge,","venue":null,"work_id":"b9c116c8-d9d6-4072-aea3-7c234a711953","year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.054916Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:c72154e55e351836fac1caf3d9d92be5e994223742a9b8e13f02080931b79324","observation_id":"4c9175e7-1513-408d-8ac9-b6bb9cec84cd","resolution":{"observed_at":"2026-08-07T15:07:11.766439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T15:07:09.148574Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.148574Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:1a33749ee970974e96b003b4ecdddf4377da2b11e7b92ac65ca554f403fc9164","observation_id":"e501b4aa-ab4b-48e9-bb12-9dc7b57355a7","resolution":{"observed_at":"2026-08-07T15:07:09.148574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:07:09.258423Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.258423Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:e929d9827d4a1effb479bcc4b5a067fb5b6401d63864ee2a303cf06cdd9041ff","observation_id":"f8be3954-69be-438e-9ad5-4432531ef75d","resolution":{"observed_at":"2026-08-07T15:07:09.258423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.632475Z","title":"Learning to dub movies via hierarchical prosody models,","venue":null,"work_id":"4a298270-1e3b-402b-b85b-3350cf411bfd","year":2023},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.359041Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:3a978b799a30e79190a18e2ba1f59e95e5f8826c340b7251082573c441955a89","observation_id":"6f78254c-f256-495b-aee1-8f76d4b0dadb","resolution":{"observed_at":"2026-08-07T15:07:11.669537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12636","last_updated":"2024-07-02T03:42:36Z","snapshot_observed_at":"2026-08-04T01:46:02.995114Z","submitted_at":"2024-02-20T01:28:34Z","title":"StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12636","snapshot_observed_at":"2026-08-07T15:07:09.453123Z","title":"Styledubber: Towards multi-scale style learning for movie dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.453123Z"},"links":{"cited_paper":"/paper/2402.12636","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:a21dec0eb6d230630f21d7b95e4e8b2210540423f08705d327c959cd1c05fcba","observation_id":"37ce9657-f384-4ed4-a705-5791653bab47","resolution":{"observed_at":"2026-08-07T15:07:09.453123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.550076Z","title":"From speaker to dubber: Movie dubbing with prosody and duration consistency learning,","venue":null,"work_id":"dfbcc79a-3585-437f-88c4-e722b37f273e","year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.527245Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:b9a30185a6a68f995cfca42352d82009a2edeaba747db4713f5eda433574c7d5","observation_id":"3a0d21ad-481e-4ab7-aa36-f256148f54d8","resolution":{"observed_at":"2026-08-07T15:07:11.589518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.470653Z","title":"Visual instruction tuning,","venue":null,"work_id":"ef05ce4c-fa77-429f-a753-feffccb8c47e","year":2023},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.645485Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:de9a3a257abfe5e453d9f998fdafbbc6b6c5ce825e800be277d0cfdb4262c630","observation_id":"a2ca5ff3-e452-482c-a4cc-9c0d122a62cd","resolution":{"observed_at":"2026-08-07T15:07:11.508937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T15:07:09.737133Z","title":"Llava-cot: Let vision language models reason step-by-step,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.737133Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:52fa1f8776a8276bce9541d8652300da3ba8715e5013d61907f1623c7e0b6c05","observation_id":"fb820020-97f2-4de1-9232-86c7858f292d","resolution":{"observed_at":"2026-08-07T15:07:09.737133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T15:07:09.853775Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.853775Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:d66e604ea70e3cef6018cf057711266dad58195781a0c105e9ce6955b80dbb49","observation_id":"b22e3ad7-cc45-48fe-b3c1-c8e53935a9a1","resolution":{"observed_at":"2026-08-07T15:07:09.853775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.385387Z","title":"Flow matching for generative modeling,","venue":null,"work_id":"eab5f06e-11e0-41fb-b1b1-1aaa12842765","year":null},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.981897Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:cebfd33059c3ced3e1a5ca74758d1b3a5b293598b0290f2905860381000e7ad4","observation_id":"297f42d7-bd54-44b4-aed5-644aafba4cb8","resolution":{"observed_at":"2026-08-07T15:07:11.422727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:10.333160Z","title":"An audio-visual corpus for speech perception and automatic speech recognition,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.333160Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:42aae111ff7cd8139019a5e56e993dec60ff1a777c0f854eec328c54faeae5b4","observation_id":"e275e094-90a4-4712-9e20-fe0c7af3ff27","resolution":{"observed_at":"2026-08-07T15:07:10.333160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.293356Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"b37bed84-fff3-41d1-b951-ae216c0434c1","year":2020},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.067509Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:7285c07b903895a4c315b81db6d46c960472cb66f4ff1265d806218b643d8626","observation_id":"3d6cc985-0e82-459d-850e-bb737c7a2e05","resolution":{"observed_at":"2026-08-07T15:07:11.331277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.198408Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"f5bf48b9-82c8-4582-86fc-f69c7491a9a6","year":2021},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.120717Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:a38ae025edddcc0de3678f88279fecedb325a8d5c14034f202cfad5834fd40d1","observation_id":"0cdbc5a6-b3fb-4b09-aebe-f4d579bae2a7","resolution":{"observed_at":"2026-08-07T15:07:11.240478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.133650Z","title":"DiVE: Dit-based video generation with enhanced control,","venue":null,"work_id":"d24563b3-aa7b-4d85-b2b5-fc4507dbbb5e","year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.174456Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:410718f4c14f9c2c28fc2ada110ff09398b3a49b549d9a1f6ed2ec9f3af30580","observation_id":"710d353d-232f-42a6-875b-bfde1a713ea6","resolution":{"observed_at":"2026-08-07T15:07:11.170141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T15:07:10.212017Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.212017Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:70e57d5f520af47d310c54a2632ee4df70a627e6748354b690420b8dfb996f8f","observation_id":"f3fe19ef-6c80-4bbd-9835-209e6f266201","resolution":{"observed_at":"2026-08-07T15:07:10.212017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12890","last_updated":"2021-11-25T03:35:18Z","snapshot_observed_at":"2026-07-06T12:12:03.376276Z","submitted_at":"2021-11-25T03:35:18Z","title":"V2C: Visual Voice Cloning","version":1},"cited_work":{"arxiv_id":"2111.12890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.12890","snapshot_observed_at":"2026-08-07T15:07:10.745668Z","title":"V2C: Visual Voice Cloning","venue":"cs.CV","work_id":"24208f72-cca0-4597-8188-e78beb0672da","year":2021},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.279629Z"},"links":{"cited_paper":"/paper/2111.12890","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:5b8b67fd5ca272dc45017c063203ba671476d5435474d8e80ee5623d94148db5","observation_id":"5e30b8f5-a9a6-4481-8b01-4d2924fa4b96","resolution":{"observed_at":"2026-08-07T15:07:10.775143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T15:07:10.363576Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.363576Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:c27a76d8314b8874779455188acdc14d23fdacd751a49b804d77f65fd1e50ce7","observation_id":"092bb8b5-818c-403a-9762-39b6ad937b9a","resolution":{"observed_at":"2026-08-07T15:07:10.363576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10288","last_updated":"2020-04-22T23:08:58Z","snapshot_observed_at":"2026-08-04T06:02:53.556014Z","submitted_at":"2019-10-23T00:21:33Z","title":"Location-Relative Attention Mechanisms For Robust Long-Form Speech Synthesis","version":2},"cited_work":{"arxiv_id":"1910.10288","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.10288","snapshot_observed_at":"2026-08-07T15:07:10.573005Z","title":"Location-Relative Attention Mechanisms For Robust Long-Form Speech Synthesis","venue":"cs.CL","work_id":"cff052a0-06dd-4fb0-a0c9-9d43b514fb82","year":2019},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.404068Z"},"links":{"cited_paper":"/paper/1910.10288","citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:f45414b88b635279b0ebad7cbc1563c04a967fc07112b89c9d98f6583a2206ba","observation_id":"fd3fd5fe-5aa3-4ab2-b700-eb822cd43a8a","resolution":{"observed_at":"2026-08-07T15:07:10.612708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.067329Z","title":"Tem- poral modeling matters: A novel temporal emotional modeling approach for speech emotion recognition,","venue":null,"work_id":"9f7524c3-7c0b-47f4-932c-24d5a1d8ad5f","year":2023},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.445186Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:ed6fb53b4814e81f78394be9a6eb09672c66ff06c2827d9c73a68987dab28cd9","observation_id":"9edd3850-dac4-4e3a-a2ff-8b7a03a45d5b","resolution":{"observed_at":"2026-08-07T15:07:11.100841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:10.983192Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"39a1beeb-7c43-4d40-b3c6-c346ac2a009a","year":2016},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.491851Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:847cf646cb9cdf9cff7d79977212db3b6f5537489b828252968783f4ea5de2a1","observation_id":"0c2c5a5c-a7cc-448a-aa58-3a770be52bba","resolution":{"observed_at":"2026-08-07T15:07:11.031819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:10.028412Z","title":"Available: https://openreview.net/forum?id= PqvMRDCJT9t","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.028412Z"},"links":{"citing_paper":"/paper/2505.16279"},"observation_digest":"sha256:c0f7d9b06cae92379ede228835ccefbafbc93cddd227aaf2e3c1cc7752ce4e22","observation_id":"afeebc99-ff03-4cc8-8e88-c14dd6001225","resolution":{"observed_at":"2026-08-07T15:07:10.028412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16279","last_updated":"2025-05-22T06:23:05Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T15:02:09.826242Z","submitted_at":"2025-05-22T06:23:05Z","title":"MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2505.16279."}