{"as_of":"2026-08-21T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d44aee10885e4820bcca0f5663c27f3a0b823e77cfdcbdab5005523c635a66e","coverage":[{"denominator":176,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T22:04:31.302192Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.11283/citation-record","integrity":"/paper/2604.11283/integrity","json":"/paper/2604.11283/citation-record.json","paper":"/paper/2604.11283"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Deep neural networks for acoustic modeling in speech recognition: The shared views of four research groups,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:72b2a5c9e845b17da06fba71ce98509c32b9edfe0aae90a1035fb975fcde3984","observation_id":"10768c91-4c8f-48fa-a272-7d1ab7561600","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4b1ae878ba6f86ea7a0b1d24c3ff1747d6577ac922273ab1cc98b210df38db42","observation_id":"160cea28-2304-4f49-b1da-d2adfc3268ab","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4921e5013a3b51d4436ac49500a2b78b5b0ca3dac549dbb80c5654ca3f74050b","observation_id":"9fc18f9d-2a66-4c58-8660-89aecf196f2d","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0392ec5db9aca96d7547da4d315bdc0c3b984fe2ec15d184ef8e5ed7a1dd9fc7","observation_id":"3dcdd481-d9f2-4978-bef9-da71125d0718","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Direct speech-to-speech translation with a sequence-to- sequence model,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4ab181fdcdb31b8c4725666565edbcb97982679747f1f415dfb1eedb2dea80de","observation_id":"e5303075-5d96-42b2-98ae-d02318d4c7a1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ff4be951814d18e867386095ab814334e5b0586557dd34d54c5e3105ee133d15","observation_id":"55e557c7-a83c-461d-982a-04df1c1f32ee","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3f59d26e60c7f66173f81a556c82cff16cbf7af1ae8f3eccd966435381d2bfae","observation_id":"d9a5b663-85ae-46c3-9c1d-b639bcbaf8a1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:82e6589260600a044f8239e9c8a8bf719d4813d4e44657c2747021952398b267","observation_id":"f8270dea-65ae-4719-bcf5-da0ce077fb42","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:d5f8ab3b2b11ab0b4f2fffa2421418a62615b8601faa725f9dcd16183b22fab2","observation_id":"a10440fb-602f-488a-8a5f-a99d21359d6f","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:6c05059e23cab9441d19792f466d722c0fb44eeb2063839b560f74a89a9e251c","observation_id":"f4dd3ce0-a03e-43fc-92bc-5c1ff2c46ad4","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:adf7f4d7aaff4e83e4175ed0b1d391dd40d4c5eb68596d5d6925b5bc79c2bf79","observation_id":"c52d8c46-8963-4dcc-a36d-3f38695b628a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b36cfe62eeace239c0712141063d0a54b78f9e3df114cbf4cb509beafc7007bf","observation_id":"90cb84c3-4bd3-4607-a61a-152f361024b2","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Llama-vid: An image is worth 2 tokens in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2e36da7c1f82e86531c794ee6eb789f1ef076f3773050252b75c02086313d5bc","observation_id":"64c1ce9a-3c23-4695-9a24-c3e21dd9b449","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ee40934c7aed96255923d5e50f7a8519b07175a91dbd37b555e73e17ddb192e9","observation_id":"c54f1da5-4857-4b49-a020-fc06cc90dc37","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:89029b4076bd06608ff90211701fbb166ca3e6b5e9a7cdce3bf7301d7e06812f","observation_id":"a4899045-5f27-4698-9c8e-33b41a8884b0","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:62c4aab3f51ebfcdb8f9361532708791a6e1b2b0af67b5aa7973cf9dd55d2ae5","observation_id":"ea2a24ff-9863-478d-81c4-6342b93c7be4","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"A survey on video diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:a2404019ae281c082bf49aefb050926d0e4cd0ae9ae6f2bd11d9213648aa4844","observation_id":"275fcc5a-7699-43c7-962b-7237ba203c8c","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Omnisync: Towards universal lip synchronization via diffusion transformers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0071fa3701cf2de7df36bbb81dd59b149438b4b8c69d0298883722da864831c6","observation_id":"dfc92ba4-c667-4b87-a752-7c922f749208","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12669","last_updated":"2024-05-23T03:56:56Z","snapshot_observed_at":"2026-08-16T13:51:01.596518Z","submitted_at":"2024-05-21T10:34:47Z","title":"A Survey on Multi-modal Machine Translation: Tasks, Methods and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12669","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"A survey on multi-modal machine translation: Tasks, methods and challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2405.12669","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:40c9200c3031ec646783bf29a99773faa61852d9d6a4b6a8959c9f66ebfbf711","observation_id":"e706ad03-e91b-4dd9-85ae-4b5d210013d1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Video-guided machine translation: A survey of models, datasets, and challenges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2de9855d29c632bf876d0d5989d41fe81f9b8937a4f232c248f644e39cdc2cae","observation_id":"66d72910-9195-4787-bb78-39e8c1b4dd81","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:e776b39d9abf250378bd90e7b6428e3a1c86693c899407d7d51019b1662ca421","observation_id":"f8f38568-bab9-4527-9df5-4febdffb687f","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Video understanding with large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b984fc46511550e6d3a59259f5ac8fa470917c01d05ab8e50e79fea9014dab14","observation_id":"db826b02-7e8f-420c-a01c-f7a3abafbed3","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"A survey on video temporal grounding with multimodal large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:d6713a6489632bc3303c337ef1eda24f95c19375192dc9eb57419648259a9a26","observation_id":"26eccb96-1dd0-44e9-b82f-316a3a735192","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Direct speech-to-speech neural machine translation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2dcf8322cb66eb5b683ebee9fef44a4fe267586d05975a8ce85969ae9b7da234","observation_id":"cc0aed22-173e-4283-a805-bdd0a25edd93","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Towards controllable speech synthesis in the era of large language models: A systematic survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b2540f4c3253b26579f99209c6c3d948a70a4c27907153629e6f97944d405839","observation_id":"ce5f19c4-0f83-4a90-87fa-0e9f9e34ac11","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Advancing talking head generation: A comprehensive survey of multi-modal methodologies, datasets, evaluation metrics, and loss functions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b56e4d67f9bee46f47d78cf4d2b884021999cee64d6d6c25ae9f6929edff69d1","observation_id":"5fa792ce-96a7-448d-ad97-39496589d1bd","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Rabiner and B.-H","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:6c139ea6c75a147ae012c551329ca2ff96e8fcb534066d89ef7bc3785bbec518","observation_id":"fa4cfb08-33cb-4d22-bc6b-a9b6e4760899","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Connection- ist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:dc53a8081aff31d5f5631b55eb7c05440fb05c5213f74db7796d3c62091cb83a","observation_id":"63e0517a-cf0a-4063-b2f1-c93093946845","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-08-14T23:07:07.038301Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Deep speech: Scaling up end-to-end speech recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:c7f86151ef4fe4eccea8a2219da2c02afe00ec7dcb04ea07a610ee64d65e6a25","observation_id":"80b95312-4df9-4ba7-af79-1b6243102680","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Listen, attend and spell,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3a6fd25bd9327f13886a4507255d634c8f0d1e3d95ce4456d1e16a7104aaf10e","observation_id":"fe51874d-d962-4993-9687-15d22b3cea4a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"The mathematics of statistical machine translation: Parameter estimation,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:052b4a66dd626838ccba555d73c5ffbaf2ad44ca3573b2733e9c4b61fe48d1db","observation_id":"82758b61-a320-4cef-9ec0-d8e837e138c9","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Statistical phrase-based transla- tion,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:76e1c64aa3e0bb6e1993701eb87f268df1b8819f6878edff21fbb8fd9e174b6a","observation_id":"ad93a695-7de4-415e-b647-666d5f3d0846","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Sequence to sequence learning with neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:61a6cdc42dc88d1bd1d3bce52eb0ad2da00a24f53871783c314f1350bc5ff8ed","observation_id":"9cfd52df-9c8c-4911-b3e0-31fadbe1e67f","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Speech parameter generation algorithms for hmm-based speech syn- thesis,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0456534aa3bfb110f9a1c56bc2f00ef65469d0bef7eb3b09c1d56ef67670c9f9","observation_id":"a8c4693f-be0c-4201-87c0-7809eeb7524e","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Statistical parametric speech synthesis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:38e44a9547a691d7e5fe8f38d5cf14cb7ddd2bcb63046056c996728fd97d0955","observation_id":"8b1a67ab-e196-4150-a9e6-3b888ee3815b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:fc4fcab810b37b72014fb1dddc65b31c6bb4741190c7f6a79553520da18f3729","observation_id":"d11733ce-2223-4cbb-9f7d-d36caa5c0f0b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Photo-realistic talking-heads from image samples,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:a33e9d2a8f29da6ac990aea7611cf2d73aebb78aa9c145d59d856951e2471c3c","observation_id":"d2be9e07-127d-46ac-a2b5-6052be1cb955","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Lip reading sentences in the wild,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2684b0df9e1b47f7126149dc18a968e3abb6e6b60c5fc88db8f7bd32145142e9","observation_id":"9379d2f9-a24f-47dd-af73-53137e5254d2","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Few-shot adversarial learning of realistic neural talking head models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:56a5aa591cc18b6c2938450e02632274aece92ba93152814d5dfc152b8ac64fd","observation_id":"b3f0000a-9e5b-480a-8ecc-bb5ad6a9b90a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Onellm: One framework to align all modalities with language,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:7f1b53c13cc20210c511fa962d5667b012b57f9fcdb145ded676ee64a834f843","observation_id":"5ce64f5f-d3fa-49fc-92df-656f8c3a125e","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:e890f390547ae56621e50f3f6cfe0abc6c218ad7c5f93ba70e5edc7a912f46ea","observation_id":"7d73ef55-7391-4aea-bce7-041f6685bbf2","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:171c7cedde07cf9136aecf46c41dc05f50d93d03f444078424da9aa9a08b825b","observation_id":"daf14975-2cad-485a-93ad-6bf2230210c0","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Videobert: A joint model for video and language representation learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:562a7caebee83b958d50d6543d5ee2f59ba36d207b787d3cfefd84150257cad6","observation_id":"a8ff4e49-2cc0-47ea-9c56-24f88d298d42","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Actbert: Learning global-local video-text repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:d9490e101d3d961cf297a02f356d2ea36aecf80709ede2c1f217def30d3e158f","observation_id":"b35132a1-d16d-4fe1-91de-d9e115b87974","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:d17b5851842b189c9a5fa6e85673d4e07ef589413a89a924509b2e99c8d7abd3","observation_id":"c09d45f8-535c-453f-b463-64b97345b01b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:570bbf0b2e2b3e71e9e9fd4a7ed60ca0ecfb6cefe6002b82823d306ca94d9f43","observation_id":"483d256a-4ef9-4304-af45-e3e508f8d609","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Violet: End-to-end video-language transformers with masked visual- token modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:1f302fdc8ebeb43fe84aca3c2e62aa16f935ae1bbc486930eb30f53c5a80578e","observation_id":"2dfdf966-6e4c-43ee-aaf5-0669857d0008","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Omnivl: One foundation model for image- language and video-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:171484c720913c2e798d443d3c2cd14c68feac4a92491ecb770742f9c100c60e","observation_id":"fa371314-5ff1-4d14-aaf2-f7878025e093","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b0814c2616ddd9ff96302e614a7c3e04bf84837cf7c2faff28f7aa1d7680dddf","observation_id":"80c999f0-f809-4892-80c9-05670df423ee","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Unival: Unified model for image, video, audio and language tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3ee908d6a29442d56c1982b6f519fa1bb3871de77d5f02b0e7fb981ac9aaaa39","observation_id":"4507d018-e051-4a22-b52d-49fbc6b6d26b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:84d93fadad943f770122319e79645f44387f8d2117ebad6f4dc16c7e2083411c","observation_id":"6004dae6-7026-4b8e-bafc-53a5143f010a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Pali-x: On scaling up a multilingual vision and language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:49580eb1cc021684a4ce2b4cf86b1dc747d10e0ca206a3de6f03c0736274cace","observation_id":"2fa3e50f-30de-4fa4-980a-fbbf94b42c88","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Qwen-vl: A versatile vision-language model for understand- ing, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0ef15f3c24167870f1d7ffd37a78a459fefcd1cd67ac0d74eeac771a44562095","observation_id":"33b91d41-a5c1-4b18-9ac9-70901ebbfe73","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ba627aafae884008d5195679cc1c31cd51e701df1e9b55039d34b9240c5993bc","observation_id":"5b60ed54-80be-45aa-82d0-3f1d280504ee","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:50fc0f3818c8b1a19df5c9ae084d69b8231b1fe3000708ba5d1eefb4d9c89ec2","observation_id":"50f1f047-b84d-4a46-95c5-dbe1724e49d1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:e2eacea39478471fb5bf47251b31f3668641a2bfacf4fc57d0ce8b8c3bfbea65","observation_id":"6d2e3842-bbb3-4e92-84ad-800e932d1c89","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:922bb5ff5e6d06afebdd7fa3abae676857751cacba019feb5c5f7c638e5c8a80","observation_id":"5d22707e-a9a9-45ad-be56-2c7f62545229","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Groundinggpt: Language enhanced multi-modal grounding model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0fa08446a0277ed4eae5a6b22c171e7dc7bd9e06c74c327f1a13108a7a275d35","observation_id":"be48bc47-fefc-4306-8f73-aa1e24715988","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Moviechat: From dense token to sparse memory for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:cd0bd1a1030bfc437357d967bbd6fd6b9ee278414ac5feec2c523d165c82fce8","observation_id":"a5ca39dc-8743-4b51-afb6-6072a4cf7452","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01422","last_updated":"2025-08-11T12:47:49Z","snapshot_observed_at":"2026-08-16T14:13:23.468189Z","submitted_at":"2024-03-03T07:43:39Z","title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01422","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Moviellm: Enhancing long video understanding with ai-generated movies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2403.01422","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:8a21c88b75fc6328d672e35edce0ba861b3fa3ff9f75316aa3d6063e632a9c35","observation_id":"5dde9bc3-9171-4c61-bc3a-f7ffe8c86a11","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Longvlm: Efficient long video understanding via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3b0337e79d248df00628cc19d4187da22dd8b07f54c49f1fefbd69cafb222c4c","observation_id":"54af9688-e32a-4b0d-83c8-0854bf176e86","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:8f36440de8567d0a78a7e6abfc161565faf048a90a06c0104d95167e49a68830","observation_id":"98f16a7d-ef0c-4731-9d87-6bfb2f9429cf","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Vtimellm: Empower llm to grasp video moments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:45de3564f39472e319c523601206f7e2e8333e50e79d85828e39dbc0e5492407","observation_id":"7b7076a6-220a-4457-b723-32c353d2f7c0","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-16T14:17:41.002456Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b22ec35b478f44ab46f2e35aee4c5b30835f9bd6b2a583e6668b87790fec8cc7","observation_id":"b14dd2fa-b7d8-4e7a-afc2-dc5e2c459a8d","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Videollm-online: Online video large language model for streaming video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:aea6e8692ef08bfa571c791cb923858d240b97930e7c0cb449062b514f7186cd","observation_id":"43c77e3f-1d5a-4a5a-b119-3c912e7a53c2","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Lita: Language instructed temporal-localization assistant,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:cc6da5e7aa1e7376e3702701d96210f90c7b84f002d1a3109bce39d244fdd0ef","observation_id":"1b1bcd79-5687-4d88-a1fc-899c71622054","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:bf429c11fdfc81a0f308bfde11e03676fd21a0f9a1d4a9804e06fb75b724bfef","observation_id":"5398d75c-2f60-4d21-8592-3986f2665dbd","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3616858b9abe29b895fc1fe5ce7750b4eaaa80d1b59ad576feabbe9a6e46dc66","observation_id":"2ffa213a-6bef-424f-935e-45aa0041ff81","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-14T02:35:09.273544Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Time-r1: Post-training large vision language model for temporal video grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:da65c1ddef3f72216f08b247a2559367318923ede50acc16c434f369a394c8c9","observation_id":"5e8ebaf9-3410-4ae5-bd62-0a945189ece1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-16T15:06:35.991757Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Seam- lessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:f84be8f8544e953cd5601b74de68d472638a90e09b9ae96cf2fbef02e489b370","observation_id":"be03c237-266f-43f1-9f75-ee4376385482","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Av2av: Direct audio- visual speech to audio-visual speech translation with unified audio- visual speech representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:909253f05dcd82feb42e2eaa69dd6a66f3005ac83f8117188b329f07e9607375","observation_id":"37ef2916-36f7-4037-9372-f0039b9b1239","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Adaptive inner speech-text alignment for llm-based speech trans- lation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:949a7305132936674b310629de38e2caecd9f9f0dd856e87124cae71c98cd17a","observation_id":"9d4d6e7a-9647-421a-9d92-bd5f93a675bf","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Inimagetrans: Multimodal llm-based text image machine translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:6aa83b4f62dab57b5cc40bbdb5799f0a447668430bed3a449667b011622030b0","observation_id":"a8f12530-b7c1-41d5-92f2-7e5223a631f3","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:700537c6a24b9fac9d48c40c8f4750975d872816b68a813eb568f2cc7211df03","observation_id":"60853e80-729e-4c6a-8be1-e44a06e385f5","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Bt-adapter: Video conversation is feasible without video instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:884c7338af571ccdeae7f1a5294913be374f2a16216e12ef31b1731ae94cf7f4","observation_id":"2f6a9045-e26e-4717-b525-43abcce74042","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Otter: A multi-modal model with in-context instruction tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:cb6ff031559cfe247ce64f37e7b5ac8cfe2c7cdb232f8c763bf86a167b8eefa9","observation_id":"aa46b280-4fb8-47fe-b285-5ffe9559d136","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:9b123084f63f775b874f46575e155a669e61b408b52b978347a155f5a3cbeabb","observation_id":"5f3ad4f5-f0cb-481c-a1e4-4ea5f04d58bc","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11865","last_updated":"2025-05-16T06:50:09Z","snapshot_observed_at":"2026-08-17T03:03:23.284563Z","submitted_at":"2024-04-18T02:43:37Z","title":"From Image to Video, what do we need in multimodal LLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11865","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"From image to video, what do we need in multimodal llms?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2404.11865","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:35c38f651fd51354eade3e8fb1f8838e553c554c502e7eb6181fb9d07b6bc06b","observation_id":"7dd0a2ad-7068-4bb3-a3dc-a6079849cc68","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Reef: Relevance-aware and efficient llm adapter for video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:741c9621317ea6a98410cfc1ec68bbf3f9bf9e299e08806c611432c0490cd991","observation_id":"82dee9e6-900f-4f14-84ba-277bccc87674","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Vlog: Video-language models by generative retrieval of narration vocabulary,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:207a932f82fd189e00bd13763db0fe69454c7cac6769e1c495ac2bbab1e79370","observation_id":"d0072e5b-df64-4ba2-be21-c4407ea5164a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:45d122804922afe1bd8073ace1dad1cc4ab99d2dbde0ecbc43844df07e95f9c4","observation_id":"a4d8b360-d86c-4a6e-b5a3-ad3d28189a0b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Cosyvoice: A scalable multilingual voice generation model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:07141449624abc6bc9c700d38c2e42e1e0355f5318e046ff7d02093c1dda6126","observation_id":"66f06165-fdfa-496c-8376-a8fe887675b3","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Fish-speech: Leveraging large language models for advanced multi- lingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:cc359a971434381a8c03ff00d2ae182dd1309a3c136409b59c2d95239bbbe294","observation_id":"f348cb99-400d-4a35-b18c-dc165d39c950","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04380","last_updated":"2024-10-06T07:20:58Z","snapshot_observed_at":"2026-08-16T13:12:13.892396Z","submitted_at":"2024-10-06T07:20:58Z","title":"HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04380","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Hall-e: Hierarchical neural codec language model for minute-long zero-shot text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2410.04380","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:997d6c1bb4e6bf4ce8e70bb64eaf8b2aea962f5e3388013aa65296a583a92c74","observation_id":"148aecbb-bd2a-4eb1-b797-1cb8b87f8337","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"V oxinstruct: Expressive human instruction-to-speech generation with unified multilingual codec language modelling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:e484461ee970e631cf3f3eb476d1e5f7d96af246882b5d28067f6461fb1a8bd2","observation_id":"aa24220d-3b3d-4b45-8d3f-e9dc9e36fabd","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-20T01:09:59.849605Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:43c0002a72c7bbf1c729a82fed1a062d6918a04f951f92786ab3b3097475e271","observation_id":"5bb3292c-5288-40fd-be9f-aa3f4257990a","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Mega-tts 2: Boosting prompting mechanisms for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:91b6480162b0a40302f7affdd50b7cb26f0df2c56a467449dee899b2b383c53b","observation_id":"03fc689e-c71d-42b2-a81e-7ef85ef8b1af","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-16T12:55:06.202467Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Megatts 3: Sparse alignment en- hanced latent diffusion transformer for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:a8de90af97b98686ea6835317d809534ace920419e2b3e24a2e5b711dc87957a","observation_id":"a4c39120-64ca-43b2-befd-ce6d88be8442","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:b6b83fb39283dea3793b10135e54890c85bcbde53a9c17d1e25d040b97119f41","observation_id":"a6a1f961-7ef8-4cc2-ac74-94e3e8085089","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-18T18:30:27.003087Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Prompttts 2: Describing and generating voices with text prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:61090b2cb0bc9c8db0c6029656a75b946bd631349980327f3b9822f546bde7d6","observation_id":"a850a614-1c5e-462a-93bb-3ff0952954d1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13662","last_updated":"2023-06-25T11:42:52Z","snapshot_observed_at":"2026-08-17T18:42:13.982509Z","submitted_at":"2023-01-31T14:26:52Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13662","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Instructtts: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2301.13662","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4ced102178cf4b4220d4a753069a87abedf80f4c3c1c1f7e1840fa4d3a8ff809","observation_id":"d7dca130-2869-4c72-9d71-5b43ab92708f","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Styletts 2: Towards human-level text-to-speech through style diffu- sion and adversarial training with large speech language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:53852fd995a0fdc0de88c73faa0a13a22dc5996f6796b3b68f1c835ab83152ef","observation_id":"06085be6-89e8-469c-8f4a-485aece58c1b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Controlspeech: Towards simultaneous and independent zero- shot speaker cloning and zero-shot language style control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:15133803581086bdbcf69c63c81a0cc632efdffc6063cc212ec7a8df6c02a7b6","observation_id":"008ddd17-1a0e-4145-bed2-d3466210c9d4","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10550","last_updated":"2023-07-20T03:28:06Z","snapshot_observed_at":"2026-08-16T15:14:49.782401Z","submitted_at":"2023-07-20T03:28:06Z","title":"SC VALL-E: Style-Controllable Zero-Shot Text to Speech Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10550","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Sc vall-e: Style-controllable zero- shot text to speech synthesizer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2307.10550","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4ba26c87928bb20d4a3d91ff1709cc94d879dd940f7c1fe54a68ab151c73016b","observation_id":"de70324d-a926-4f93-ab8b-cc9bd948aa7b","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-19T20:00:01.315853Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:9821b15f0725a3ada9c12ae46031a32df8b2c0e3c90579fa584eb48015c659b6","observation_id":"1674fc9b-f029-4588-b108-cfe923adc7ce","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"V oicebox: Text- guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:22a9aad915eeb1a3cfbe7bd326755bf5247ad52a566231649f5338b1a7c26001","observation_id":"c3e6503c-fabf-4965-ab72-5abcbb1424b8","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-16T15:39:31.485174Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:749f6cbb13b7b7264277ab89177fc1048ab0b5b829a2fb027a8dc1963328a895","observation_id":"46c4a353-49c8-4094-9e8c-fc49dce02c09","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-18T17:50:58.009731Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:f91cd245795cb26f4bc7ca499dd6b01d21efc9b0af581d0df5e35b5ad3a07a1f","observation_id":"20d62fa4-d936-4e00-9ab3-b8291178187d","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-08-19T00:29:49.236242Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Ditto-tts: Diffusion transformers for scalable text-to-speech without domain- specific factors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:f398986af0e4c9b7c1bd657699f41abfd98c9e627999a88384346a1991507ee5","observation_id":"0e3aaad8-48ce-4b1e-a5c5-1a1eb2beeeec","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:794bb008fa7b0ce36a99a9de3461b6cca6f78c1c93f551d16ea5332954cdd72b","observation_id":"fae34acb-80fa-4cd5-a6f1-5152c13aca10","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":176},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 176 outbound references and 0 inbound Pith citation observations for arXiv:2604.11283."}