{"as_of":"2026-08-17T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79af12d5bb6cd4f08d34ff780b5085516f0d970b9c0ffc58531a076e2a40f0bf","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:02:43.973872Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:02:31.374359Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T05:36:01.085675Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"cited_work":{"arxiv_id":"2505.05714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05714","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topicvd: A topic-based dataset of video-guided multimodal machine translation for documen- taries","venue":null,"work_id":"962a0dc1-e708-44f4-a4a8-a0f325e1f541","year":2025},"citing_paper":{"arxiv_id":"2604.06789","last_updated":"2026-04-08T07:57:05Z","snapshot_observed_at":"2026-08-17T12:41:51.325497Z","submitted_at":"2026-04-08T07:57:05Z","title":"Video-guided Machine Translation with Global Video Context","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:31.374359Z"},"links":{"cited_paper":"/paper/2505.05714","citing_paper":"/paper/2604.06789"},"observation_digest":"sha256:53472caa01389893ac485199437b0c89437defa68279b6824379f71ccc112996","observation_id":"a39f062e-2b1d-4cd1-a0db-63956455a44a","resolution":{"observed_at":"2026-05-11T05:36:01.089435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05714/citation-record","integrity":"/paper/2505.05714/integrity","json":"/paper/2505.05714/citation-record.json","paper":"/paper/2505.05714"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.616975Z","title":"Com- putational linguistics 16(2), 79–85 (1990)","venue":null,"work_id":"e951312f-757d-436b-bee2-3f370dc337db","year":1990},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.620759Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:048bbc994cd411c12b6d8793d548e9f8fa662311a56d8ae1c274153be43e7799","observation_id":"754ef313-4f65-467f-affa-b450de34288b","resolution":{"observed_at":"2026-08-15T23:02:45.623504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.588077Z","title":"Computational linguistics 19(2), 263–311 (1993)","venue":null,"work_id":"4b0a9329-f103-40f2-800c-4dbe6291e8c7","year":1993},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.636446Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:901435925ffcb54f13ed62da7dea4652f96d3f7b88ea4646c232965c00b2a458","observation_id":"da7d68f8-72af-4658-a5ce-42f7384ef080","resolution":{"observed_at":"2026-08-15T23:02:45.595056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08678","last_updated":"2019-06-02T11:56:10Z","snapshot_observed_at":"2026-08-15T15:37:21.580313Z","submitted_at":"2019-03-20T18:11:59Z","title":"Probing the Need for Visual Context in Multimodal Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08678","snapshot_observed_at":"2026-08-15T23:02:43.644979Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.644979Z"},"links":{"cited_paper":"/paper/1903.08678","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:1ab9b08df466ea6b77ebe807579b052b1f9971d6dcbe7811e8a3fddd71a6d66c","observation_id":"607f67cb-9144-4312-b59b-cd0712594396","resolution":{"observed_at":"2026-08-15T23:02:43.644979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.656312Z","title":"In: proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.656312Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:e2c9912cf06c5921906dacee54a04ca71538959504e201c8c22dae0e8fa956a9","observation_id":"65de26f9-65b3-48de-ac11-3626508a165e","resolution":{"observed_at":"2026-08-15T23:02:43.656312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07177","last_updated":"2017-10-19T15:20:14Z","snapshot_observed_at":"2026-08-15T02:49:40.676036Z","submitted_at":"2017-10-19T15:20:14Z","title":"Findings of the Second Shared Task on Multimodal Machine Translation and Multilingual Image Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07177","snapshot_observed_at":"2026-08-15T23:02:43.665742Z","title":"arXiv preprint arXiv:1710.07177 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.665742Z"},"links":{"cited_paper":"/paper/1710.07177","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:86cd013e53a0b564cb7362a66e7eb0797a80e200dc8d1df1129893b9bfe6111e","observation_id":"143d9c91-0e1e-48f4-ba24-6583cbb878ce","resolution":{"observed_at":"2026-08-15T23:02:43.665742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.00459","last_updated":"2016-05-02T12:38:03Z","snapshot_observed_at":"2026-08-14T21:59:13.124161Z","submitted_at":"2016-05-02T12:38:03Z","title":"Multi30K: Multilingual English-German Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.00459","snapshot_observed_at":"2026-08-15T23:02:43.675287Z","title":"arXiv preprint arXiv:1605.00459 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.675287Z"},"links":{"cited_paper":"/paper/1605.00459","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:075abc9e82268417efb3b90f78e0bb9441ddde88a897e31eda9a16f7fdb8473a","observation_id":"31c7b818-1c3f-4f8b-b169-183c60421731","resolution":{"observed_at":"2026-08-15T23:02:43.675287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04350","last_updated":"2017-07-07T09:18:55Z","snapshot_observed_at":"2026-08-14T21:01:15.572684Z","submitted_at":"2017-05-11T18:49:17Z","title":"Imagination improves Multimodal Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04350","snapshot_observed_at":"2026-08-15T23:02:43.687535Z","title":"arXiv preprint arXiv:1705.04350 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.687535Z"},"links":{"cited_paper":"/paper/1705.04350","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:857423aab6e11bcf0324aa30111cff6b8996ac0f16c31d5eb4ad411a5d47e224","observation_id":"37c7f534-8b34-4c9a-8e2a-029c9e2cce2a","resolution":{"observed_at":"2026-08-15T23:02:43.687535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.03916","last_updated":"2016-06-13T16:52:09Z","snapshot_observed_at":"2026-08-14T22:14:30.255260Z","submitted_at":"2016-01-15T13:42:04Z","title":"Multimodal Pivots for Image Caption Translation","version":3},"cited_work":{"arxiv_id":"1601.03916","doi":null,"metadata_source":"pith","pith_arxiv_id":"1601.03916","snapshot_observed_at":"2026-08-15T23:02:44.710545Z","title":"Multimodal Pivots for Image Caption Translation","venue":"cs.CL","work_id":"56d5d609-a7e4-433f-9401-d9c9a848ffff","year":2016},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.697404Z"},"links":{"cited_paper":"/paper/1601.03916","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:a9a14f8b4db9a8e2e87daaa9fb2502f015f344888cf0c630264f32d7a8dbe57e","observation_id":"fa3f8c8d-b072-4fb0-8d91-ebff79151495","resolution":{"observed_at":"2026-08-15T23:02:44.721741Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12038","last_updated":"2024-03-22T02:24:57Z","snapshot_observed_at":"2026-08-16T15:06:25.806572Z","submitted_at":"2023-08-23T09:55:41Z","title":"Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12038","snapshot_observed_at":"2026-08-15T23:02:43.706594Z","title":"arXiv preprint arXiv:2308.12038 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.706594Z"},"links":{"cited_paper":"/paper/2308.12038","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:19a72a974e7e54a375f15c8f916ab1e06cce8544e0ea7869fd61bae40ba72314","observation_id":"488d8d50-9ac0-495a-bdae-d78479469555","resolution":{"observed_at":"2026-08-15T23:02:43.706594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18326","last_updated":"2023-07-03T08:10:10Z","snapshot_observed_at":"2026-08-16T15:30:44.360286Z","submitted_at":"2023-05-23T08:53:36Z","title":"BigVideo: A Large-scale Video Subtitle Translation Dataset for Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18326","snapshot_observed_at":"2026-08-15T23:02:43.717676Z","title":"arXiv preprint arXiv:2305.18326 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.717676Z"},"links":{"cited_paper":"/paper/2305.18326","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:9f2a3087d58386c62a1f25085a29ed86e8d8f3c37dc7dbd65fe1621db7df1a05","observation_id":"fe9505f4-c571-4f49-8b37-b06ea81987ec","resolution":{"observed_at":"2026-08-15T23:02:43.717676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17415","last_updated":"2023-06-02T12:38:37Z","snapshot_observed_at":"2026-08-16T15:29:05.035665Z","submitted_at":"2023-05-27T08:41:18Z","title":"Exploring Better Text Image Translation with Multimodal Codebook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17415","snapshot_observed_at":"2026-08-15T23:02:43.727156Z","title":"arXiv preprint arXiv:2305.17415 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.727156Z"},"links":{"cited_paper":"/paper/2305.17415","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:62184b85cb27195441785f8c9ddc75db3a17a80c3c264cbe46bc67f5a140c67b","observation_id":"e48644a5-ce53-4de7-91ef-05beac93275f","resolution":{"observed_at":"2026-08-15T23:02:43.727156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09173","last_updated":"2022-03-17T08:51:09Z","snapshot_observed_at":"2026-08-16T17:13:51.714558Z","submitted_at":"2022-03-17T08:51:09Z","title":"On Vision Features in Multimodal Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09173","snapshot_observed_at":"2026-08-15T23:02:43.739216Z","title":"arXiv preprint arXiv:2203.09173 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.739216Z"},"links":{"cited_paper":"/paper/2203.09173","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:2a3148abaf2fc6ceb69cd27a6a5f2c2cabd103f1c7f533dff8c1e5d5edf6a1e9","observation_id":"f1516d71-fc51-44e6-8eee-ed956b2f2a89","resolution":{"observed_at":"2026-08-15T23:02:43.739216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03415","last_updated":"2021-09-08T03:32:48Z","snapshot_observed_at":"2026-08-16T17:58:11.541409Z","submitted_at":"2021-09-08T03:32:48Z","title":"Vision Matters When It Should: Sanity Checking Multimodal Machine Translation Models","version":1},"cited_work":{"arxiv_id":"2109.03415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.03415","snapshot_observed_at":"2026-08-15T23:02:44.463496Z","title":"Vision Matters When It Should: Sanity Checking Multimodal Machine Translation Models","venue":"cs.CL","work_id":"361b696d-90ae-4976-a85f-7ede688d83cf","year":2021},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.747525Z"},"links":{"cited_paper":"/paper/2109.03415","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:9996cf36ddeef80437841de322d444c5e68cacf894949630b4f94704762ed1ea","observation_id":"1dcbd495-2d88-4d73-a826-d71b6beef9b8","resolution":{"observed_at":"2026-08-15T23:02:44.477475Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20201","last_updated":"2023-10-31T05:51:56Z","snapshot_observed_at":"2026-08-16T14:47:21.730193Z","submitted_at":"2023-10-31T05:51:56Z","title":"Video-Helpful Multimodal Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20201","snapshot_observed_at":"2026-08-15T23:02:43.759420Z","title":"arXiv preprint arXiv:2310.20201 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.759420Z"},"links":{"cited_paper":"/paper/2310.20201","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:e9e83ace55b5016a443c3e3ea992cb00750ee1744a7b7061cb4102da30acaf27","observation_id":"ac8bd45e-0794-4372-9797-f411d2d0fd49","resolution":{"observed_at":"2026-08-15T23:02:43.759420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08054","last_updated":"2022-05-26T04:35:49Z","snapshot_observed_at":"2026-08-16T17:27:09.133797Z","submitted_at":"2022-01-20T08:38:31Z","title":"VISA: An Ambiguous Subtitles Dataset for Visual Scene-Aware Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08054","snapshot_observed_at":"2026-08-15T23:02:43.776121Z","title":"arXiv preprint arXiv:2201.08054 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.776121Z"},"links":{"cited_paper":"/paper/2201.08054","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:2d6bcf6fddc2b90c5d4295e8cd40b23b0e885246b0da8699f7ab9d40fb8741ef","observation_id":"b2f830f9-6bce-4bda-90f5-3cd07b19e9fb","resolution":{"observed_at":"2026-08-15T23:02:43.776121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.518740Z","title":"In: Proceed- ingsofthe28thACMinternationalconferenceonmultimedia.pp.1320–1329(2020)","venue":null,"work_id":"271ad3c4-4f5d-4f86-83d4-2284ee91b67f","year":2020},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.787965Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:4e164fbdf91e19da1ed3f1362d90a52212ea1c679976cb021912eab29bb0e6d9","observation_id":"218dcaf0-4238-4404-972a-7388cf85e90b","resolution":{"observed_at":"2026-08-15T23:02:45.534366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.795565Z","title":"In: Computer vision– ECCV 2014: 13th European conference, zurich, Switzerland, September 6-12, 2014, proceedings, part v 13","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.795565Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:6224be9932e202121784dd6b7b688d7b1442daebea26a146c0a227dc7e96b980","observation_id":"f9a2247e-411c-4249-bd4b-18b3ca3871f4","resolution":{"observed_at":"2026-08-15T23:02:43.795565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-14T14:17:05.281369Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-15T23:02:43.805122Z","title":"arXiv preprint arXiv:1908.03265 (2019) Title Suppressed Due to Excessive Length 15","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.805122Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:0bd2cb5a349d2a76feb9fa6f2e23f381b4b558e28b02dce8396ae79b18bc84c6","observation_id":"b219a8ae-9827-4f9a-adb3-fbfa6549f7a3","resolution":{"observed_at":"2026-08-15T23:02:43.805122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.818156Z","title":"In: Proceedings of the 40th annual meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.818156Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:cd6eb34e637d2814049e6b9d18d26c0f1ec8df5e707c61158259c101b1e523ef","observation_id":"5d7eb4aa-37ad-40ff-8d0d-f7116b80964e","resolution":{"observed_at":"2026-08-15T23:02:43.818156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.824479Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.824479Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:0730e8965375dfeb4d5b42771d1eeb5e927e68c3a1f7484d408fcaae93e3804e","observation_id":"68edbca9-4b8f-497a-90eb-87ae48f6fd9b","resolution":{"observed_at":"2026-08-15T23:02:43.824479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-14T18:05:47.659963Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-08-15T23:02:43.830889Z","title":"arXiv preprint arXiv:1811.00347 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.830889Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:72a7688dcfff5fa6b95005e33489b41235e89046d9e052dc59cce1ae29239e2e","observation_id":"98a9a690-5b7d-4297-81a4-1a7b43299519","resolution":{"observed_at":"2026-08-15T23:02:43.830889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.836788Z","title":"Advances in neural information processing systems 33, 16857–16867 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.836788Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:5613cba75ca0e6daa3e6fe25041461d34ad103636c3ff3b92b399c63bfb88a44","observation_id":"632c9712-2f59-48a6-b931-45038deecd98","resolution":{"observed_at":"2026-08-15T23:02:43.836788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.284388Z","title":"Information Sciences 554, 47–60 (2021)","venue":null,"work_id":"f37bcb62-5536-489a-abc8-546ee2e812cc","year":2021},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.846069Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:b8a9032bfd29146c784afe6432644b7f21b41590429f0ce3bae2625ae7470d7f","observation_id":"11be5605-ea23-497c-a68f-c79e2e963d8e","resolution":{"observed_at":"2026-08-15T23:02:45.291861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00767","last_updated":"2022-09-03T09:22:51Z","snapshot_observed_at":"2026-08-16T16:43:19.168542Z","submitted_at":"2022-07-26T08:42:06Z","title":"Multimodal Neural Machine Translation with Search Engine Based Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.00767","snapshot_observed_at":"2026-08-15T23:02:43.855495Z","title":"arXiv preprint arXiv:2208.00767 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.855495Z"},"links":{"cited_paper":"/paper/2208.00767","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:6ddc38dfd760e26c3259624732c4a1833fd460911e8429aa7e0e1406b0e20921","observation_id":"7176c716-8193-4edc-9649-b04a7b2f8e17","resolution":{"observed_at":"2026-08-15T23:02:43.855495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.237413Z","title":"In: Proceedings of the 3rd Workshop on Advances in Language and Vision Research (ALVR)","venue":null,"work_id":"ac02012b-9f7f-464b-88c6-1ec5cbee3496","year":2024},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.874353Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:4c1520d1863ed8ef567dee918fef424dfeb233a09d3f124fe5bb289cf8401a61","observation_id":"34292f98-fc31-4481-ae13-c5864ac2a5c0","resolution":{"observed_at":"2026-08-15T23:02:45.254023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.887532Z","title":"Advances in neural information pro- cessing systems 30 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.887532Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:dc6891f0016b06a5e2d9225ecd646ae0e72a261d4f4eb49d773341fb9cfc5b33","observation_id":"d90a583e-6023-4083-b914-d35e9a4fc042","resolution":{"observed_at":"2026-08-15T23:02:43.887532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.154026Z","title":"Journal of Forensic Sciences69(2), 515–528 (2024)","venue":null,"work_id":"ca3aed6d-6e04-409b-8f29-58b35a10a583","year":2024},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.896642Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:03f3a270324c0ad7a9780abe953b80343ee94e400e94d75c0714be662c0e9d9a","observation_id":"34796a6c-1aa2-4641-8022-b4d226843f94","resolution":{"observed_at":"2026-08-15T23:02:45.164302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.903938Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.903938Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:94a01aa70768d826d10d07e622023eb203b09483aa9ae5454ad597697ed89064","observation_id":"16cfa06e-7c5a-4ef5-a47c-299d95d1ef8d","resolution":{"observed_at":"2026-08-15T23:02:43.903938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:43.915602Z","title":"IEEE transactions on image processing 13(4), 600–612 (2004)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.915602Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:6210439074a2fbc6d1b9b53970ec141342de6c7c8d6ab5a6261d02cd3d299073","observation_id":"2b5308f9-e562-418b-8350-87aca98f19c8","resolution":{"observed_at":"2026-08-15T23:02:43.915602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14462","last_updated":"2021-05-30T08:27:16Z","snapshot_observed_at":"2026-08-16T18:21:09.377991Z","submitted_at":"2021-05-30T08:27:16Z","title":"Good for Misconceived Reasons: An Empirical Revisiting on the Need for Visual Context in Multimodal Machine Translation","version":1},"cited_work":{"arxiv_id":"2105.14462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14462","snapshot_observed_at":"2026-08-15T23:02:44.178661Z","title":"Good for Misconceived Reasons: An Empirical Revisiting on the Need for Visual Context in Multimodal Machine Translation","venue":"cs.CL","work_id":"16a37fc4-cef5-413d-a974-7fc75d58cfa7","year":2021},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.925346Z"},"links":{"cited_paper":"/paper/2105.14462","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:d3663233707e50f928f18f95673a98e0ef4aaeb95ccc3830637c908f0cee16a3","observation_id":"2aaec268-3076-49f7-9a10-033644562dc3","resolution":{"observed_at":"2026-08-15T23:02:44.191174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.053963Z","title":"Journal of Information Processing30, 388–396 (2022)","venue":null,"work_id":"7e2f4148-0a5b-4ca5-bd20-69e88d482603","year":2022},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.933026Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:cfc3cf369055cfacb5828b028e534e222661bb12b733393ce04821b54c3c6a67","observation_id":"c9f07399-0dd1-43d3-89ff-d4e9747699e7","resolution":{"observed_at":"2026-08-15T23:02:45.067433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:02:45.011771Z","title":"In: Proceedings of the 58th annual meeting of the association for computational linguistics","venue":null,"work_id":"66761c00-8e42-42d4-929c-e32d5ea0e1cd","year":2020},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.951813Z"},"links":{"citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:046c21f5ca800a91ffff85d06ab3c1d2cf52137696d909e6ac15636399bef269","observation_id":"0b451aad-93e4-450e-a901-cc503c7b5c43","resolution":{"observed_at":"2026-08-15T23:02:45.022272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08742","last_updated":"2020-07-17T04:06:09Z","snapshot_observed_at":"2026-08-17T16:13:06.459021Z","submitted_at":"2020-07-17T04:06:09Z","title":"A Novel Graph-based Multi-modal Fusion Encoder for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08742","snapshot_observed_at":"2026-08-15T23:02:43.963024Z","title":"arXiv preprint arXiv:2007.08742 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.963024Z"},"links":{"cited_paper":"/paper/2007.08742","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:5cefc21feef5c936122b25ef942799d30e0409df67b9e5f35fb1f4569ea38f5a","observation_id":"281336bf-bec2-491c-bd9d-100e4acbbccd","resolution":{"observed_at":"2026-08-15T23:02:43.963024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10313","last_updated":"2023-09-03T03:46:05Z","snapshot_observed_at":"2026-08-16T16:07:17.825628Z","submitted_at":"2022-12-20T15:02:38Z","title":"Beyond Triplet: Leveraging the Most Data for Multimodal Machine Translation","version":2},"cited_work":{"arxiv_id":"2212.10313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10313","snapshot_observed_at":"2026-08-15T23:02:44.057721Z","title":"Beyond Triplet: Leveraging the Most Data for Multimodal Machine Translation","venue":"cs.CL","work_id":"3115316c-232c-41b8-947d-186b6a84f61b","year":2022},"citing_paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:43.973872Z"},"links":{"cited_paper":"/paper/2212.10313","citing_paper":"/paper/2505.05714"},"observation_digest":"sha256:1f3394c24fec962df28c2ee18c233f1ab7773b7901c7cf6b2d7365a6f2d441b4","observation_id":"4748accd-5a75-459a-8683-2b9e07d9b595","resolution":{"observed_at":"2026-08-15T23:02:44.074685Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.05714","last_updated":"2025-05-09T01:31:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T22:56:37.252914Z","submitted_at":"2025-05-09T01:31:02Z","title":"TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2505.05714."}