{"as_of":"2026-08-13T11:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d44a52c077fbd394e4c7b52f7dad1f7e73d07f97ece7ea26794e7b730f6c0fcb","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T12:53:22.119074Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08112/citation-record","integrity":"/paper/2607.08112/integrity","json":"/paper/2607.08112/citation-record.json","paper":"/paper/2607.08112"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1611.01599","last_updated":"2016-12-16T16:09:34Z","snapshot_observed_at":"2026-07-06T05:17:29.499249Z","submitted_at":"2016-11-05T04:05:18Z","title":"LipNet: End-to-End Sentence-level Lipreading","version":2},"cited_work":{"arxiv_id":"1611.01599","doi":"10.48550/arxiv.1611.01599","metadata_source":"pith","pith_arxiv_id":"1611.01599","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"LipNet: End-to-End Sentence-level Lipreading","venue":"cs.LG","work_id":"766d4c49-af39-4762-b877-122d230a43fe","year":2016},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"cited_paper":"/paper/1611.01599","citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:4e6a52307e6ef49137d3f8e6ea571484b8ad05898515aa5cd777aef647083c52","observation_id":"77885fbd-0945-44e7-86bc-be2bcc157ec9","resolution":{"observed_at":"2026-07-10T12:57:07.609021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.797639Z","title":"Lip reading in the wild","venue":null,"work_id":"fc1e5c0d-1c67-499e-a050-2cfad4fa7390","year":2016},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:6c0369cbd21c75d381a5d9e7c265a4c3bd5e37c0ac098ec3a35dbfa1ce538264","observation_id":"b74b966e-d759-4cf7-ad9e-5132fcc1e64d","resolution":{"observed_at":"2026-07-10T12:57:07.798938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.765695Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"10d830cd-ce25-4c56-a265-0b0d404a6764","year":2017},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:c62f7fe010cb81b0dee5e2efd72409d273f4b874a414e095287738cab0ee7e41","observation_id":"529f548e-fc6d-4dd8-999c-290708cc5386","resolution":{"observed_at":"2026-07-10T12:57:07.766741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":"1809.00496","doi":"10.48550/arxiv.1809.00496","metadata_source":"pith","pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":"cs.CV","work_id":"2f4e32b3-48a5-4b83-946d-739ea8df5168","year":2018},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:4489ab6702429f1854d51c59a3bad1beceb03b8eb4951c6867ca3ae83d42f1d2","observation_id":"42e8e4b9-097d-493d-9bdf-5f18b0fc8fd5","resolution":{"observed_at":"2026-07-10T12:57:07.605649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.792255Z","title":"End-to-end audio- visual speech recognition,","venue":null,"work_id":"192c52f5-8d34-4516-8ebc-7584509cbe48","year":2018},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:54df1617fbdff4a3eeb7f0a571b40e276e810ad7e54b78abff38a8c361737816","observation_id":"79c96a54-7300-4bee-b00f-38a6e5f6d1d9","resolution":{"observed_at":"2026-07-10T12:57:07.793434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.786813Z","title":"Lipreading using temporal convolutional networks,","venue":null,"work_id":"e7542656-5b4d-4014-a87a-ed8b62347f47","year":2020},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:aa582d22bd83f053cf09bc95bddaf72b0a985bc79af27077fd61d59e0986ab79","observation_id":"7bcee6f3-6794-470b-9331-e67a34ba5fbc","resolution":{"observed_at":"2026-07-10T12:57:07.788000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.793984Z","title":"Training strategies for improved lip- reading,","venue":null,"work_id":"33799d8a-84e3-4b64-9ffd-bd49df2a28e2","year":2022},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:d7908cafbc4a310067bc50cca3382a7031244e170fc012d05d0be002610ec01d","observation_id":"bd7ccf15-1558-4d13-aac9-b69e475421bb","resolution":{"observed_at":"2026-07-10T12:57:07.795076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.778043Z","title":"A multimodal german dataset for automatic lip reading systems and transfer learning,","venue":null,"work_id":"92dc27f4-3af8-4d2f-a335-043bf5a4ea49","year":2022},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:7bec1d9e4657f886f247676afb949fb3b32da79346055ceba979ea465ad3bbdd","observation_id":"7c97ae26-d06e-4bd5-a39d-547fc6051e06","resolution":{"observed_at":"2026-07-10T12:57:07.779253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-022-00550-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Speech Recognition for Multiple Languages in the Wild,","venue":"Nature Machine Intelligence","work_id":"1335d7d4-7dd6-474f-bb54-03df4c8942b3","year":2022},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:783393b56d8acea986b468f388b3fde68cc9d5d9dffd65f4aeb92a4106ed3130","observation_id":"8432314e-b67e-41bc-8f0f-eb825ce1a1cc","resolution":{"observed_at":"2026-07-10T12:57:07.523625Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.784942Z","title":"Scaling multilingual visual speech recognition,","venue":null,"work_id":"1f8c5e0d-de6e-40aa-83a9-dcf35a0074c4","year":2025},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:86bc6925fc7c49da0be16fa16676cf74edc9ccd9d2e81f80c1460599d1ff8293","observation_id":"e6ff0fab-f406-4880-8956-bc472252b2e4","resolution":{"observed_at":"2026-07-10T12:57:07.786234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.776203Z","title":"Visual speech recognition for languages with limited labeled data using automatic labels from whisper,","venue":null,"work_id":"904525d8-24d0-4f1c-805a-308a448afb08","year":2024},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:01fddc6b7181210db199b17b4033d732e71ffcfc3f45ac4babd5d4db7d43aaa9","observation_id":"abd173d5-ed40-43b3-a6b6-279c9b085549","resolution":{"observed_at":"2026-07-10T12:57:07.777454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.758219Z","title":"Lrro: a lip reading data set for the under-resourced romanian language,","venue":null,"work_id":"a09628d1-8e68-42af-b985-2474bf7aab48","year":2020},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:44bcac037e13d65ec963ec88c3b8482e9fa57c04d997529e4332bdede68724fa","observation_id":"ceffa10a-dd0f-4d26-8f47-471fbe63cd37","resolution":{"observed_at":"2026-07-10T12:57:07.759395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.799532Z","title":"Toward language-independent lip reading: A transfer learning approach,","venue":null,"work_id":"f1e1c0d7-ed37-4950-afd6-91defe369f4a","year":2021},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:f68e855e1cfe13583c2000f33493fc98994f589a08203be3c324ad30e27939e8","observation_id":"f4714316-4d92-419d-a0f8-f6eff61246ad","resolution":{"observed_at":"2026-07-10T12:57:07.800840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.767405Z","title":"End-to-end lip reading in romanian with cross-lingual domain adaptation and lateral inhibition,","venue":null,"work_id":"0d64d36f-78c9-4512-9dfe-b9c7f4ecdfd7","year":2023},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:7925de107c864a5f2f523b5bc395abdb29f6ab797f99b11e20fc02a3e1ebca36","observation_id":"4bfc1d75-93ba-4c70-93e5-5097e924385b","resolution":{"observed_at":"2026-07-10T12:57:07.768627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.771118Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"4157d181-99a1-4071-adab-2b8f9337840b","year":2023},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:3ba4053b254bb04061888d5caf2f44a9a035f8f091d9f1f71f727091e1910251","observation_id":"3c8376d8-ff51-41ea-b8b4-869f1e6e7bef","resolution":{"observed_at":"2026-07-10T12:57:07.772266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.774475Z","title":"An audio-visual corpus for speech percep- tion and automatic speech recognition,","venue":null,"work_id":"bc75dde4-326f-4509-9fba-db0c5d519b78","year":2006},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:1ea7203a00715e81a3775a9ac43989cce1388f918157b684b894da3475c6a0b5","observation_id":"0de941e6-3fcc-438a-9517-7541fe6a68d5","resolution":{"observed_at":"2026-07-10T12:57:07.775662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.762269Z","title":"Lrw-1000: A naturally-distributed large-scale benchmark for lip reading in the wild,","venue":null,"work_id":"18f76200-6f03-4b42-b61d-a208f2553c5e","year":2019},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:1f86484c910c0a499d4c322608a487594e447efae180c3ba53003fd9a9c73cb1","observation_id":"fbcadae0-5547-446a-ae41-80573d54ffd5","resolution":{"observed_at":"2026-07-10T12:57:07.763500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.779813Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"67de5742-637c-4775-bb3f-1a8ef34591ea","year":2023},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:69f1ed8f18034f34c6f55128e7c44d5d63e974059849fa5246062b037638d119","observation_id":"ef0bb2c7-fc3e-47d3-9fea-b41cce30ebe5","resolution":{"observed_at":"2026-07-10T12:57:07.781003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.795629Z","title":"The Multilingual TEDx Corpus for Speech Recognition and Translation,","venue":null,"work_id":"bbe9a9e4-f6f4-4681-ae25-f149ad06fe1f","year":2021},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:b057bb50bc47bec317ad6a1e472791b6ff53959e25af68647f6003d24aa0f1bc","observation_id":"e5bfc115-1220-4bb7-ad90-530d55611d8e","resolution":{"observed_at":"2026-07-10T12:57:07.797065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.790427Z","title":"V oxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":"0bf99946-52af-4a46-a086-60dd2f569cb1","year":2018},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:e32c566d0579299aa92a8b97efaf9516811caa18c9ff923093ec03ab45d0b24a","observation_id":"9f1b07c5-e432-4a41-bc6a-073758491283","resolution":{"observed_at":"2026-07-10T12:57:07.791707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.788558Z","title":"Looking to listen at the cocktail party: A speaker- independent audio-visual model for speech separation,","venue":null,"work_id":"83ec5605-2ed0-42cb-9ace-7768aa3a1f39","year":2018},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:c351fb24db68e1c6129547ede7266ed96cf738a3063189cd9d3e4481492d7b8b","observation_id":"433e90eb-7505-44ee-851b-54890b9b5d12","resolution":{"observed_at":"2026-07-10T12:57:07.789885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.769167Z","title":"PySceneDetect: Python and OpenCV-based scene cut/transition detection program & library,","venue":null,"work_id":"757c8a85-38c7-4c84-9c68-2c63ed720210","year":2024},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:02ac60a2c91141ee441652279946de6c3ab8e70aa02749d78f810bed4e752733","observation_id":"7bd304dc-626b-4817-9e4b-c6bc2c805a04","resolution":{"observed_at":"2026-07-10T12:57:07.770542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.781547Z","title":"Arcface: Additive angular margin loss for deep face recognition,","venue":null,"work_id":"a8a8c0f1-65a5-41da-895e-d66f42e6881f","year":2019},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:c9f7c145d475ce3adb517bebdd003df1c2182640bfda8763dfca318e2d84321b","observation_id":"3733d10e-7a35-456f-add9-85a6c13c4bc6","resolution":{"observed_at":"2026-07-10T12:57:07.782691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.783226Z","title":"Sample and computation redistribution for efficient face detection,","venue":null,"work_id":"e8130958-96cf-44cd-b45f-98dfc0c28f51","year":2022},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:2995b07083264caf8bbd68ad86917986feabbc2bcc0141b385786835f6872a14","observation_id":"5c936dd5-2659-4f4d-8793-6f7bd49a0df8","resolution":{"observed_at":"2026-07-10T12:57:07.784394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.760065Z","title":"Pyannote. audio: neural building blocks for speaker diarization","venue":null,"work_id":"8b7c2be9-3f45-43f7-b678-4a8a8ff7e994","year":2020},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:7869d41fceb25cddcfeeea53b0761b7b3f41f57d3b7d6bb577572fc58455090f","observation_id":"fb8fe471-e162-4516-8aaf-6382762f8d82","resolution":{"observed_at":"2026-07-10T12:57:07.761708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.772800Z","title":"S3fd: Single shot scale-invariant face detector,","venue":null,"work_id":"506b0126-34c6-43b5-8892-04acec235953","year":2017},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:7cc399165ff219744c8bde2d8c24882eb212177e38dcba0c14b470c6946e2bcc","observation_id":"262cb23a-0737-47be-a251-081c5cd31191","resolution":{"observed_at":"2026-07-10T12:57:07.773945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.764044Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"bb02b593-dc36-4ec9-a6f8-d89d66d54435","year":2016},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:f703226abfa69e93828f5e1eb5333d3c9179b77184cad1f4bd0ee3602df13738","observation_id":"23260569-3503-49f7-b3be-40addb677030","resolution":{"observed_at":"2026-07-10T12:57:07.765175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.02368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.600863Z","title":"Ro-n3ws: Enhancing generalization in low-resource asr with diverse romanian speech benchmarks,","venue":null,"work_id":"723eaec3-94fc-452c-85d5-9fbf85fcd7fc","year":2026},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:f5f4021479ed14e5c1bc2f5647b340b3cd127d9a9eac3bb417514d5c2ea4171d","observation_id":"58a25b60-d11e-427c-ae01-2bb11e063b23","resolution":{"observed_at":"2026-07-10T12:57:07.602615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":"1510.08484","doi":null,"metadata_source":"pith","pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-07-10T12:57:07.598373Z","title":"MUSAN: A Music, Speech, and Noise Corpus","venue":"cs.SD","work_id":"7c604702-578b-4f91-9cc6-f8aa7dbe6d26","year":2015},"citing_paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T12:53:22.119074Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.08112"},"observation_digest":"sha256:12b0235795d714a9fcdcbb83d87f884c70d43272eacd0a010239fc51f01932bc","observation_id":"5bc25880-485f-4339-9d06-dcbf39c95e59","resolution":{"observed_at":"2026-07-10T12:57:07.599591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08112","last_updated":"2026-07-09T04:54:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:06:26.595463Z","submitted_at":"2026-07-09T04:54:53Z","title":"VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":24},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.08112."}