{"as_of":"2026-08-08T04:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a69d26344a922800033a6ffb0234b3d9c60e92b8363fcb96994b6025498a005","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:44:02.577587Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:43:58.304998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:44:02.849295Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.04635","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04635","snapshot_observed_at":"2026-08-07T10:44:02.849295Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","venue":"cs.CL","work_id":"87b886e1-e5a2-4187-878f-5623f94a5c4c","year":2025},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.304998Z"},"links":{"cited_paper":"/paper/2506.04635","citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:ee63a165f8aae98f6e47e80263aecc134ed041b654934ab0b707ad450e75641b","observation_id":"14534fc1-1de0-45a5-9a32-140aa25824c8","resolution":{"observed_at":"2026-08-07T10:44:02.920063Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04635/citation-record","integrity":"/paper/2506.04635/integrity","json":"/paper/2506.04635/citation-record.json","paper":"/paper/2506.04635"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.04635","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04635","snapshot_observed_at":"2026-08-07T10:44:02.849295Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","venue":"cs.CL","work_id":"87b886e1-e5a2-4187-878f-5623f94a5c4c","year":2025},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.304998Z"},"links":{"cited_paper":"/paper/2506.04635","citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:ee63a165f8aae98f6e47e80263aecc134ed041b654934ab0b707ad450e75641b","observation_id":"14534fc1-1de0-45a5-9a32-140aa25824c8","resolution":{"observed_at":"2026-08-07T10:44:02.920063Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.961924Z","title":"ViCocktail dataset In this section, we describe the multi-stage pipeline for auto- matically generating a dataset for A VSR model","venue":null,"work_id":"80da33f6-e954-4a38-aa89-a7821875652e","year":null},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.395010Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:434b4a6e2f9dd7d455b5eeb8bfd2ea85f92e99fdf71f0da7bbe38abe7c2b79ea","observation_id":"cda3b0d1-e221-46f6-8a58-e7c8b0932664","resolution":{"observed_at":"2026-08-07T10:44:09.037825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.662997Z","title":"The first model uses a Conformer-based encoder [31] with a CTC/Attention de- coder [32]","venue":null,"work_id":"9864075f-7eeb-4b53-8001-708e2ffa67d1","year":null},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.659123Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:bc7f9fd9a87208c0dc861ba1b3433589e70b061a16d0fd996c7e9c808c3d4d05","observation_id":"af47041d-62e8-4410-ac52-cee99ec66afa","resolution":{"observed_at":"2026-08-07T10:44:08.739735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.388984Z","title":null,"venue":null,"work_id":"41cfa9ad-65ae-4d99-a752-b246d582d68f","year":null},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.897221Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:2541b68a6ea9799ab2a641a90eb774f92747fa4800a0b3097f311502d010a23c","observation_id":"c55a85f0-9deb-42c5-b28f-c3c9109eb22d","resolution":{"observed_at":"2026-08-07T10:44:08.461469Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.522228Z","title":"natural”, “music","venue":null,"work_id":"d4bae03d-61a4-4a7e-8eeb-5f53ad9bde1f","year":null},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.762305Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:d384434f39b85e365626e7eb76a95845870400e723fe785f45a904d5b2513d6a","observation_id":"34ae3160-da82-41d3-b579-faa8a6eb7395","resolution":{"observed_at":"2026-08-07T10:44:08.603449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-07T10:43:59.852640Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.852640Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:2e6d88ba500f281d314fd172124a61c92f2c8bce27ba1b5834d233da33d0210e","observation_id":"a8e7cc0e-08b4-4f64-b6c7-a5b6f96bd24f","resolution":{"observed_at":"2026-08-07T10:43:59.852640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.245069Z","title":"Our data collection and preparation process is fully automated and can be extended to other languages","venue":null,"work_id":"94b7296f-0300-4c37-a409-f69cc0cb173e","year":null},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.065158Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:a54a35d4d15f3e271ac78d544716956e99310db950593466a7ba2608d01af239","observation_id":"31069dcb-5d22-4b6d-8860-ed195367982f","resolution":{"observed_at":"2026-08-07T10:44:08.315209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.187872Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.187872Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:792aea7d951fa3d978c2af669b76f607d127bc1c6b1b0adf07527ddd80ee4d7e","observation_id":"0b9620e7-3120-47fc-83fe-813600c7f8d6","resolution":{"observed_at":"2026-08-07T10:43:59.187872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.086651Z","title":"Integration of acous- tic and visual speech signals using neural networks,","venue":null,"work_id":"c6f98f2c-bbde-42f2-a428-082df20d37cf","year":1989},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.325929Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:e96ea5c332628f20aa2fb6830033b1a919b3589524c5a4a8c8a193923673a593","observation_id":"e025039d-30c9-482c-9372-2276f42acc19","resolution":{"observed_at":"2026-08-07T10:44:08.158035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.964898Z","title":"See me, hear me: inte- grating automatic speech recognition and lip-reading,","venue":null,"work_id":"6144ce71-b895-480d-9809-79c0ee2a0ff8","year":1994},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.466040Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:dae31a903d678d7baa5df3f07781e6734a1299304e581d2990426cc15822b565","observation_id":"66ef00be-2e43-4000-8ffb-1a7c9f6da7fe","resolution":{"observed_at":"2026-08-07T10:44:08.028221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.833568Z","title":"Multimodal interfaces,","venue":null,"work_id":"9873eda9-a7d3-4576-a125-6d3fe73eb52e","year":1996},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.589762Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:098f1e186b5b5f4a75a01331a5adb22679482677c8d9923c4e777b033fef3674","observation_id":"cf6772e2-062b-4b11-a5f5-d8f0eaa910dd","resolution":{"observed_at":"2026-08-07T10:44:07.885954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.673899Z","title":"Lip read- ing sentences in the wild,","venue":null,"work_id":"27316819-341b-4060-895d-0638828e856a","year":2017},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.712319Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:3c82ff10bdb05b10193217cca2763c5752e9aee5c0159559776617bf649c0005","observation_id":"ddaa6b4d-bd68-4df0-81f8-e6212c4d5f7f","resolution":{"observed_at":"2026-08-07T10:44:07.750127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.801610Z","title":"RUSA VIC corpus: Russian audio-visual speech in cars,","venue":null,"work_id":"a1279495-2f03-42ca-8044-9826c73c96ac","year":2022},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.799174Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:63eda2ce2f14f8289ced449b33271bfa39b63421fbf9178543c50ae8467992cb","observation_id":"1abe6788-433b-426a-b964-dccf5c0adfcd","resolution":{"observed_at":"2026-08-07T10:44:06.869597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.539677Z","title":"Large-scale visual speech recognition,","venue":null,"work_id":"a8ef9e86-1c11-4090-9d19-8ef9d3d6f4c1","year":2019},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:59.968516Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:2d49e10d1620b53f2b0847ca5cd73032fa1041e6ace60e95e8c62a2feb281dc5","observation_id":"97db2532-7544-4c47-9e69-7132363b267b","resolution":{"observed_at":"2026-08-07T10:44:07.601661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.407438Z","title":"Avas: Speech database for multimodal recognition applications,","venue":null,"work_id":"38060f9b-b9b6-46ce-9631-40c02e9c0610","year":2013},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.102673Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:0aac42949ff6903cf328ccade1abdcbfc05579fd3c18710855bf0b52c9ec20f9","observation_id":"80da9692-e488-4ef2-8012-8ff559f16835","resolution":{"observed_at":"2026-08-07T10:44:07.478794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.252881Z","title":"An arabic visual dataset for visual speech recognition,","venue":null,"work_id":"cee0fed8-2a6d-4a3f-aa3a-804bd1e5457a","year":2019},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.250298Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:b98bb0df14379e2291d0807d1132b2842f5088661d51faa767b33559cdfe0400","observation_id":"16c16b9d-f679-400a-88c3-c35c431f57ec","resolution":{"observed_at":"2026-08-07T10:44:07.328730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:07.084274Z","title":"Cn-cvs: A mandarin audio- visual dataset for large vocabulary continuous visual to speech synthesis,","venue":null,"work_id":"44f2c7cb-6a69-4db1-8907-6a68b57629c1","year":2023},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.380608Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:5b6d2460639a6b859ca8ec7f9f754287fb809dbf7477e1848db5446d8981f51d","observation_id":"a85b86a1-6850-4757-a564-b82e1ddc902d","resolution":{"observed_at":"2026-08-07T10:44:07.159675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.955598Z","title":"Lipreading with densenet and resbi-lstm,","venue":null,"work_id":"ddd31020-b906-4438-bed1-95a967922aa5","year":2020},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.508386Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:13a2edea4a9b6e0a9031cc48dfad3c3e7c3e756ed640752eefd09fc206e33466","observation_id":"caf27eae-3b0e-4f6a-b147-4f5a72c66176","resolution":{"observed_at":"2026-08-07T10:44:07.028858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.574357Z","title":"A cascade sequence- to-sequence model for chinese mandarin lip reading,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.574357Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:594df3a95d7f92f720bcb05d63d8189809b39118873ab7612b7f1938e6ceb4d3","observation_id":"c5fb88b5-9090-425a-afc2-c04eba3c98d2","resolution":{"observed_at":"2026-08-07T10:44:00.574357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:05.790758Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"73298bcd-b89a-4e99-bd48-9f284379295b","year":2023},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.557071Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:4d8686dfdab0e3d4d3020d3808464c76844dbfd464af99cb9bdea873b6d68aa9","observation_id":"4a6fb9e2-5068-4426-a192-7c4b4f6122bd","resolution":{"observed_at":"2026-08-07T10:44:05.859305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.664124Z","title":"Havrus corpus: High-speed recordings of audio-visual russian speech,","venue":null,"work_id":"605cf940-e1df-4124-98f0-97f9cda4b77c","year":2016},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:00.958153Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:4b7ced36186169fa494695e05171d4ed854743cd03172d11246141c3675f724c","observation_id":"82c188c4-f436-4a9b-8934-fe8c410b2b7b","resolution":{"observed_at":"2026-08-07T10:44:06.720953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.549735Z","title":"Towards es- timating the upper bound of visual-speech recognition: The visual lip-reading feasibility database,","venue":null,"work_id":"b5dcc3d8-5d8c-44a8-a141-9eef35e0b040","year":2017},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.140474Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:4ed8a1620cb2ccb9f667d55ad0156e9c76444f3223b1e185366e4b92c8fa57fe","observation_id":"bef02caf-cb17-4f85-b162-160266766334","resolution":{"observed_at":"2026-08-07T10:44:06.600363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.444622Z","title":"Visual lip reading dataset in turkish,","venue":null,"work_id":"5f010254-b4ff-4622-b733-6fd65779ec61","year":2023},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.293218Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:c97f12ece0973ca084d697ec824175499ee7dd877237c933925e48204de22cf5","observation_id":"42e40033-5729-4718-bbf1-5cdc395bb8ae","resolution":{"observed_at":"2026-08-07T10:44:06.491929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:08.841857Z","title":"The ASD model relies on both audio and visual features to deter- mine when a person in the video is actually speaking","venue":null,"work_id":"98627d83-b108-41b7-a849-750fcc4c6a43","year":null},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:58.506495Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:5e29d9c62a2ffec2653ec980a104697bc5ecd7380dba14f22cc3fd905ab1558e","observation_id":"6b858014-4c99-4a7e-8f23-27711c5e815f","resolution":{"observed_at":"2026-08-07T10:44:08.900652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.310275Z","title":"Lip reading in the wild,","venue":null,"work_id":"e6530020-ca97-470d-893d-a13117839ac5","year":2016},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.352567Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:97100a9059e5c8b296c0b059437ac09d5ddcf55baad521119689fc1b7d42bd01","observation_id":"760ad800-c7ad-4ebc-8cc5-b6a609744b58","resolution":{"observed_at":"2026-08-07T10:44:06.383881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:06.126623Z","title":"Robust self-supervised audio-visual speech recognition,","venue":null,"work_id":"c928721b-6b02-4299-8b39-a509dbbb1670","year":2022},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.425993Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:8201536ca3597a2addb3dca9a743c3bee6d52280dfc0ec8345fe072643b67f28","observation_id":"7b42453e-0765-48e7-947b-7acba01e11d4","resolution":{"observed_at":"2026-08-07T10:44:06.199784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:05.934210Z","title":"Whisper-flamingo: Integrating visual fea- tures into whisper for audio-visual speech recognition and trans- lation,","venue":null,"work_id":"1669a49c-8958-4982-b2b1-ce1af91f0df6","year":2024},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.499122Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:305d55a740877dfbc83d8091a3d644c8faa62beb7d115e5c9d57b3d698b64c8b","observation_id":"d456a7ff-1ee3-4d35-b82c-aaed08e9dc57","resolution":{"observed_at":"2026-08-07T10:44:06.022408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.615895Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.615895Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:32b2a5a15f586c1429e2449774e4745cbf910e33c40d89cf63e86c1d7577b441","observation_id":"471ae582-469e-466f-8343-a189ba9faf54","resolution":{"observed_at":"2026-08-07T10:44:01.615895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.671995Z","title":"Simple and effective zero-shot cross-lingual phoneme recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.671995Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:2b14b4d540286eb001efe6ebeb94d81453e89f19fd4d96915f7e3efdab4d3314","observation_id":"24ef293d-e845-4682-afbc-87b2ad79bfc6","resolution":{"observed_at":"2026-08-07T10:44:01.671995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:05.599302Z","title":"S3fd: Single shot scale-invariant face detector,","venue":null,"work_id":"9b6422f7-c471-4e33-b8b0-d1bfabc0cad2","year":2017},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.726648Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:6933cf9e865e105425632bae0424461655caeb417a2dcfdd852aee9af051cf16","observation_id":"2849a824-84b2-42d5-8a38-e82436792501","resolution":{"observed_at":"2026-08-07T10:44:05.697665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:05.485324Z","title":"A light weight model for active speaker detection,","venue":null,"work_id":"a227fd24-2948-431e-aa7b-16faa67aa169","year":2023},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.800743Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:48d901ea6e1442dd90584e84ae50d116f5d9d35c7a5765c90bbf6f16a19144ef","observation_id":"abbf2c26-b893-40cc-a4bf-c1e08487b3ea","resolution":{"observed_at":"2026-08-07T10:44:05.532314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:05.339422Z","title":"Out of time: Automated lip sync in the wild,","venue":null,"work_id":"0913c3bf-3fce-4dea-8eaf-db5ac381e60f","year":2016},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.862618Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:cdd05774f3cc23da53a3a6d581e2dc4f5f4ce8e1f80025b7316243c8e9cf5764","observation_id":"fedafee6-38e3-4709-9e24-ab31cf6c6faa","resolution":{"observed_at":"2026-08-07T10:44:05.413907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:05.082277Z","title":"Dlib-ml: A machine learning toolkit,","venue":null,"work_id":"12c57ef9-c031-4760-9f2d-360047b1cce1","year":2009},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.938616Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:1ac51eec94fc010e60507a9b6fa07a91be102178c8efba8a1400d1285eca7060","observation_id":"53c7fd6b-edc6-4728-81b2-38816c36a69c","resolution":{"observed_at":"2026-08-07T10:44:05.230983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:04.753891Z","title":"Vietnamese end-to-end speech recognition using wav2vec 2.0,","venue":null,"work_id":"c41ba220-128b-4a56-a7e5-7ffae71fbbe7","year":2021},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:01.986945Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:0d018e8c5b28e985af6a75269257bef8474f46f6ac46ff9ba9bd2beba8668de5","observation_id":"8258663b-4295-4237-949e-95f1acb13e81","resolution":{"observed_at":"2026-08-07T10:44:04.910813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:04.428002Z","title":"Synthetic conversations improve multi-talker asr,","venue":null,"work_id":"4c42a250-f602-426b-be56-5fd93e0ce285","year":2024},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.068194Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:7daf043bfa5f0caef138b3d43f7c404ba4397c5a1738e9dfb249c8ed20c795bd","observation_id":"06e23409-5baf-4e7e-a8e4-c44496ccd595","resolution":{"observed_at":"2026-08-07T10:44:04.554124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:04.028853Z","title":"Msa-asr: Efficient multilingual speaker attribution with frozen asr models,","venue":null,"work_id":"c0f2b632-0f63-43e7-a3e6-d4aa1ce31957","year":2025},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.192619Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:493bf5975ca1d9ec294555f5ffff077f59e19d095e46ac2a1537f4d8a155d6e6","observation_id":"b3e1757f-8f27-4af3-8d94-6012dfc76184","resolution":{"observed_at":"2026-08-07T10:44:04.202199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:03.859534Z","title":"Phowhisper: Automatic speech recognition for vietnamese,","venue":null,"work_id":"7dd269dd-37d3-45fe-b4bd-6df812016c05","year":2024},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.277536Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:e7ad9601838730e8d3d9cc090ebdbd37a3219e4c48131eb88523ef54f6aa3eef","observation_id":"bb1324eb-2107-40b9-8c39-0e37d2b80fcf","resolution":{"observed_at":"2026-08-07T10:44:03.940516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:03.487748Z","title":"End-to-end audio-visual speech recognition with conformers,","venue":null,"work_id":"34dfecbf-9d2e-43e8-bd0e-673d40e23c91","year":2021},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.360780Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:cde84e153ae90d247def2c4cb6fbc9d63bf49c1013cadb0c142f9f4c576de2fe","observation_id":"d5ceb486-d7ba-4b2a-af87-238661caba7d","resolution":{"observed_at":"2026-08-07T10:44:03.678059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.427128Z","title":"Hy- brid ctc/attention architecture for end-to-end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.427128Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:3c8f8108f6d5784dda4888421fc75964d22b7a466651dc6d04bf81152e6159d0","observation_id":"56da5b47-bc35-473c-a8de-6f583bad848d","resolution":{"observed_at":"2026-08-07T10:44:02.427128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:03.170213Z","title":"Subword regularization: Improving neural network translation models with multiple subword candidates,","venue":null,"work_id":"ee3ea3bf-dd1c-44db-bf4f-2c6df0e8cd53","year":2018},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.518850Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:7e5a28f169ef7ed66026c2a669df2def7e8f8a92a3b90fa8f21d974d804a02d2","observation_id":"d4d35d24-1f69-4048-856e-89f12b758e9b","resolution":{"observed_at":"2026-08-07T10:44:03.293287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:03.001246Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation,","venue":null,"work_id":"2dff10b4-2b02-4eb6-8f1e-f5d56f96b50e","year":2023},"citing_paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:02.577587Z"},"links":{"citing_paper":"/paper/2506.04635"},"observation_digest":"sha256:be358634126d6201d1af43097d24e80e110939ea69e4d22918796c8a3f29b68f","observation_id":"5dc24ec7-717d-4f4b-8817-26656b7bf6cd","resolution":{"observed_at":"2026-08-07T10:44:03.080745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04635","last_updated":"2025-06-05T05:13:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:34:45.508243Z","submitted_at":"2025-06-05T05:13:01Z","title":"ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.04635."}