{"as_of":"2026-08-08T23:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cb14bc09372bbbbd07a32ba161a52ad2bd171c825dd2027bc55e3000014264a","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:50.951353Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:48.987998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:26:51.425005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"cited_work":{"arxiv_id":"2506.02012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02012","snapshot_observed_at":"2026-08-07T13:26:51.425005Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","venue":"cs.CV","work_id":"13fdaf31-14d0-46d3-bd1c-012082b08ecc","year":2025},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:48.987998Z"},"links":{"cited_paper":"/paper/2506.02012","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:738cfb42d103d8aafbfb5980aaf2389a4d3dcf4bd72003a8c210ea9d6bc958c9","observation_id":"f16fa30a-8bec-4a7e-b1e9-821092d3c397","resolution":{"observed_at":"2026-08-07T13:26:51.504112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02012/citation-record","integrity":"/paper/2506.02012/integrity","json":"/paper/2506.02012/citation-record.json","paper":"/paper/2506.02012"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:54.508432Z","title":"Typically, a VSR system takes a silent video containing the speaker’s lip movements as input and outputs the corresponding text","venue":null,"work_id":"9c257bff-c9ac-4e26-9e84-e8c1672e6983","year":null},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:48.891052Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:7cf9791ddbdccc3d1252d25e6be1536c2fbfdc173d523755ea4d3549c50fe844","observation_id":"b37aed34-d145-4be2-98d0-b26ab68836dc","resolution":{"observed_at":"2026-08-07T13:26:54.549002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"cited_work":{"arxiv_id":"2506.02012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02012","snapshot_observed_at":"2026-08-07T13:26:51.425005Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","venue":"cs.CV","work_id":"13fdaf31-14d0-46d3-bd1c-012082b08ecc","year":2025},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:48.987998Z"},"links":{"cited_paper":"/paper/2506.02012","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:738cfb42d103d8aafbfb5980aaf2389a4d3dcf4bd72003a8c210ea9d6bc958c9","observation_id":"f16fa30a-8bec-4a7e-b1e9-821092d3c397","resolution":{"observed_at":"2026-08-07T13:26:51.504112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:54.401422Z","title":"Data To evaluate the effectiveness of the proposed methods, we need to select an appropriate dataset that enables LLMs to demon- strate their potential","venue":null,"work_id":"580f2d49-4750-4180-9a0a-caca9801a27f","year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.122743Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:5b72be1bbc4a139e7abae9cad520e0171ecfe82711203ddf786a9b6b50bd5aa4","observation_id":"b6b68f59-8a76-4fc6-b1c2-b6866386d3ee","resolution":{"observed_at":"2026-08-07T13:26:54.446779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:54.286128Z","title":"Results on Scaling Test We first conduct a Scaling Test to investigate how the LLM scale affects VSR performance","venue":null,"work_id":"1783e36a-576b-4bfd-9beb-88c57d3e89d7","year":null},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.219210Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:a79109375a0ea37abaaec4b40898fa7ab6d38e71d30787611a00b271be12b229","observation_id":"762b0e2f-eb5c-4727-8bdf-ccb35005817d","resolution":{"observed_at":"2026-08-07T13:26:54.347995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:54.182661Z","title":"By a comprehensive experimental study, several interesting conclu- sions can be drawn","venue":null,"work_id":"db17af53-2b48-47c2-ada1-a19942bd2381","year":null},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.339547Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:2c78e341b8e2c22c4c21c29821b806d8792778b14d6c47c42995371ef766ed00","observation_id":"5c3fdda2-e049-4577-b9b5-63b50531825a","resolution":{"observed_at":"2026-08-07T13:26:54.227348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01599","last_updated":"2016-12-16T16:09:34Z","snapshot_observed_at":"2026-07-06T05:17:29.499249Z","submitted_at":"2016-11-05T04:05:18Z","title":"LipNet: End-to-End Sentence-level Lipreading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01599","snapshot_observed_at":"2026-08-07T13:26:49.462849Z","title":"LipNet: Sentence-level lipreading,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.462849Z"},"links":{"cited_paper":"/paper/1611.01599","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:8278e5166d9fb83933512478a12b6a2523d3341014b4cfc12a350731da6d4940","observation_id":"a90a3d3c-9de4-430d-acb4-60865026ff96","resolution":{"observed_at":"2026-08-07T13:26:49.462849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:54.031430Z","title":"Large-scale visual speech recognition,","venue":null,"work_id":"e138fe56-d43a-4d42-a0c5-87dbec174a42","year":2019},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.577502Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:3de9750cc1c415c48cf78bdf18bc112f783abe903746b0e64b369698c301dd3f","observation_id":"c0bc5c44-0d9d-4e87-8190-505f49c24f5a","resolution":{"observed_at":"2026-08-07T13:26:54.105230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:53.822601Z","title":"Auto-A VSR: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"1ac7af89-6397-4031-a4de-439513acf069","year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.710060Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:33997f90a289cc9fa31b2cbb78c5c69b2ac8edea9738287d3582cc8c06fc055d","observation_id":"70d4497e-80f7-4555-9aac-065e795b019b","resolution":{"observed_at":"2026-08-07T13:26:53.906245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:53.677874Z","title":"Zero- shot fake video detection by audio-visual consistency,","venue":null,"work_id":"13b298cc-d6f0-443d-8f58-9d8a7fd22b50","year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.801766Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:ea5f08aeac37906f07a3c15d1494148ba27018673b3eceb2e5b9b67d785cb696","observation_id":"a9e9b772-6ece-44e2-8493-5a65aa9f11f3","resolution":{"observed_at":"2026-08-07T13:26:53.747874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:53.445569Z","title":"End-to-end audio-visual speech recognition with conformers,","venue":null,"work_id":"f7d90024-ecab-4306-b65b-d92ad5625b3a","year":2021},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.830794Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:bbfd14571acd83adf8924b6d43ca3869da5defa9af2f0155ce155c345d843d5d","observation_id":"8eb19c12-609b-4f9d-a03f-b4d2349dd87f","resolution":{"observed_at":"2026-08-07T13:26:53.530159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:49.868685Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.868685Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:5e2a9fa3038d052465c61cd6a54639b141a3cf45fd78f216ce6aa56d93ad6bfa","observation_id":"da87d841-f1f5-4358-889f-125ba353a560","resolution":{"observed_at":"2026-08-07T13:26:49.868685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:53.271774Z","title":"Audio-visual speech recognition with a hybrid CTC/attention architecture,","venue":null,"work_id":"49be9a55-42ad-4ff2-86d5-f59a64afd6be","year":2018},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.912997Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:0d5a805b581b1db58e9e5aef24f44793bcbdeda68a0a1f0bea3fad28c1d6e0fb","observation_id":"6b8b2fb7-6e6b-4dcd-8f94-a7f8f59eeecc","resolution":{"observed_at":"2026-08-07T13:26:53.368223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:49.952570Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:49.952570Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:cfd485a3d4e503042154d83df349a1de5d59fd653e9bf36a21d4756af6c33584","observation_id":"3d56787f-5e08-4d60-b1db-07a5e87ece83","resolution":{"observed_at":"2026-08-07T13:26:49.952570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:53.158706Z","title":"SyncVSR: Data-efficient visual speech recognition with end-to-end cross- modal audio token synchronization,","venue":null,"work_id":"928144ac-529a-4b8c-bbb4-5f96bb959ab1","year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.008690Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:43e4e3601263f8d827221547227af75964d31b6cdea78990ae6ae1d6b40ed080","observation_id":"49acefc7-7e40-4a56-827e-894eac7a893f","resolution":{"observed_at":"2026-08-07T13:26:53.191811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16438","last_updated":"2024-10-21T19:02:13Z","snapshot_observed_at":"2026-07-06T19:37:24.895623Z","submitted_at":"2024-10-21T19:02:13Z","title":"AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16438","snapshot_observed_at":"2026-08-07T13:26:50.042373Z","title":"AlignVSR: Audio-visual cross-modal alignment for visual speech recogni- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.042373Z"},"links":{"cited_paper":"/paper/2410.16438","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:a9bdf446cccb78fd1e07cb771dbaf92a02e61d6ae0e362d3b6ce5e1637bd2e45","observation_id":"150bd5e0-5047-4913-b84f-9f45720ad619","resolution":{"observed_at":"2026-08-07T13:26:50.042373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:50.076082Z","title":"Video understanding with large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.076082Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:17a674d31ed3ee36d6b700114a972b834390ef64c5127be9e95ba1daaa459dac","observation_id":"f9b40599-a2f9-453a-b2b0-10e4c6ee0d0a","resolution":{"observed_at":"2026-08-07T13:26:50.076082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-07T13:26:50.104456Z","title":"Audio-visual LLM for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.104456Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:951c64ef5b5805ac0433e343fa5ff3b1b0f736fff9509f810f21b2beb8a1ac81","observation_id":"0117793b-5de8-4a38-8bf8-8c9c07a7b2ee","resolution":{"observed_at":"2026-08-07T13:26:50.104456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16038","last_updated":"2024-01-30T14:37:10Z","snapshot_observed_at":"2026-08-06T12:45:18.285554Z","submitted_at":"2024-01-30T14:37:10Z","title":"A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16038","snapshot_observed_at":"2026-08-07T13:26:50.136607Z","title":"A survey on generative AI and LLM for video generation, understanding, and streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.136607Z"},"links":{"cited_paper":"/paper/2404.16038","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:fce0d24f1fe84992ba42e596625e2c7999f93e7e82c90f21e780a77fd182cd4b","observation_id":"5db23810-0159-4806-8878-5b2ca4b1e425","resolution":{"observed_at":"2026-08-07T13:26:50.136607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:53.023300Z","title":"In- teractive video search with multi-modal LLM video captioning,","venue":null,"work_id":"7f567bd8-ce96-41aa-be06-9f5cad5d0fa0","year":2025},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.164958Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:b07a5b94a03113f4a181e09b94492737c98721a56e97a5ba166a0d8b8b65ce5d","observation_id":"5e6cc251-cb88-4cba-aca1-49a25c431ee7","resolution":{"observed_at":"2026-08-07T13:26:53.084681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:50.215701Z","title":"Improv- ing image captioning descriptiveness by ranking and LLM-based fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.215701Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:2b2876465eadfb52659442023e9c6907cf0966a71c4a15f51cdbdf644c20c928","observation_id":"5341b810-45ce-41fc-b7fd-ce13ed146c14","resolution":{"observed_at":"2026-08-07T13:26:50.215701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.918079Z","title":"From Alt-text to real context: Revolutionizing image captioning using the potential of LLM,","venue":null,"work_id":"66aa7a78-1ca3-47ca-bdc1-c1260f69efeb","year":2025},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.249129Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:6b4fa974f7d7d474b839cb0e40ff62c6d2fe659c97d99b4f4c301567a0fc932a","observation_id":"ed53de28-daf9-497b-8404-adcd6a9563a2","resolution":{"observed_at":"2026-08-07T13:26:52.962299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.826501Z","title":"Image captioning using multimodal LLMs,","venue":null,"work_id":"d8c74452-2403-48f9-adaa-43d45a7a9822","year":2025},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.285952Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:569dce9cbab0df119af5b2703bf1cadc78a06246aebceb237e92641aa337e7e0","observation_id":"b3005850-b162-48f3-ae2f-f8932267cbe1","resolution":{"observed_at":"2026-08-07T13:26:52.867854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12319","last_updated":"2025-03-07T09:30:16Z","snapshot_observed_at":"2026-08-07T00:42:32.268631Z","submitted_at":"2024-09-18T21:17:27Z","title":"Large Language Models are Strong Audio-Visual Speech Recognition Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12319","snapshot_observed_at":"2026-08-07T13:26:50.325971Z","title":"Large language models are strong audio-visual speech recognition learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.325971Z"},"links":{"cited_paper":"/paper/2409.12319","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:de4e25581934d16141780c8f11ff1177981f23684f965ccea87e561a09112df0","observation_id":"0327afcf-c734-44be-94d0-24058c03960e","resolution":{"observed_at":"2026-08-07T13:26:50.325971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.746074Z","title":"Where visual speech meets language: VSP-LLM framework for efficient and context- aware visual speech processing,","venue":null,"work_id":"743e8a6b-53a0-48cf-b4f6-f36ba3f32e97","year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.365046Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:ebdff8d27af4fe36471f4d1bef71b44fffcaf8208eb312c871714f27c51fe942","observation_id":"82ab2c1c-d7f1-48a4-92cc-31733056dfad","resolution":{"observed_at":"2026-08-07T13:26:52.779608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.648221Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"cd21abb3-4d1d-46de-ae66-e6b6812e0e42","year":2022},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.399320Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:d018b828bfcddd5d9647d6646f2121ec7dcc0468007701efbf2f6d37fd13b7c1","observation_id":"00a6e8bb-a13c-4354-baf0-8e26871288e2","resolution":{"observed_at":"2026-08-07T13:26:52.690197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.547699Z","title":"QLoRA: efficient finetuning of quantized LLMs,","venue":null,"work_id":"0b649b1c-9b51-45f6-ae1f-17d08d07de81","year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.444681Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:236c05a32adafaf1895ee6be79e9988fdf3b2a1607c6771ab519d6fdc971d883","observation_id":"6c891675-f42a-477c-8555-633857dc29f1","resolution":{"observed_at":"2026-08-07T13:26:52.588466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:26:50.497376Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.497376Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:a3ad0c892bbb0ad445610cc66719a0084e327fde26d776689a7a37c8d0c8fe2b","observation_id":"163a93d6-7ced-4505-9690-2c48bdb8f7ad","resolution":{"observed_at":"2026-08-07T13:26:50.497376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:26:50.531636Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.531636Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:4638d065389ea40d205aef0f35392c6cb6bc9c224e2562dc04a702118ea2d99d","observation_id":"bc8b4bba-044c-49b5-84b1-eada9dd0c73f","resolution":{"observed_at":"2026-08-07T13:26:50.531636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-07T13:26:50.575343Z","title":"Seed-ASR: Understanding diverse speech and contexts with LLM-based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.575343Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:f04a25b11542ae8a76fbce9fed197a1b7ab5a755ed725bbf20b8d64d5ea73067","observation_id":"e5ce7bd1-b68d-4f4e-aaa7-1dca9bbc100b","resolution":{"observed_at":"2026-08-07T13:26:50.575343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.431571Z","title":"SALM: Speech- augmented language model with in-context learning for speech recognition and translation,","venue":null,"work_id":"11aba1be-ff5d-4701-89b6-640c7dc90618","year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.621678Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:3b48c236e609c5678c06a7cc274a53d4802ed508c7d9422e81182538a0ad2dd6","observation_id":"88951f03-dd06-4f25-ab6f-b33e1550af26","resolution":{"observed_at":"2026-08-07T13:26:52.486867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.337998Z","title":"End-to-end speech recognition contextualization with large language models,","venue":null,"work_id":"22a1af61-7104-411d-aa7f-dac662d18249","year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.638136Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:fbfae5939101ab34d334036452ed25fadfa3bb3fc04f6898052095f89ce62437","observation_id":"e0a989c0-1396-4f1e-9cba-a0d4c16c8906","resolution":{"observed_at":"2026-08-07T13:26:52.373358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01860","last_updated":"2024-06-04T00:09:43Z","snapshot_observed_at":"2026-07-06T18:24:52.604412Z","submitted_at":"2024-06-04T00:09:43Z","title":"Eliciting the Priors of Large Language Models using Iterated In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01860","snapshot_observed_at":"2026-08-07T13:26:50.653716Z","title":"Eliciting the priors of large lan- guage models using iterated in-context learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.653716Z"},"links":{"cited_paper":"/paper/2406.01860","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:d04c21bf2baacebbf860e38d42569412818f9bbb3a5a25388572274a289d57dd","observation_id":"1e71e487-a1dc-4eca-8346-8eb7ef13852a","resolution":{"observed_at":"2026-08-07T13:26:50.653716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.226837Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":"fd1dfc81-4d22-4c46-bb50-bb711eb625f7","year":2018},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.682959Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:5596c227852efc228e66a4488d913864f9c9bee27e17344c94096658ae634260","observation_id":"9773ea2a-8ec3-432e-9950-a73c074c1dbe","resolution":{"observed_at":"2026-08-07T13:26:52.274212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.126118Z","title":"CNVSRC 2023: The first Chinese continuous visual speech recognition challenge,","venue":null,"work_id":"0fdf1617-e170-4998-8268-d7e3df43815e","year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.713141Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:2f8ebcdb4610de18f6d27e9e7ef0ca44fe6418cd9a6429149f620229360b195c","observation_id":"82560c5f-b2c8-4036-90d3-a6af7d469a01","resolution":{"observed_at":"2026-08-07T13:26:52.170063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:52.020907Z","title":"CN-CVS: A Mandarin audio-visual dataset for large vocabulary continuous visual to speech synthesis,","venue":null,"work_id":"3fde398e-a28c-48c6-8d8d-3c3fa4947275","year":2023},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.767581Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:542170e11bc991fbd0c22f920e39c125caecf7dde2a01baac48a7e228a12212e","observation_id":"e126a1f0-ed55-4bd6-8622-f923f61a0da1","resolution":{"observed_at":"2026-08-07T13:26:52.062046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:51.753316Z","title":"Reti- naface: Single-shot multi-level face localisation in the wild,","venue":null,"work_id":"3c70ea71-d43b-4cfd-acd1-ab3e884bbb0f","year":2020},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.865248Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:f2ac863932608b1b5e86f3da65f87a15f273133dcdebd69eb374653959d5de7a","observation_id":"2459821c-f360-47ef-bbe0-f41d26cc0bb9","resolution":{"observed_at":"2026-08-07T13:26:51.921380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:26:51.610856Z","title":"How far are we from solving the 2D & 3D face alignment problem?(and a dataset of 230,000 3D facial landmarks),","venue":null,"work_id":"3e277032-186e-47ca-92ad-22e79752f83a","year":2017},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.916906Z"},"links":{"citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:5a77fbd9dcf45b8eaa9d497687e0471e8174ae55ec5b9ff43b7242d29abb4803","observation_id":"0233da9d-c52d-48dc-a9b5-20952f3ad4de","resolution":{"observed_at":"2026-08-07T13:26:51.677890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:26:50.951353Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:50.951353Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02012"},"observation_digest":"sha256:8066db39b1f4eecc23b0817ad1474afbf517954818915dfa1410ec152ab7b63b","observation_id":"cfc314a5-4cd6-4b34-8c8d-07d91929297d","resolution":{"observed_at":"2026-08-07T13:26:50.951353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02012","last_updated":"2025-05-27T21:00:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T08:27:51.508405Z","submitted_at":"2025-05-27T21:00:12Z","title":"Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2506.02012."}