{"as_of":"2026-08-23T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:649ef4fff4401ae379075986021eb36dbc8b7559fd2b666dc79435b41039516d","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T01:05:25.297558Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.19005/citation-record","integrity":"/paper/2412.19005/integrity","json":"/paper/2412.19005/citation-record.json","paper":"/paper/2412.19005"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.753772Z","title":null,"venue":null,"work_id":"4a93e1e1-2f32-4455-9248-ffc3871cbf84","year":2022},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.135052Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:049cf42b3f1f0178660a9768ffe52cbd2cd22917b1911cdf57ccef1d5a6d60eb","observation_id":"9819fb71-3be1-4bb7-ae70-12641b8398ae","resolution":{"observed_at":"2026-08-11T01:05:25.757889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.139898Z","title":"A.; and Terry, M","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.139898Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:5db538dbe58a1bd3fdf5b5a8c9f7abb83b61671dd8e9c222dbdf8fea74586cc1","observation_id":"f8e323fd-71e4-4e01-9866-0593d073c01c","resolution":{"observed_at":"2026-08-11T01:05:25.139898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.734437Z","title":null,"venue":null,"work_id":"a53158cf-9d66-4a62-8761-b7ad83a48b34","year":2017},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.144700Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:d7459c4472f26fd6c432c487948bde26bbb931156ed4d8db63ed763fcda733f7","observation_id":"aec799f5-a5c7-498f-909b-254ba7d47342","resolution":{"observed_at":"2026-08-11T01:05:25.738337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.723062Z","title":null,"venue":null,"work_id":"2db5a563-12f4-42be-a194-2b2154bff15b","year":2019},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.149302Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:a9cff9d68310a48a612078506b466a2651b38947ee1942c17c899e0290060e05","observation_id":"6ed1bcd3-b5f5-4f3f-839d-1750d99fa922","resolution":{"observed_at":"2026-08-11T01:05:25.726840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T01:05:25.154177Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.154177Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:8a1f2985e56e1e7ec5be6d4ae25bfa822998d13d19d8df52bbbe958936d24315","observation_id":"e75adb01-ee7a-49bd-b510-13c046284058","resolution":{"observed_at":"2026-08-11T01:05:25.154177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.709776Z","title":null,"venue":null,"work_id":"072c0b8e-9f0b-4014-a7f2-4802d5b4427e","year":2022},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.159412Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:558fe124a9585ba79001ca0e9120498aea79e1fcce551954ad0451fa3e24691c","observation_id":"51bd5f57-11ea-4469-bac2-e5daf317de48","resolution":{"observed_at":"2026-08-11T01:05:25.713510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.698800Z","title":"S.; et al","venue":null,"work_id":"e9250cd0-abcc-4ed4-9716-d5113e5f283d","year":2017},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.164318Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:14b8a1f1e8526c531f6c08521ba3ac8ea4521321ffd307bfe2d41dd52c9920aa","observation_id":"5ea404e4-35ae-413d-b607-00300f95f472","resolution":{"observed_at":"2026-08-11T01:05:25.702530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.686895Z","title":null,"venue":null,"work_id":"b9a53bdd-952b-49dc-8a4e-7acf8143113c","year":2022},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.168796Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:7cdfa25cbf15ed3f46689d4495f73cddaa6c6a5b5694b8c957ed3d908bed9c9d","observation_id":"3be9c8a3-d2d3-4296-ba7e-970b6391e6ae","resolution":{"observed_at":"2026-08-11T01:05:25.690915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.675186Z","title":null,"venue":null,"work_id":"2bf9d96d-8deb-46fb-b30d-86e6e0b437c6","year":2021},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.172885Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:6f58cf83def4d345f806dd7439a8890a22e73cd6fe29656dbe088359006bc5a3","observation_id":"43fad217-ff45-4afc-bbb1-91492a4ad0ec","resolution":{"observed_at":"2026-08-11T01:05:25.678966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.663250Z","title":null,"venue":null,"work_id":"633dcdd4-5097-40ca-aa53-54252213ee24","year":2022},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.177145Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:75d6f6db02ca39be0901e10ca67519e315539a8bfddb4e11d3b10110a026a781","observation_id":"23561336-57b0-485b-90fd-3e88674c3dbc","resolution":{"observed_at":"2026-08-11T01:05:25.666864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.650400Z","title":"A.; and Est \\` e ve, Y","venue":null,"work_id":"e0b98d59-2e21-4c29-a0a3-288f9e38bc68","year":2018},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.181125Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:423c796cd5da60f2720d91f75784a7a842cbe8b0694e399b237833c84c2d8ebb","observation_id":"c52d7ff5-170c-4429-ae08-ca218a69f7b5","resolution":{"observed_at":"2026-08-11T01:05:25.654588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.639271Z","title":null,"venue":null,"work_id":"c253f0f6-fa32-4ec3-a505-872f1eaee576","year":2020},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.185301Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:aab6bbc683aedf9da7558106dc904bf4c445bf22e1e789ae116911eb8bd7115e","observation_id":"b5bf6700-d066-4bcf-8707-a8ef9c8612a4","resolution":{"observed_at":"2026-08-11T01:05:25.643046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.628694Z","title":null,"venue":null,"work_id":"b2233d7d-9f58-4008-86e9-83e87e15504b","year":2022},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.189883Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:0ff5d364503d1060a524f3de63674ce6f4dde0e16644902f30298d2665d81724","observation_id":"704a2e8c-ee68-48cf-85d9-c96f39ea67d6","resolution":{"observed_at":"2026-08-11T01:05:25.632331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.616567Z","title":"B.; et al","venue":null,"work_id":"40db2d35-6771-458a-bb37-2f5365e57ffe","year":2023},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.193915Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:729f1ebb87c7b308b97e3b4a05c23e62fab896c75cef94c95eb2e047b59a0731","observation_id":"2a5b3729-4203-4a9c-b3f1-73130e9635b1","resolution":{"observed_at":"2026-08-11T01:05:25.620550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.01690","last_updated":"2022-02-02T23:38:10Z","snapshot_observed_at":"2026-08-16T17:44:34.581969Z","submitted_at":"2021-11-02T15:49:20Z","title":"Recent Advances in End-to-End Automatic Speech Recognition","version":2},"cited_work":{"arxiv_id":"2111.01690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.01690","snapshot_observed_at":"2026-08-11T01:05:25.413096Z","title":"Recent Advances in End-to-End Automatic Speech Recognition","venue":"eess.AS","work_id":"21361f28-65d4-42ef-b9f3-6e65b6941e7e","year":2021},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.197977Z"},"links":{"cited_paper":"/paper/2111.01690","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:0384bf795ee3a1d257346f5b65bc45313651fd5d988734fb865ab65cf38d650e","observation_id":"b86b23b8-8390-4194-9eed-839cdf2d4590","resolution":{"observed_at":"2026-08-11T01:05:25.418045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00624","last_updated":"2024-08-01T15:09:32Z","snapshot_observed_at":"2026-08-16T13:29:11.956691Z","submitted_at":"2024-08-01T15:09:32Z","title":"SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data","version":1},"cited_work":{"arxiv_id":"2408.00624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.00624","snapshot_observed_at":"2026-08-11T01:05:25.394410Z","title":"SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data","venue":"eess.AS","work_id":"799ed4ac-4f17-453f-b56a-503de9de3f6e","year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.202387Z"},"links":{"cited_paper":"/paper/2408.00624","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:7ee588e1173796cc6119593ccc30b2f41aa58fa10c6c09a62c0e6634488d4c64","observation_id":"7c6b1571-201a-4e10-9a73-84e31f452a04","resolution":{"observed_at":"2026-08-11T01:05:25.400860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.603682Z","title":null,"venue":null,"work_id":"e1e0964f-b89b-4de1-b35a-b3a5d9210b35","year":2021},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.206854Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:66fc6b5a420526443574c7fd601fb3998a4ef898baed2727b4b54dd5bdc27a47","observation_id":"0aee6e1b-36b6-46d7-88fc-bd34bd4fd4c0","resolution":{"observed_at":"2026-08-11T01:05:25.608137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.590746Z","title":null,"venue":null,"work_id":"9ace375b-8e8c-4e1a-a12b-75000c136ecf","year":2019},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.210740Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:ecf31f3d0b8d8a1c907941c5050e6869e21f98ba96b196702e9c551ec470e250","observation_id":"0daedf50-3487-434d-9505-52db1fb1be6b","resolution":{"observed_at":"2026-08-11T01:05:25.595395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.578944Z","title":null,"venue":null,"work_id":"370bf412-e470-4c54-83c6-e6d11e91a858","year":2015},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.214550Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:13e44786cc436c38bfd1eaa4cebe31cb2ac633d365c3b838f409b2dce55b01eb","observation_id":"c4777255-4c87-48c9-bb7a-9d837499d61c","resolution":{"observed_at":"2026-08-11T01:05:25.582849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.566530Z","title":null,"venue":null,"work_id":"9c9b8e43-55c9-4d52-a05f-effe3325c527","year":2020},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.218564Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:fd92bc816a9664127e525b5d1d34cbd796bd14fc5874ca0d7447c4da7f41a0a7","observation_id":"ae35bcb0-eccf-4eab-9e5e-b490705f9b68","resolution":{"observed_at":"2026-08-11T01:05:25.570703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.553984Z","title":null,"venue":null,"work_id":"53164509-948f-43f5-907c-087cf7f5249b","year":2023},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.222798Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:c28090fd1f0b6d7dc9f385ee7c7f1c0bf08b193ea67d153075ec521ca99a9103","observation_id":"4a26dfb9-7821-493b-95a5-2dce9c6ea197","resolution":{"observed_at":"2026-08-11T01:05:25.558098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.541183Z","title":null,"venue":null,"work_id":"5d7d9bc3-17dc-4438-8453-e5cddc69c801","year":2023},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.227086Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:5cd3a0270443dcc811b42300f58479454338294c4b7e8b0c5c60fc4f8fe2b796","observation_id":"e5c2c538-f13e-4199-8a7d-57562c9d43cc","resolution":{"observed_at":"2026-08-11T01:05:25.545170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16658","last_updated":"2024-08-27T02:15:49Z","snapshot_observed_at":"2026-08-19T14:49:48.249453Z","submitted_at":"2024-01-30T01:22:18Z","title":"OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16658","snapshot_observed_at":"2026-08-11T01:05:25.231138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.231138Z"},"links":{"cited_paper":"/paper/2401.16658","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:1677114056e2896db1c1712835054c1580f6dd63d32f0d8c5f2b25d56b3c5f3c","observation_id":"e112e5cf-dd33-4854-bbed-943d7f4c078a","resolution":{"observed_at":"2026-08-11T01:05:25.231138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.529322Z","title":null,"venue":null,"work_id":"c9b6614c-f6d0-429d-a1e7-5534c637561a","year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.235249Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:1edb5f654fb033594f544ebf6871a096641cd48c3c9a6f62c273c2a28cd37fee","observation_id":"a7d777fe-6c77-4b36-a043-9d8d2a677433","resolution":{"observed_at":"2026-08-11T01:05:25.533156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.517881Z","title":null,"venue":null,"work_id":"e9acd520-842e-45aa-8813-ce2ca82c08a8","year":2020},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.239210Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:613b89f53352bbaf9caccd6cbcc8d64c660533f397be271cc95a86b264deed72","observation_id":"f027b8ca-f3b3-4877-b97a-8845b40ea424","resolution":{"observed_at":"2026-08-11T01:05:25.521453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.506107Z","title":null,"venue":null,"work_id":"b1302160-f8b4-49db-9670-52bd32e74b53","year":2021},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.243192Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:9a994a42f47947e0516b9e5b35ee9aa1b394905f402fdcb958dec96be68b30ed","observation_id":"2f6181f0-02e5-4101-8cd8-867c245777ec","resolution":{"observed_at":"2026-08-11T01:05:25.510061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.493935Z","title":null,"venue":null,"work_id":"a02ef143-9a9b-41c2-8d9b-ac5a7db72e2f","year":2023},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.247335Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:4b2e05dc2c72744a17139d2dd3c606d2af3bf78f1d30472f1151f40d2db864a9","observation_id":"b807b04e-11bf-4927-858e-e0b5cf0a3578","resolution":{"observed_at":"2026-08-11T01:05:25.498221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-20T11:09:28.876170Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-11T01:05:25.252868Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.252868Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:d76b9ae8f0b2332eb5db52cbc77d9e126cb8815f8d564c515492977879a2586a","observation_id":"2afc2728-2a4c-4a8e-876b-a317348b0c4c","resolution":{"observed_at":"2026-08-11T01:05:25.252868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.258164Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.258164Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:8b2268bf47e16df6b249f69ea2cbfac3ba10d669032c8ea892295df6e3212668","observation_id":"1e1cb9c4-9e91-495a-a57c-2653ba32e847","resolution":{"observed_at":"2026-08-11T01:05:25.258164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-14T18:05:47.659963Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-08-11T01:05:25.262962Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.262962Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:a9d605e4aa43915f35aa0556ff661faf365e056fc13dee215b62215b62376c79","observation_id":"a71b6ce3-3ba2-426c-9e6c-6ce9857ea1ce","resolution":{"observed_at":"2026-08-11T01:05:25.262962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.475596Z","title":"H.; et al","venue":null,"work_id":"48c41214-15de-4af5-9ff5-b5237c3cbf7b","year":2023},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.267762Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:de85437b9695e18d34c3b2f829216b0ad79e55f74ce8f63076a6093ac140e3e9","observation_id":"02375a06-f2c6-465b-92d2-53753f74c328","resolution":{"observed_at":"2026-08-11T01:05:25.479801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.463141Z","title":null,"venue":null,"work_id":"2d580d30-542b-4565-a8d4-7d40bfb4b7ad","year":2017},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.271597Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:290fb3d872d93c8e7f14e4c1a8bd0915dfc4fb874c097851ed5f57c9049a0443","observation_id":"4eef70f0-60ca-44fd-9cdb-21f31dfe981a","resolution":{"observed_at":"2026-08-11T01:05:25.467008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-18T17:11:38.711653Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-11T01:05:25.276351Z","title":"Y.; Xu, N.; Zhang, S.; Poon, H.; and Chen, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.276351Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:bddb19a5b3fcf1950d684e67643d5851dcce59d083c6f931cac1e229ea0e7929","observation_id":"5604b06b-f4cf-4267-988d-7194c7fc18d0","resolution":{"observed_at":"2026-08-11T01:05:25.276351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.450771Z","title":null,"venue":null,"work_id":"f603717c-951f-405a-a02d-4f0d0b1bcd41","year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.280859Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:c70c5f1809eb46c448bdc1a2a3d1e9622fa3da0d0aa79c01c6cd23fdc1d4697d","observation_id":"202d0df1-0e54-489b-ba30-f7d6f52eb77e","resolution":{"observed_at":"2026-08-11T01:05:25.455249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-21T06:38:59.055217Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-11T01:05:25.284939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.284939Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:c0d1abb49898618be80d70f45c40435416e7604d1c49f196955a5f0f597e8883","observation_id":"cae51ae3-9b63-473a-9422-905e2dbbdc3d","resolution":{"observed_at":"2026-08-11T01:05:25.284939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10501","last_updated":"2024-08-21T11:36:47Z","snapshot_observed_at":"2026-08-16T14:00:32.744525Z","submitted_at":"2024-04-16T12:19:54Z","title":"Self-Supervised Visual Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10501","snapshot_observed_at":"2026-08-11T01:05:25.289337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.289337Z"},"links":{"cited_paper":"/paper/2404.10501","citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:e89d3998a747a87cba3522af592da3eb461407748498bc16ead2997f189c17e5","observation_id":"967b3aa1-0641-4b5c-a23c-5ae2fb657536","resolution":{"observed_at":"2026-08-11T01:05:25.289337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.293355Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.293355Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:68af2b6c3f1cf3991f4d3f20a466f48fc6e43e232df7cc1cd9d07663e9f2718d","observation_id":"ff7488c2-cc51-4873-aa61-751357a2c8bb","resolution":{"observed_at":"2026-08-11T01:05:25.293355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:05:25.297558Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T01:05:25.297558Z"},"links":{"citing_paper":"/paper/2412.19005"},"observation_digest":"sha256:b4d0d478697fd4a1e4e6df9e1b80f8fbf17565894a95455e24ef10368f23fef7","observation_id":"88ba8d26-9434-45af-8fcc-f42d3584a07e","resolution":{"observed_at":"2026-08-11T01:05:25.297558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19005","last_updated":"2024-12-26T00:26:45Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T23:11:21.334745Z","submitted_at":"2024-12-26T00:26:45Z","title":"Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2412.19005."}