{"as_of":"2026-08-18T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c67949aae88bfe62c3162cac888cd04e9ddd768f17ac1af847d3023527414f9c","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:13:16.605795Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.11618/citation-record","integrity":"/paper/1908.11618/integrity","json":"/paper/1908.11618/citation-record.json","paper":"/paper/1908.11618"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.334354Z","title":"Improved speaker independent lipreading using speaker adaptive training and deep neural networks","venue":null,"work_id":"753f5557-fe6c-4dfb-b4df-ac4045a55755","year":2016},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.330178Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:7f23495e550a0e5c4f4eb8fefce392b5cb031325afca9bb1f655d39e8f179ff8","observation_id":"e1fb123a-b994-4db9-a1cf-6d279826eff5","resolution":{"observed_at":"2026-08-14T10:13:17.342047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01599","last_updated":"2016-12-16T16:09:34Z","snapshot_observed_at":"2026-08-14T21:31:52.086416Z","submitted_at":"2016-11-05T04:05:18Z","title":"LipNet: End-to-End Sentence-level Lipreading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01599","snapshot_observed_at":"2026-08-14T10:13:16.335704Z","title":"Lip- net: End-to-end sentence-level lipreading","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.335704Z"},"links":{"cited_paper":"/paper/1611.01599","citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:8cd558dc371cb54de5df0b77d811d895e8dbb2eaa8fd688844e049fc2351c6ee","observation_id":"d10a5ed7-5bf3-4b64-be67-3f884ee3769a","resolution":{"observed_at":"2026-08-14T10:13:16.335704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.308619Z","title":"The natural statistics of audiovisual speech","venue":null,"work_id":"84a7c60a-3d5f-4096-b5aa-5bdee9ab0541","year":2009},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.344748Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:af887bc0a3cf99b0e3cb7310fe08fb401bb6a1e5a3827a24eb18052d4f94be08","observation_id":"2c8c86ec-206a-47fb-bc35-314d54824ab0","resolution":{"observed_at":"2026-08-14T10:13:17.322733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.289886Z","title":"Lipreading from color video","venue":null,"work_id":"4e00732d-4898-4a65-803f-302913164566","year":1997},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.350281Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:301278d65ea80bcf400707a4d23141fed735b661d2c878a3bf149c4e3e0c2340","observation_id":"de53de35-197b-4c63-8a7d-5751cf81757a","resolution":{"observed_at":"2026-08-14T10:13:17.296347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.269201Z","title":"Lip reading in the wild","venue":null,"work_id":"0dac890e-7c08-49d1-8498-ac4972056812","year":2016},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.356484Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:27294fb2940cdd373f0658242ae57b17056c6de1b3d78b2f7f4224ee48a959cd","observation_id":"eb7f2d26-0ca4-4fd3-8b24-4795f649d1c4","resolution":{"observed_at":"2026-08-14T10:13:17.274433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.252365Z","title":"Learning to lip read words by watching videos","venue":null,"work_id":"7e040bd1-7661-479a-9836-9e1aa79dafd1","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.364587Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:0cbc1e24394c3cdcfaa34f65e65494ea4c70f0e486c21eefae53c9261dac11dc","observation_id":"9000b87c-7555-479f-968c-6449428a50ca","resolution":{"observed_at":"2026-08-14T10:13:17.257495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.229901Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"77ad836a-5ba8-4d69-994b-15a633acb165","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.379468Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:b67f05b82bfbf28bc838539de13bbe4be78cdaed7c2d8789502074377582a88c","observation_id":"0c9c0936-ef40-4e83-bb45-22f82e3bfaa0","resolution":{"observed_at":"2026-08-14T10:13:17.235879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.205878Z","title":"Toward movement-invariant automatic lip-reading and speech recognition","venue":null,"work_id":"3dca4934-c9fe-4f08-8a5e-3cc94cfd2a0e","year":1995},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.389161Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:f38585ef14da486dde056af00dcca858f49c55b8440302ffb3f7e2ecefa7f3df","observation_id":"2ddffe38-9e90-4bc1-a26d-c7ac4cb618c1","resolution":{"observed_at":"2026-08-14T10:13:17.214393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.189930Z","title":"Long short-term memory","venue":null,"work_id":"37fc2aea-180e-4c9d-b2b0-204fd4cd351e","year":1997},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.400542Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:11fae8b625fa2c59e30e32fba0f9d9189050a9f3dcdb2c8f11642b502f62ebad","observation_id":"8b9c4c94-bd7f-4e58-b953-fa399ad559db","resolution":{"observed_at":"2026-08-14T10:13:17.195559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.166663Z","title":"Videolstm convolves, attends and ﬂows for action recognition","venue":null,"work_id":"2b8898e4-6b0e-4f1b-8149-4243bb2fbafd","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.410492Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:bc4707fbedadcb2db13ab19bca6d8b5438a01779f04eebcc26b93a5c62d5a076","observation_id":"9b155bce-615d-4481-b1ab-5d229fe6e8d1","resolution":{"observed_at":"2026-08-14T10:13:17.175556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.141179Z","title":"Audio-visual speech recognition using deep learning","venue":null,"work_id":"b0297bbf-cd7b-4e1c-a6f1-1fda82773202","year":2015},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.428574Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:df9627fb0495949132031965c323db15eeeb74503a3be88e2e4a5ed340bc7f2a","observation_id":"d19605dc-49ba-43c6-b0b8-7fbccaffdc84","resolution":{"observed_at":"2026-08-14T10:13:17.152173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.117963Z","title":"End-to-end audiovisual speech recognition","venue":null,"work_id":"ed46fcf8-5a18-4aa5-9df7-7f117660f23d","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.442214Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:7a53ac8c7687773f3d276f051f1a6b0f97272db7b631ee27f6e0631d46262c4a","observation_id":"430d9fb0-6be7-45d2-b500-6afb1d0bcfdf","resolution":{"observed_at":"2026-08-14T10:13:17.126325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.092675Z","title":"An image transform ap- proach for hmm based automatic lipreading","venue":null,"work_id":"e6272bbd-98d6-48bf-bed2-9b879c3da66f","year":1998},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.454167Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:90b330b7806209f1fa6f38035bbc0744a5a30cfbc6b694363f87c53a0077382c","observation_id":"3cca9545-f18b-461f-950d-d45d147dd8f0","resolution":{"observed_at":"2026-08-14T10:13:17.100644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.068932Z","title":"Recent advances in the automatic recognition of audiovisual speech","venue":null,"work_id":"4f087eea-7097-49d2-9c25-0f00e8f0b89d","year":2003},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.470890Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:fbe912d5f917a9eebe1987b915706ece022fd23c5668ff25f820cfdc79928c81","observation_id":"55ce54b8-4f7a-4136-9cd7-ace573e3b85f","resolution":{"observed_at":"2026-08-14T10:13:17.076930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.037125Z","title":"Lip reading using optical ﬂow and support vector machines","venue":null,"work_id":"0aef4bad-3be0-4c56-b68e-d3582e836f40","year":2010},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.479365Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:73ef3ec6869ffc1c8c4f099291a924361eac8020ec57ad9c21ef4af887f7dcdd","observation_id":"f1760879-f233-41ba-aa87-02b2c93af2cb","resolution":{"observed_at":"2026-08-14T10:13:17.044818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:17.007564Z","title":"Convolutional lstm network: A machine learning approach for pre- cipitation nowcasting","venue":null,"work_id":"bda2a182-d887-4a05-9dbf-1dbbc525d980","year":2015},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.490705Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:98773b291002da5c037bc534ce0258d149f44a47e222e2d052bd327eedc42180","observation_id":"f94d5605-5501-4d93-882f-a11482410d74","resolution":{"observed_at":"2026-08-14T10:13:17.016990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.505615Z","title":"Two-stream convolutional networks for ac- tion recognition in videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.505615Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:e432944dce0a71789c999aeac8e395e48a482d524d3e85225c2d4c9bf222f6fb","observation_id":"49763019-c3b6-4b02-892b-9d8d8c2749d1","resolution":{"observed_at":"2026-08-14T10:13:16.505615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04105","last_updated":"2017-09-08T10:08:34Z","snapshot_observed_at":"2026-08-18T10:22:24.078790Z","submitted_at":"2017-03-12T12:06:04Z","title":"Combining Residual Networks with LSTMs for Lipreading","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04105","snapshot_observed_at":"2026-08-14T10:13:16.519177Z","title":"Combining residual networks with lstms for lipreading","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.519177Z"},"links":{"cited_paper":"/paper/1703.04105","citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:486bd4c9ec246cc6900c67b2fb5663dc68726dd971b4e86893897ca8d04e4871","observation_id":"693dd69f-c76b-4e51-832c-a69fa585f26f","resolution":{"observed_at":"2026-08-14T10:13:16.519177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.953291Z","title":"Convolutional long short-term memory networks for recognizing ﬁrst person interactions","venue":null,"work_id":"9e7a9469-e3f6-4026-98c1-7f224ade3199","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.526459Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:aff231e12042fa3fb3a61ff6d77739f4e635fb2e7d36e5321c2099aa4d11fcb8","observation_id":"bd126973-8fec-48e2-b45e-918140376801","resolution":{"observed_at":"2026-08-14T10:13:16.961031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.924289Z","title":"Improving lip-reading performance for robust audiovisual speech recognition using dnns","venue":null,"work_id":"7680aa63-ea54-4b8e-9f9c-8a3828293931","year":2015},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.536979Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:3c0bd58be4bb25434508877b3fb4da7c89934950fca705eb2b194c0789d35cd9","observation_id":"994ea864-7e38-4e17-9fcb-6afa9de28a89","resolution":{"observed_at":"2026-08-14T10:13:16.937044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.898771Z","title":"Hu- man action recognition by learning spatio-temporal features with deep neural networks","venue":null,"work_id":"c56869d0-bfa0-490b-ab29-5acb06595ddf","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.542441Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:8a64d53ca5e420f165e7891506c5b6849da8c744ab1fc9fb5888484471be7f6f","observation_id":"604defd1-f3de-4f81-a1c6-cf891aee9a19","resolution":{"observed_at":"2026-08-14T10:13:16.905106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.870414Z","title":"Pre- drnn: Recurrent neural networks for predictive learning using spatiotemporal lstms","venue":null,"work_id":"cc98e80e-ea20-4c98-a997-735786ddb1d2","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.552535Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:31081bd8f84aa38924e349479dca47b5a0025153c87fa3949b34e156bedde79e","observation_id":"20992fce-8a4c-495f-bc42-f9a5cf4453e1","resolution":{"observed_at":"2026-08-14T10:13:16.876930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.851530Z","title":"Lrw-1000: A naturally-distributed large-scale benchmark for lip reading in the wild","venue":null,"work_id":"80bccbff-cd72-47a3-a8ee-a0194e64d402","year":2019},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.564273Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:ad0c9499f077f7ab9055ee8ec058114300a19656fa106a83eb211b02546c0fda","observation_id":"44855688-7a4f-4c2b-9651-06b751e2e4f1","resolution":{"observed_at":"2026-08-14T10:13:16.856778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.832720Z","title":"Learning spatiotemporal features using 3dcnn and convolutional lstm for gesture recognition","venue":null,"work_id":"baa4030f-5b27-4b31-b455-09e745b406e0","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.576389Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:fb347a2154a7d5f81fa224bbdf740316fdf9e8b6358a2416b148876810c8cc90","observation_id":"a62bb90f-2ddb-45aa-a245-6e0022ff9150","resolution":{"observed_at":"2026-08-14T10:13:16.839284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.805352Z","title":"Adding attentiveness to the neurons in recurrent neural networks","venue":null,"work_id":"0111c0fd-4c0e-4a3f-8155-b8b0cd114425","year":2018},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.584649Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:ace33ab14cf1c7ea3e194c30ea43c048c5635b3c6b44bd23025c100c72c60755","observation_id":"c3836fe0-acb8-4f34-9fd1-e27c4d14bfdd","resolution":{"observed_at":"2026-08-14T10:13:16.812779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.774031Z","title":"Lipreading with local spatiotem- poral descriptors","venue":null,"work_id":"17208440-12b1-4030-9dc1-73544f2e0f5d","year":2009},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.593574Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:83fbb6c21295e6b6f3557ba18aa0d93b8902774912176eb6d9266c759982456e","observation_id":"7f9febc2-6774-4a98-8fde-8869dee38b18","resolution":{"observed_at":"2026-08-14T10:13:16.781772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:13:16.742155Z","title":"Multimodal gesture recog- nition using 3-d convolution and convolutional lstm.IEEE Access, 5:4517–4524, 2017","venue":null,"work_id":"b80bb266-0c26-4515-943d-a1f96cc37e87","year":2017},"citing_paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T10:13:16.605795Z"},"links":{"citing_paper":"/paper/1908.11618"},"observation_digest":"sha256:14e52d539316ce95bcbb19326d9f57f2ccfb707ef20725c5b76592005a8e1606","observation_id":"3b50c32d-886b-4b2b-bd68-df5501fe7d0f","resolution":{"observed_at":"2026-08-14T10:13:16.753235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.11618","last_updated":"2019-09-02T02:22:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T07:49:19.535699Z","submitted_at":"2019-08-30T09:50:20Z","title":"Multi-Grained Spatio-temporal Modeling for Lip-reading"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:1908.11618."}