{"as_of":"2026-08-15T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5db928ad96def4fcb87b90096fdb065ed85a534c876c623db4ca4283076a7d25","coverage":[{"denominator":233,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:01:09.886963Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.07656/citation-record","integrity":"/paper/1908.07656/integrity","json":"/paper/1908.07656/citation-record.json","paper":"/paper/1908.07656"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2010.20927","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:14.116763Z","title":"Driver inattention monitoring system for intelligent vehicles: A review,","venue":null,"work_id":"15283b16-d68c-472b-8691-2a3cf78dd8ad","year":2011},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.620281Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:9f3c716f79272eb4d75e1ec011a0b430d054ff49a606b3c6c9b6d36a02a4fd7f","observation_id":"9802fe7e-e35a-4ddb-82d6-aeb0ff5f0e71","resolution":{"observed_at":"2026-08-14T13:01:14.134204Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.627452Z","title":"Video-based lane estimation and tracking for driver assistance: Survey, system, and evaluation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.627452Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:a0a4e15474e1bf1fa675902b99236342ba90b5e9db7c7295472be21bd6c12e45","observation_id":"e13739e9-5465-4847-9554-67e12ec63dff","resolution":{"observed_at":"2026-08-14T13:01:08.627452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2011.21193","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.998101Z","title":"A Review of Computer Vision Techniques for the Analysis of Urban Traffic,","venue":null,"work_id":"86878f36-4ceb-49a2-b160-08bc91512254","year":2011},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.634421Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:b8c717170fee1003fddc414a69ca493754b8349582b497b42f9f7ed086414a9b","observation_id":"335e3c92-4dee-4a41-8f12-a7a801dd97e8","resolution":{"observed_at":"2026-08-14T13:01:14.011348Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.25710","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.897825Z","title":"Looking at Humans in the Age of Self-Driving and Highly Automated Vehicles,","venue":null,"work_id":"846d33f0-f90e-4e4e-8a46-98135c0a8f35","year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.643411Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:9054110b425ecfefcf28ffd13ffbb5f70e90bc6f872b17e54a5b2a61a7cc703f","observation_id":"a7500238-0b10-4c1e-b714-b3ed6ad91f0d","resolution":{"observed_at":"2026-08-14T13:01:13.909385Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-14T13:01:08.651114Z","title":"End to End Learning for Self-Driving Cars,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.651114Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:dd69b100448ebf7650061addf78a0cba4e46a1e30878875486a3df53404b31fc","observation_id":"1109e25c-6cf2-4150-9514-a54386c19326","resolution":{"observed_at":"2026-08-14T13:01:08.651114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.671153Z","title":"Lane-Change Detection Based on Vehicle-Trajectory Prediction,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.671153Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:8d2aa03191bcb04f672f7a590c4d6a54eb36f10ce02bbcbeb924b01f9206d2ae","observation_id":"c986f42e-207e-4716-8a4c-e7c594cc024f","resolution":{"observed_at":"2026-08-14T13:01:08.671153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.23777","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.706163Z","title":"Single-pedestrian detection aided by two-pedestrian detection,","venue":null,"work_id":"07f69f85-1cbe-4d22-94af-5c26302acd63","year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.686815Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:0aa3cd07c7a03867710f8b58591b00b2e9e0ee2af5a7bd217329b4b5bf93b3bc","observation_id":"e84d86f5-c469-4383-9569-e0a8e19a5708","resolution":{"observed_at":"2026-08-14T13:01:13.714652Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.23111","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.634613Z","title":"Deep Architecture for Traffic Flow Prediction: Deep Belief Networks With Multitask Learning,","venue":null,"work_id":"4fc7fd22-2eaa-4a4b-af42-704d4be1171d","year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.693484Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:c22d7213a3dbac8ae899c5381e3036f4b5f026867bdc1524d52ec0f24c50acf8","observation_id":"e5db191b-8100-49e6-96d8-420c1251b616","resolution":{"observed_at":"2026-08-14T13:01:13.643286Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.700987Z","title":"Capturing Car-Following Behaviors by Deep Learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.700987Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:c9bf9f3daf8c1a9dd9ca26af7a196c4802eb70f7a2665a2b73f6b8c71fd48ae0","observation_id":"f72cae4d-5e06-44db-83d0-33cb29e58bba","resolution":{"observed_at":"2026-08-14T13:01:08.700987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.709077Z","title":"Deep Learning for Reliable Mobile Edge Analytics in Intelligent Transportation Systems: An Overview,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.709077Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:27260ccf8f9fdaf18642dc594a923983d05cb174e722428c29f935821d102168","observation_id":"4249d6c4-cb8f-46c4-825b-b478b0e5ddf0","resolution":{"observed_at":"2026-08-14T13:01:08.709077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.716072Z","title":"Brain tumor segmentation with Deep Neural Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.716072Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:73ad03ebfce93adc540858fb062b991a38e31986b457cd568380079694723339","observation_id":"59c61f42-26b3-4574-b158-a6043c0eadd5","resolution":{"observed_at":"2026-08-14T13:01:08.716072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.723022Z","title":"Multimodal Neuroimaging Feature Learning for Multiclass Diagnosis of Alzheimer's Disease,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.723022Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:f56426c6870063f5490c735401b1159a6c5656120edb1e57a12c4bcd23007d99","observation_id":"f4c45c3b-762b-4d31-bdfc-500325342473","resolution":{"observed_at":"2026-08-14T13:01:08.723022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18632/aging.100968","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:11.463141Z","title":"Deep biomarkers of human aging: Application of deep neural networks to biomarker development,","venue":null,"work_id":"bb038137-4ccf-4f8f-819d-c6ec12997678","year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.730321Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:25898908be2e641c83f857e51cd3389cb05134af3c86d98d60aa6cbf7f3715e6","observation_id":"827f7863-dde4-47e3-b0c6-118d0ab69d96","resolution":{"observed_at":"2026-08-14T13:01:11.472398Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.737011Z","title":"An end-to-end computer vision pipeline for automated cardiac function assessment by echocardiography,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.737011Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:7bbc38a8b17ac2dffbd06db5bcddca5c687531fb7c243c2af4a888993d39a1b2","observation_id":"463c5b2d-66c1-44db-bf94-ef2a3b7f552b","resolution":{"observed_at":"2026-08-14T13:01:08.737011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.743378Z","title":"A review of smart homes—Past, present, and future,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.743378Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:74934d150bc03c6cdd46d3a2b7f585cbf9885fa1c7e0c05a776c1b4931f21335","observation_id":"565e380b-daee-4c11-9108-c4f421219e14","resolution":{"observed_at":"2026-08-14T13:01:08.743378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.751214Z","title":"Personal virtual assistant,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.751214Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2162335bd11f8916202f2bf41de1996da0834b1666b7e44d6c7327b76ba0d523","observation_id":"4951d811-fc49-4712-a6f0-3092ce16a6a5","resolution":{"observed_at":"2026-08-14T13:01:08.751214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.758262Z","title":"Application of data mining techniques in customer relationship management: A literature review and classification,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.758262Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:06b8ebae800dfa0479ce817f970ac00868773faf867a13d6087b4e7cfea5c8e9","observation_id":"8effee34-4ad6-4635-be05-790a4e0f6940","resolution":{"observed_at":"2026-08-14T13:01:08.758262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.768393Z","title":"A review on application of data mining techniques to combat natural disasters,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.768393Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:bf1cf2ee70354aaf63021e8674e8ac53aaea02fb46ba6964cc4f6754230acdb5","observation_id":"c54934fb-e7d0-4e06-968c-06bed4a60cbd","resolution":{"observed_at":"2026-08-14T13:01:08.768393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.780129Z","title":"Vision based hand gesture recognition for human computer interaction: a survey,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.780129Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:b3f4209e093757d833bfacdc2c11269fb1e839f0cdbdf7ec1c43553c2fa4a7da","observation_id":"28be8827-fa62-4b08-a8ef-00f990f63f45","resolution":{"observed_at":"2026-08-14T13:01:08.780129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.789423Z","title":"Deeppose: Human pose estimation via deep neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.789423Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:998474af6b04cf4ce67b2909d897cf8aa1d26f87c7218f1f09032b718ef0e912","observation_id":"ab10b8f9-204f-4adc-9875-c26cc8fede87","resolution":{"observed_at":"2026-08-14T13:01:08.789423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.800284Z","title":"Joint training of a convolutional network and a graphical model for human pose estimation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.800284Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:746c327fddd41436980e80d9519ff841634cc62c080538ec3a9da9dac06f5c24","observation_id":"301a4bdd-fb8f-4fd4-837f-1414bf08ffcd","resolution":{"observed_at":"2026-08-14T13:01:08.800284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.807316Z","title":"Safety and security in smart cities using artificial intelligence—A review,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.807316Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:27d47ce3451d3b5184da94304df4a24aa7dc31e31a45fcea5b84449c7c5324dd","observation_id":"88c400a1-2f3c-49ea-a6ca-4598da99380c","resolution":{"observed_at":"2026-08-14T13:01:08.807316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/t-affc.2012.38","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:11.434998Z","title":"Detecting depression severity from vocal prosody,","venue":null,"work_id":"2537b9c4-8029-4e66-893f-6838baff5cbb","year":2013},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.818921Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:dbd34865915a9e4b8da8e7825ee2468f21d516e7701590ec8976ea26109fd1c8","observation_id":"3164275e-c3a0-4939-94c2-e7122f84cec1","resolution":{"observed_at":"2026-08-14T13:01:11.444641Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1044/1092-4388(2001/087","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:11.406529Z","title":"Speech and prosody characteristics of adolescents and adults with high-functioning autism and Asperger syndrome,","venue":null,"work_id":"86e75777-56fb-486d-a336-2ddd022170ac","year":2001},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.833772Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:6e7092a525ca62909ba017cdb20ec35211a958317661f5ec0eec08fbc3ff609d","observation_id":"b98bc186-c8ee-4ce7-9eea-fa73127929ba","resolution":{"observed_at":"2026-08-14T13:01:11.413211Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.851105Z","title":"Survey on speech emotion recognition: Features, classification schemes, and databases,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.851105Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:1f5676be7037a0c9ef29d229d0dc653e00b70acec77c4d42ef55f9aa58ee76a4","observation_id":"87f4e4ef-77bd-4df2-be33-b8d2a73d3761","resolution":{"observed_at":"2026-08-14T13:01:08.851105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2017.02.013","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:11.352832Z","title":"Evaluating deep learning architectures for Speech Emotion Recognition,","venue":null,"work_id":"1cc3fb9e-bfa9-4c32-a01b-cc44804d923a","year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.860968Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2dc0436dcc66fef554e516ddfd684d99d76dfdfda995a375a81a135700a6f0d5","observation_id":"4db270f3-3de1-4607-95ce-7697892ff09c","resolution":{"observed_at":"2026-08-14T13:01:11.360773Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.66383","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.370402Z","title":"Deep learning for robust feature generation in audiovisual emotion recognition,","venue":null,"work_id":"805d9ffb-7a00-4f94-832b-0d980196ee3d","year":2013},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.869900Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:1bd95cf26d1f9a9b7e39f10c4ff1bdbb89fd284e15e2bad198ed36a8abf602e3","observation_id":"1a7efe52-5a14-4af7-bffd-ebc9614ea687","resolution":{"observed_at":"2026-08-14T13:01:13.390037Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.879658Z","title":"A fast learning algorithm for deep belief nets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.879658Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:e9013e6aa7608080e0d158192928c552f8aec5b2ebaa3c961e35855d7e676469","observation_id":"647b53f5-ebaf-4431-8d07-eceb9ab49518","resolution":{"observed_at":"2026-08-14T13:01:08.879658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.888253Z","title":"Learning multiple layers of representation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.888253Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:147adaaee3df5d8bfbcf4bb95cb4ec16f135548f1411fe8bf2381a85e48b1e8a","observation_id":"3f555ffb-2710-4c3f-bad5-c376c509b950","resolution":{"observed_at":"2026-08-14T13:01:08.888253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.896054Z","title":"Comparison of deep neural networks to spatio-temporal cortical dynamics of human visual object recognition reveals hierarchical correspondence,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.896054Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:95db7a05c8f1efbe413aa4f1a95a69f27bda5d4f7f788357fab64d23ffe395df","observation_id":"9717493d-9b56-472a-b111-66c52fa7c5cb","resolution":{"observed_at":"2026-08-14T13:01:08.896054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.904616Z","title":"Deep hierarchies in the primate visual cortex: What can we learn for computer vision?,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.904616Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:5aa25163f0aeaaac8e851e0c83d2443bb7917c54398ea1938d7afbacde38514d","observation_id":"406f3d56-6e94-4b20-977a-1da977106617","resolution":{"observed_at":"2026-08-14T13:01:08.904616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.913592Z","title":"Deep learning in neural networks: An overview,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.913592Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:f397bcd00befd085cd80dbf825e0f8f171baad1fc9315d5f8adc242cdfc85df4","observation_id":"9d6baccd-072a-492f-9179-ea913010af37","resolution":{"observed_at":"2026-08-14T13:01:08.913592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.923180Z","title":"Imagenet classification with deep convolutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.923180Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:f9fb77ec1b24a7d26dc401acc0557abe91e46c4e3524ab0093235a72057ceccc","observation_id":"7131c250-b790-4778-a356-1c547b523a7a","resolution":{"observed_at":"2026-08-14T13:01:08.923180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.933678Z","title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.933678Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:60822c779f229d45751f4667871997cd9d309da04afb346d9da6b50b2e4cb3e8","observation_id":"f4aac34f-6efa-4123-8813-dee70fbf2e7f","resolution":{"observed_at":"2026-08-14T13:01:08.933678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.943421Z","title":"Generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.943421Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:7370dfcd339c42ce7d43448bf3d1bca9d945db3f7b175e6db20d1665c30a17aa","observation_id":"5d3db918-db27-43b8-8990-d7f7cb14354b","resolution":{"observed_at":"2026-08-14T13:01:08.943421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-14T13:01:08.958184Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.958184Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:f1a8ff10cb75387cb49cf3270fff319377ddefaf3f3f0cf20c8ea0d4ffe29eac","observation_id":"bebd5e0f-1e50-4705-a1b7-d94c8ba72204","resolution":{"observed_at":"2026-08-14T13:01:08.958184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.08803","last_updated":"2017-02-27T23:21:10Z","snapshot_observed_at":"2026-08-10T10:35:06.780085Z","submitted_at":"2016-05-27T21:24:32Z","title":"Density estimation using Real NVP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.08803","snapshot_observed_at":"2026-08-14T13:01:08.978165Z","title":"Density estimation using real nvp,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.978165Z"},"links":{"cited_paper":"/paper/1605.08803","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:175cd7072547772a815f2293f421c95e0d76c9b5c3c28f2dc00890be85d9bc63","observation_id":"a6ec1a85-2ede-4752-9260-960933c3b5e5","resolution":{"observed_at":"2026-08-14T13:01:08.978165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.00019","last_updated":"2015-10-17T05:06:11Z","snapshot_observed_at":"2026-08-14T22:46:30.846767Z","submitted_at":"2015-05-29T20:16:51Z","title":"A Critical Review of Recurrent Neural Networks for Sequence Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.00019","snapshot_observed_at":"2026-08-14T13:01:08.990791Z","title":"A critical review of recurrent neural networks for sequence learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.990791Z"},"links":{"cited_paper":"/paper/1506.00019","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:c93f7068fd5fe670360e96100a07c77e1c31edffb0fb41fb5ce470e3bc12f3b3","observation_id":"98d53d6c-b491-44ca-a39c-c4b46bb7734c","resolution":{"observed_at":"2026-08-14T13:01:08.990791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:08.998454Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:08.998454Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:603d6694586ffd9a17c043b3bfa5bc52b91f062c18b2f7317ca5e9a4e0648266","observation_id":"0b63cf57-7806-47df-b37b-241922040c13","resolution":{"observed_at":"2026-08-14T13:01:08.998454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.72804","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.197260Z","title":"Novel hierarchical Cellular Simultaneous Recurrent neural Network for object detection,","venue":null,"work_id":"1264642a-ff51-4ae8-9a09-09f54882b2f4","year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.014506Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:98b9e263571667ec5b31f605637c807fa80bf72ba89521f2fe3dbbe7db1cf042","observation_id":"6854baa9-262b-421e-948c-93aad74e22fe","resolution":{"observed_at":"2026-08-14T13:01:13.210517Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.025108Z","title":"Restricted Boltzmann machines for collaborative filtering,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.025108Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:ee3a6d16d3302504b57c288cddd1875545d2db08a4ed7236bd16b97fe4b5845e","observation_id":"9703dc47-7852-4c32-9190-4ee9cb2fcc09","resolution":{"observed_at":"2026-08-14T13:01:09.025108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.033545Z","title":"Deep boltzmann machines,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.033545Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:ad60913f6964ab523ba4655fdb32f4f961ca33030175f7adc75492cf62ebd928","observation_id":"10b34afc-3bfe-440b-9127-a587cc236667","resolution":{"observed_at":"2026-08-14T13:01:09.033545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.046205Z","title":"Extracting deep bottleneck features using stacked auto-encoders,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.046205Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:60de0556675f012ec4c7a8b586e6322e1bd45297c9cb4fd75bc7d3e3501cecd1","observation_id":"18ce4847-0689-401e-99f6-70aca7fdcbe8","resolution":{"observed_at":"2026-08-14T13:01:09.046205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.057361Z","title":"Extracting and composing robust features with denoising autoencoders,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.057361Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:ce7449ec6cf43a80d7e51bd580a27ac255f484a9ce2cde5fa06df83d8e646316","observation_id":"f42abfe2-e355-49a7-b038-c7ccd78440ef","resolution":{"observed_at":"2026-08-14T13:01:09.057361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.068813Z","title":"Learning hierarchical representations for face verification with convolutional deep belief networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.068813Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:16ac9dae361d74e27107d6c4d9a7ab4168f616fb4452c8828f16391669be11a9","observation_id":"81edcbb3-35e2-4335-a3b8-489f3ce5d2b5","resolution":{"observed_at":"2026-08-14T13:01:09.068813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.084351Z","title":"Investigation of deep boltzmann machines for phone recognition,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.084351Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:c54839e2ecc2cb0320255800c28599e1fb8dc79c2d6afc46e4cc0f4a66edf729","observation_id":"bb3d104d-5db1-45da-9bbf-a34c0cf08ab3","resolution":{"observed_at":"2026-08-14T13:01:09.084351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.097237Z","title":"Random Deep Belief Networks for Recognizing Emotions from Speech Signals,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.097237Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2396baad9fb01efd1bc290c6590ff8629136a344d75446ad4602af4fb36025a4","observation_id":"0c230678-7e24-4780-ac80-4fa256350fbc","resolution":{"observed_at":"2026-08-14T13:01:09.097237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.109262Z","title":"A research of speech emotion recognition based on deep belief network and SVM,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.109262Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:1d7217cd308af2aebedff2e702d79c8ecb96d202a527394394a06274881a5614","observation_id":"98c97ae5-df14-445a-9e73-37026f2bda07","resolution":{"observed_at":"2026-08-14T13:01:09.109262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.119448Z","title":"Convolutional deep belief networks for scalable unsupervised learning of hierarchical representations,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.119448Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:6570451ad4e843b6484e1015fce0498b451bd54ef630925bba1b2a87b6df9853","observation_id":"b968b7c6-7da1-41d7-8119-a2f814ef4521","resolution":{"observed_at":"2026-08-14T13:01:09.119448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.127194Z","title":"Attribute2image: Conditional image generation from visual attributes,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.127194Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:bcf16eadacab0d3b2cc45e57482c8c0a857d07f56a7543e05c80c8ebec3a4ded","observation_id":"9bb0f783-0f21-4b1b-88c6-6590654d45d8","resolution":{"observed_at":"2026-08-14T13:01:09.127194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.135399Z","title":"An uncertain future: Forecasting from static images using variational autoencoders,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.135399Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:af468e64d377c0481a86717f9f675229d4ead057711dfe3716853eaf362207f7","observation_id":"4c18870d-f363-4e90-8b05-73f1ab7f9ea8","resolution":{"observed_at":"2026-08-14T13:01:09.135399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02390","last_updated":"2017-02-08T12:11:41Z","snapshot_observed_at":"2026-08-14T21:17:26.564413Z","submitted_at":"2017-02-08T12:11:41Z","title":"A Hybrid Convolutional Variational Autoencoder for Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02390","snapshot_observed_at":"2026-08-14T13:01:09.144521Z","title":"A hybrid convolutional variational autoencoder for text generation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.144521Z"},"links":{"cited_paper":"/paper/1702.02390","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:337ef5206f212bc209115d3d4ba846d20c8efb9f6d59db1a25e1bcacf6172058","observation_id":"56ae4670-c184-4684-9ac8-16e755a53e74","resolution":{"observed_at":"2026-08-14T13:01:09.144521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02135","last_updated":"2019-02-11T09:41:22Z","snapshot_observed_at":"2026-08-14T19:28:42.741722Z","submitted_at":"2018-04-06T05:27:14Z","title":"Expressive Speech Synthesis via Modeling Expressions with Variational Autoencoder","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02135","snapshot_observed_at":"2026-08-14T13:01:09.154281Z","title":"Expressive speech synthesis via modeling expressions with variational autoencoder,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.154281Z"},"links":{"cited_paper":"/paper/1804.02135","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:0bf2d93f376ec2f64a91e273b963ebd11ed5dd5dae75acde24e9ce6512645ab7","observation_id":"e7f2dce6-2710-41a8-a792-6304c87001ce","resolution":{"observed_at":"2026-08-14T13:01:09.154281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.05396","last_updated":"2016-06-05T13:39:27Z","snapshot_observed_at":"2026-08-14T21:56:56.378295Z","submitted_at":"2016-05-17T23:09:15Z","title":"Generative Adversarial Text to Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.05396","snapshot_observed_at":"2026-08-14T13:01:09.166554Z","title":"Generative adversarial text to image synthesis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.166554Z"},"links":{"cited_paper":"/paper/1605.05396","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2e2a0ebbc35116619842489f137330d48bdc61479584723c683f24fa2b99bee9","observation_id":"dc320539-c920-44b7-a109-57aa2996b697","resolution":{"observed_at":"2026-08-14T13:01:09.166554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.181806Z","title":"Photo-realistic single image super-resolution using a generative adversarial network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.181806Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:7b6aba0104ccf8dc906f95252471a3ea357cad1d15df32e385106804a84c210f","observation_id":"29b2fc7b-0fe0-41c6-a9ad-3eaac2c2031b","resolution":{"observed_at":"2026-08-14T13:01:09.181806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-08-12T18:51:00.108451Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-14T13:01:09.200257Z","title":"Conditional generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.200257Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:ad768575e29f50bfcd3beb93faa3441c924cbe5b7e240b33a858c45f0ad7628e","observation_id":"0cab5ea6-c721-4c3b-a308-b1d450a0f7a6","resolution":{"observed_at":"2026-08-14T13:01:09.200257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.211278Z","title":"High-resolution image synthesis and semantic manipulation with conditional gans,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.211278Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:70354bf2d748333f44b8a7e3f0d98f8ed009b570751287a50d5eac17bb2dc0e8","observation_id":"bbcd27c7-99cf-4eb5-bd8a-9bf9b3dfdfe3","resolution":{"observed_at":"2026-08-14T13:01:09.211278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.09782","last_updated":"2017-04-03T20:34:36Z","snapshot_observed_at":"2026-08-14T21:54:50.737813Z","submitted_at":"2016-05-31T19:37:29Z","title":"Adversarial Feature Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.09782","snapshot_observed_at":"2026-08-14T13:01:09.221498Z","title":"Adversarial feature learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.221498Z"},"links":{"cited_paper":"/paper/1605.09782","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:e3083a40ab88200d6dc7e70f9ea0df7e5e9d288858ebbe70cf623388aa788344","observation_id":"d5718e79-4e4a-440b-99fe-401cfea24ea8","resolution":{"observed_at":"2026-08-14T13:01:09.221498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.230151Z","title":"Large scale adversarial representation learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.230151Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:ef84c731eb1f640e77bf82b93b771a8872a6450c5698ea8acf2eb1664a5ffe54","observation_id":"a5890251-a72e-4421-9450-f61869b2fe23","resolution":{"observed_at":"2026-08-14T13:01:09.230151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.04862","last_updated":"2017-01-17T20:46:21Z","snapshot_observed_at":"2026-08-14T21:20:44.980018Z","submitted_at":"2017-01-17T20:46:21Z","title":"Towards Principled Methods for Training Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.04862","snapshot_observed_at":"2026-08-14T13:01:09.236210Z","title":"Towards principled methods for training generative adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.236210Z"},"links":{"cited_paper":"/paper/1701.04862","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:8e5d4227339fd6d23bcb4a740d3a416662aacb903069bac0861fbbc76ee63a0e","observation_id":"a6eb334d-9741-4c1d-8b13-6f30ea70d02f","resolution":{"observed_at":"2026-08-14T13:01:09.236210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.00160","last_updated":"2017-04-03T21:57:48Z","snapshot_observed_at":"2026-08-14T21:23:00.248620Z","submitted_at":"2016-12-31T19:17:17Z","title":"NIPS 2016 Tutorial: Generative Adversarial Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.00160","snapshot_observed_at":"2026-08-14T13:01:09.245579Z","title":"NIPS 2016 tutorial: Generative adversarial networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.245579Z"},"links":{"cited_paper":"/paper/1701.00160","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:570e3e2c596c03efea79526fd97ab455da013c30e4e14d0322acc7ffd9879cff","observation_id":"8575c3e9-d130-4754-a87d-5633453b58d8","resolution":{"observed_at":"2026-08-14T13:01:09.245579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05957","last_updated":"2018-02-16T14:41:39Z","snapshot_observed_at":"2026-08-14T19:45:13.064940Z","submitted_at":"2018-02-16T14:41:39Z","title":"Spectral Normalization for Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05957","snapshot_observed_at":"2026-08-14T13:01:09.260474Z","title":"Spectral normalization for generative adversarial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.260474Z"},"links":{"cited_paper":"/paper/1802.05957","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:dbd6ac280dcebfdc51ed3f94499992f8990c68d586f2a02e8908d25237156d4b","observation_id":"500abceb-c6aa-4beb-afed-d73b8ac0818a","resolution":{"observed_at":"2026-08-14T13:01:09.260474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.274365Z","title":"Wasserstein generative adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.274365Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2446f3ee871a5435c34a63fff2176dbd65132fbe55c0a5de8de15fce9b0b56c9","observation_id":"a9036aad-c42e-4806-94fb-7199bcc2ae7d","resolution":{"observed_at":"2026-08-14T13:01:09.274365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.281679Z","title":"Improved training of wasserstein gans,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.281679Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:af640b98891ec8ba69c0550f4b27c0761e4545c5f098623fafd58eab6cfab25c","observation_id":"c994c929-ad98-40f9-88d4-ec70dfdc02b7","resolution":{"observed_at":"2026-08-14T13:01:09.281679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.298273Z","title":"Least squares generative adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.298273Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:aac0ab4142d88f889e0dcd0ba867dad2a2fecde785f7996f558a9970ca25ab61","observation_id":"79182df8-cf52-40f5-b9a4-bb583e18315b","resolution":{"observed_at":"2026-08-14T13:01:09.298273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00446","last_updated":"2019-06-02T16:46:42Z","snapshot_observed_at":"2026-08-14T16:22:19.220863Z","submitted_at":"2019-06-02T16:46:42Z","title":"Generating Diverse High-Fidelity Images with VQ-VAE-2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00446","snapshot_observed_at":"2026-08-14T13:01:09.307623Z","title":"Generating Diverse High-Fidelity Images with VQ-VAE-2,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.307623Z"},"links":{"cited_paper":"/paper/1906.00446","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:55a70df53c86a280f74dbfb4b7ce0e83ff7e2f3f6c692a99489502e879ae2489","observation_id":"9a79f556-6589-4605-bf88-4fc5de7da72d","resolution":{"observed_at":"2026-08-14T13:01:09.307623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.8516","last_updated":"2015-04-10T12:27:56Z","snapshot_observed_at":"2026-08-12T12:07:47.951486Z","submitted_at":"2014-10-30T19:44:20Z","title":"NICE: Non-linear Independent Components Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.8516","snapshot_observed_at":"2026-08-14T13:01:09.316439Z","title":"Nice: Non-linear independent components estimation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.316439Z"},"links":{"cited_paper":"/paper/1410.8516","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:b9dfb44113d7564d09f509d5c798d4ac0d50a4914c7e2c31407964aee487458d","observation_id":"dea243d5-3f79-4241-a8bd-419e5ae243a6","resolution":{"observed_at":"2026-08-14T13:01:09.316439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.328752Z","title":"Glow: Generative flow with invertible 1x1 convolutions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.328752Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:e3b3a885eb37dd2ff00f650c2db46f11f7ec55b40a04420d451cb9cf67f1b81d","observation_id":"b95d918b-9ed1-4163-98ab-491c81e456df","resolution":{"observed_at":"2026-08-14T13:01:09.328752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-13T01:24:25.628327Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-14T13:01:09.341064Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.341064Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:755c90f9694215512dc81b83ca0cc83724a512d5d326954365d9e921408e676d","observation_id":"06f58d48-413d-402c-8233-44f33ec99c5b","resolution":{"observed_at":"2026-08-14T13:01:09.341064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.06759","last_updated":"2016-08-19T14:10:16Z","snapshot_observed_at":"2026-08-14T22:13:10.910190Z","submitted_at":"2016-01-25T20:34:24Z","title":"Pixel Recurrent Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.06759","snapshot_observed_at":"2026-08-14T13:01:09.349575Z","title":"Pixel recurrent neural networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.349575Z"},"links":{"cited_paper":"/paper/1601.06759","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:5ae79e103c24205ac00840285b698fa1ec5237f50149571ac3c93bd92df2196f","observation_id":"9714b967-d309-4423-8166-3f10e6571419","resolution":{"observed_at":"2026-08-14T13:01:09.349575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.571741Z","title":"Waveglow: A flow-based generative network for speech synthesis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.571741Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:e95fe32062661aa5124429e7ec16349c556dae7caed16d4c244e1f535c9d2af5","observation_id":"4d1b015d-be2b-4a83-9b78-eef6fe27badd","resolution":{"observed_at":"2026-08-14T13:01:09.571741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09452","last_updated":"2017-06-09T11:34:06Z","snapshot_observed_at":"2026-08-14T21:09:40.825053Z","submitted_at":"2017-03-28T08:39:06Z","title":"SEGAN: Speech Enhancement Generative Adversarial Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09452","snapshot_observed_at":"2026-08-14T13:01:09.581998Z","title":"SEGAN: Speech enhancement generative adversarial network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.581998Z"},"links":{"cited_paper":"/paper/1703.09452","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:535093541067a4b3af78e69d9bf30ce99b6efb6520596d6169812f711ca1b194","observation_id":"6a817db0-8ef7-483e-bea8-1b9d860f057b","resolution":{"observed_at":"2026-08-14T13:01:09.581998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.593209Z","title":"Speech Enhancement for Noise-Robust Speech Synthesis Using Wasserstein GAN}},","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.593209Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:c827b83b7e58e8e9bdad358f44cb1dcd979f388731adb07a9b106f24d82b0ce3","observation_id":"8ef72377-b71c-440f-8281-9b4d90a7b94a","resolution":{"observed_at":"2026-08-14T13:01:09.593209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.01354","last_updated":"2016-05-29T00:42:15Z","snapshot_observed_at":"2026-08-14T22:07:33.048779Z","submitted_at":"2016-03-04T05:55:02Z","title":"End-to-end Sequence Labeling via Bi-directional LSTM-CNNs-CRF","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.01354","snapshot_observed_at":"2026-08-14T13:01:09.600359Z","title":"End-to-end sequence labeling via bi-directional lstm-cnns-crf,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.600359Z"},"links":{"cited_paper":"/paper/1603.01354","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:32b52b36b6754aac7550a2c28105bd6d98696e374163e368c8427ee1f7622217","observation_id":"de37cad0-b38e-4af5-af52-67815a39a275","resolution":{"observed_at":"2026-08-14T13:01:09.600359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1259","last_updated":"2014-10-07T18:08:30Z","snapshot_observed_at":"2026-08-14T23:20:50.864190Z","submitted_at":"2014-09-03T21:03:41Z","title":"On the Properties of Neural Machine Translation: Encoder-Decoder Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1259","snapshot_observed_at":"2026-08-14T13:01:09.612776Z","title":"On the properties of neural machine translation: Encoder-decoder approaches,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.612776Z"},"links":{"cited_paper":"/paper/1409.1259","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:c1ca55c07f64179f31a054f57fd8ecd8728877a094f1cd06fbc77bc66637decc","observation_id":"c620afa6-541e-4e5a-8189-cf7db4ba98e6","resolution":{"observed_at":"2026-08-14T13:01:09.612776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.623786Z","title":"LSTM: A search space odyssey,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.623786Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:0dac4105d1950f22dfbd5a34d3534e69a8d381d05b33697719c1b705425c8dfc","observation_id":"e2e1dc73-e61e-493a-8729-5d3634c58e3a","resolution":{"observed_at":"2026-08-14T13:01:09.623786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.628937Z","title":"Recurrent models of visual attention,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.628937Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:539cddd69720588553961a72cf59c1397bd0e41fe96237e29a04b3f9eee3b6a5","observation_id":"c565236c-97f2-475a-b08d-0ba358b7f87f","resolution":{"observed_at":"2026-08-14T13:01:09.628937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.639642Z","title":"Learning to combine foveal glimpses with a third-order Boltzmann machine,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.639642Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:81d658dedcc105ff2f25b0e995b70c374d505ee50af7dd04d6978560e14ec71e","observation_id":"165303af-f1c3-46cb-9eac-cadcd52d6e2b","resolution":{"observed_at":"2026-08-14T13:01:09.639642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.5488","last_updated":"2014-04-24T02:29:19Z","snapshot_observed_at":"2026-08-14T23:36:31.425339Z","submitted_at":"2014-04-24T02:29:19Z","title":"On Learning Where To Look","version":1},"cited_work":{"arxiv_id":"1405.5488","doi":null,"metadata_source":"pith","pith_arxiv_id":"1405.5488","snapshot_observed_at":"2026-08-14T13:01:12.738120Z","title":"On Learning Where To Look","venue":"cs.CV","work_id":"d615aaba-d2f3-4bf7-aa35-83aa69587bea","year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.659359Z"},"links":{"cited_paper":"/paper/1405.5488","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:500b04eb6f4465cf39691a14e08e61a2d0783ecf9787e5f8da3f68aef611704c","observation_id":"fa1bc016-cacc-4c93-a344-f45248c361b8","resolution":{"observed_at":"2026-08-14T13:01:12.744077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.673997Z","title":"Learning where to attend with deep architectures for image tracking,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.673997Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:495d6ad9d18c4e86ab86ca5acda289ca7d54ff1e5538088a28adfffe1189d82d","observation_id":"6b5d8d92-cbb3-49cb-afcb-68a6ca2fba82","resolution":{"observed_at":"2026-08-14T13:01:09.673997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.04623","last_updated":"2015-05-20T15:29:42Z","snapshot_observed_at":"2026-08-14T22:59:51.151438Z","submitted_at":"2015-02-16T16:48:56Z","title":"DRAW: A Recurrent Neural Network For Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.04623","snapshot_observed_at":"2026-08-14T13:01:09.681764Z","title":"Draw: A recurrent neural network for image generation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.681764Z"},"links":{"cited_paper":"/paper/1502.04623","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:e50becfe85ad4e7f4a5a4e2407aebb5868be9bcb804aacd255783a43865cbaaf","observation_id":"033eff53-4e1f-4af0-b159-196ff7d4c4be","resolution":{"observed_at":"2026-08-14T13:01:09.681764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.692464Z","title":"Aligning Where to See and What to Tell: Image Captioning with Region-Based Attention and Scene-Specific Contexts,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.692464Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:6da362c71853f282680871063ae85e37cf2991c667c206e8775f37c3ada37963","observation_id":"77c4d083-049c-4154-87d2-18dae9787c4e","resolution":{"observed_at":"2026-08-14T13:01:09.692464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.02793","last_updated":"2016-02-29T17:56:29Z","snapshot_observed_at":"2026-08-14T22:24:12.703068Z","submitted_at":"2015-11-09T18:18:53Z","title":"Generating Images from Captions with Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.02793","snapshot_observed_at":"2026-08-14T13:01:09.699849Z","title":"Generating images from captions with attention,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.699849Z"},"links":{"cited_paper":"/paper/1511.02793","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:feac815d04f97dc4d39b0df3ee5a965ebb085c61b0d53d5e0030b7a2883f20d3","observation_id":"31aa1fdd-2095-4eea-a398-0cc198c395fa","resolution":{"observed_at":"2026-08-14T13:01:09.699849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-12T12:07:42.706444Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-14T13:01:09.709113Z","title":"Neural turing machines,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.709113Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:6db78e1a41c261ace76b51ca119a1d0e0a0983bd31ea5d8b67004314172eafa5","observation_id":"a45ec348-dc86-42ef-955f-c08dddb5ba1f","resolution":{"observed_at":"2026-08-14T13:01:09.709113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.04025","last_updated":"2015-09-20T08:25:52Z","snapshot_observed_at":"2026-08-14T22:36:17.759859Z","submitted_at":"2015-08-17T13:43:19Z","title":"Effective Approaches to Attention-based Neural Machine Translation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.04025","snapshot_observed_at":"2026-08-14T13:01:09.715622Z","title":"Effective approaches to attention-based neural machine translation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.715622Z"},"links":{"cited_paper":"/paper/1508.04025","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:d70a9d2b2312ed2d64187fc4ed9eb57d1a89b10a39beec3d09ee374bd5d4cac9","observation_id":"e2b12437-d4e7-43f0-912a-907fb2f020bc","resolution":{"observed_at":"2026-08-14T13:01:09.715622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.727280Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.727280Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2768ed4a3839bfe4e894b020d1a67a8f35d3c7ce3f6e42e96e571b18d9ba340a","observation_id":"e19fbff3-82e8-4bc5-a43c-a000878bc251","resolution":{"observed_at":"2026-08-14T13:01:09.727280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.736758Z","title":"Skeleton-based action recognition using spatio-temporal LSTM network with trust gates,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.736758Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:911418ffce6b1cf5e43438c34cc0e3e153d72f6a612a1aa3a76bb8a4eac1befd","observation_id":"02618946-b16a-4dc0-bcca-59b3fbb0f9a3","resolution":{"observed_at":"2026-08-14T13:01:09.736758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08318","last_updated":"2019-06-14T18:20:10Z","snapshot_observed_at":"2026-08-14T19:12:44.872970Z","submitted_at":"2018-05-21T23:10:35Z","title":"Self-Attention Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08318","snapshot_observed_at":"2026-08-14T13:01:09.746388Z","title":"Self-attention generative adversarial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.746388Z"},"links":{"cited_paper":"/paper/1805.08318","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:1e020ff3666c73b81e2d9f23dcfb0e91b0beaa258933e53400d78f3eb58f2784","observation_id":"2a771925-8704-44ce-ba07-701759d77e02","resolution":{"observed_at":"2026-08-14T13:01:09.746388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01578","last_updated":"2017-02-15T05:28:05Z","snapshot_observed_at":"2026-08-14T21:31:52.294004Z","submitted_at":"2016-11-05T00:41:37Z","title":"Neural Architecture Search with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01578","snapshot_observed_at":"2026-08-14T13:01:09.762890Z","title":"Neural architecture search with reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.762890Z"},"links":{"cited_paper":"/paper/1611.01578","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:006d65ec1ad13896d6cb6b07d7d5c8711784024385eefbd0b120454f5f3ff8ad","observation_id":"e6b92fbd-bdf7-4c26-9741-d3292038e5ca","resolution":{"observed_at":"2026-08-14T13:01:09.762890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.09055","last_updated":"2019-04-23T06:29:32Z","snapshot_observed_at":"2026-08-15T06:40:14.261008Z","submitted_at":"2018-06-24T00:06:13Z","title":"DARTS: Differentiable Architecture Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.09055","snapshot_observed_at":"2026-08-14T13:01:09.772821Z","title":"Darts: Differentiable architecture search,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.772821Z"},"links":{"cited_paper":"/paper/1806.09055","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:875901475f7a94fc8e2e8c4f39c5abb1b3ec75abe2a83498043fac2fedb77ce7","observation_id":"391ea093-95bc-44d6-a1f0-265642c2c07e","resolution":{"observed_at":"2026-08-14T13:01:09.772821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.783802Z","title":"Progressive neural architecture search,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.783802Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:daa6282b1fe68a570479ec0a3decd5ceb422523edaa2cbba6360ce9535a0c623","observation_id":"56bba1c7-faf8-44b1-b83a-9966221dfa55","resolution":{"observed_at":"2026-08-14T13:01:09.783802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.792646Z","title":"Learning hierarchical features for scene labeling,","venue":null,"work_id":null,"year":1915},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.792646Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:b8880243544382e6bd7d6aeaf7a6bbf00dd9ea63827eba1de0f7876e782f925c","observation_id":"b8331225-fd2a-4791-9e12-a7972010132e","resolution":{"observed_at":"2026-08-14T13:01:09.792646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.801032Z","title":"Going deeper with convolutions,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.801032Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:e1a3fc73fcda918ffafb86832e5ecd9cc33850d7d0a968d9c10362efb3f9d404","observation_id":"aec87521-37eb-4fb7-9f73-0accffae8363","resolution":{"observed_at":"2026-08-14T13:01:09.801032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.810780Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.810780Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:0ae3ac5add95bfde2f561c64c59fe1bb44f9fa9c389a71d6cd0a68b4422fb918","observation_id":"2c737217-3d2b-4c75-8deb-46f0547af6d4","resolution":{"observed_at":"2026-08-14T13:01:09.810780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T13:01:09.832851Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.832851Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:1ec7cda0718150d2f6a97f25974d99f56eb16b862b7dc6420fd2f8265083d76d","observation_id":"1886ac6a-668f-4324-9636-d384629ebd32","resolution":{"observed_at":"2026-08-14T13:01:09.832851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.851429Z","title":"Visualizing and understanding convolutional networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.851429Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:f01a02c59e97b95fbd388ef290c4deb85225586e146ae7e9359b0fe2ab8fcce0","observation_id":"ac9c22a0-d85a-4451-b3fd-915fe0c5fd21","resolution":{"observed_at":"2026-08-14T13:01:09.851429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.10080","last_updated":"2016-11-30T10:24:32Z","snapshot_observed_at":"2026-08-14T21:27:52.623077Z","submitted_at":"2016-11-30T10:24:32Z","title":"Wider or Deeper: Revisiting the ResNet Model for Visual Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.10080","snapshot_observed_at":"2026-08-14T13:01:09.860096Z","title":"Wider or deeper: Revisiting the resnet model for visual recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.860096Z"},"links":{"cited_paper":"/paper/1611.10080","citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:4bd23cc7b165a4f3100361b4117535e42563571e4e469722b19ce12c9af73fb9","observation_id":"b2b01d53-6e2e-4d7a-8940-85fade305c65","resolution":{"observed_at":"2026-08-14T13:01:09.860096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.872320Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.872320Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:8d099444bb5ec21b32a6dc56f0e05cfd878a1c415e22711c107132d9ddfec5b9","observation_id":"1dd5cb84-eae1-4d0f-ae2d-ddcaaa62127d","resolution":{"observed_at":"2026-08-14T13:01:09.872320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.879107Z","title":"Densely connected convolutional networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.879107Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:2375f48fb9baf81adb258f1f3cf13ac945dc3600ba8ccb66094a08a92ecd4071","observation_id":"bf00056b-1b0d-47a4-8240-1e5286212507","resolution":{"observed_at":"2026-08-14T13:01:09.879107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:09.886963Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:09.886963Z"},"links":{"citing_paper":"/paper/1908.07656"},"observation_digest":"sha256:85b763dc6294c49902674d45c0e28476be3073b11ba76ed7a362904ea7ea8977","observation_id":"71464a5a-b82b-46f9-b4fa-80b85e596a41","resolution":{"observed_at":"2026-08-14T13:01:09.886963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.07656","last_updated":"2019-12-01T03:30:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:56:58.818602Z","submitted_at":"2019-08-16T16:40:49Z","title":"Survey on Deep Neural Networks in Speech and Vision Systems"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":88,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":233},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 233 outbound references and 0 inbound Pith citation observations for arXiv:1908.07656."}