{"as_of":"2026-08-16T03:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffba7db57761d841c6ede37f8c64104ac0712945694db2e71491a7d4f12dedfb","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:32:40.579862Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.07094/citation-record","integrity":"/paper/1908.07094/integrity","json":"/paper/1908.07094/citation-record.json","paper":"/paper/1908.07094"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.723806Z","title":"Deep speech 2: End-to-end speech recognition in english and mandarin","venue":null,"work_id":"b792681c-8b3b-4956-ba48-62003e65adbc","year":2016},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.187215Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:76f00d53b7a561c62cb6e242717672bab09e6dcec8b8d653d447c7794d002240","observation_id":"35ad6b23-c40c-48e7-a66f-bda27a2c4e9d","resolution":{"observed_at":"2026-08-14T12:32:41.728991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.208110Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.208110Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:a736097555784189840c21f3b887423cd9a7f3fbb2ec6ef8f959322e05ffad95","observation_id":"cbaadc98-e1c7-4c7d-928c-a793e9a2c4de","resolution":{"observed_at":"2026-08-14T12:32:40.208110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.698089Z","title":"Deep voice: Real-time neural text-to-speech","venue":null,"work_id":"38716b6c-4e81-40ab-9fce-4266389f1c7b","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.214283Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:e83b845d5a7aefd904955d7fe21890f842bdf3489f9299d4e2f07a802cc4e8d4","observation_id":"1509ed93-aed0-40c6-9850-3f3386e0f534","resolution":{"observed_at":"2026-08-14T12:32:41.703952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.684819Z","title":"One-sided unsupervised do- main mapping","venue":null,"work_id":"170d3fb0-2faf-4037-9ae7-75dec07b13f8","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.222855Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:c43cef059ca512019e2e2132d12f64e1c3bcfba60aebd0098e613b2732811bea","observation_id":"9ea4c8e1-891d-4262-988b-de226798bd6d","resolution":{"observed_at":"2026-08-14T12:32:41.689013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T12:32:40.233991Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.233991Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:b2217aa3fae91de836f1c6f98ec3399bc2a86947d07273b95758adc96c400343","observation_id":"15406ef7-2d88-4131-9483-ecf74b271bdb","resolution":{"observed_at":"2026-08-14T12:32:40.233991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.671771Z","title":"Weiss, Kanishka Rao, Katya Gonina, Navdeep Jaitly, Bo Li, Jan Chorowski, and Michiel Bacchiani","venue":null,"work_id":"215d61cc-f4f4-4be4-b5d2-d202360cc2de","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.239835Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:fe578e4b86b180cc0391c7dd058ebe44fe4a7c15bdfdc9925321907078424097","observation_id":"0918578d-903d-408a-9083-37f831003fcd","resolution":{"observed_at":"2026-08-14T12:32:41.676458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.658104Z","title":"Learning phrase representations using rnn encoder-decoder for statistical machine translation","venue":null,"work_id":"7e87358e-81a3-4be8-85bb-19137517318e","year":2014},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.244801Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:3d0d607a7c1939bbff0505175a2df78c244a9add23fac570587b1895b962807a","observation_id":"6d75fb6c-4c44-49e7-91e8-b631717e85e8","resolution":{"observed_at":"2026-08-14T12:32:41.662912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.639011Z","title":"StarGAN: Uniﬁed gener- ative adversarial networks for multi-domain image-to-image translation","venue":null,"work_id":"3d2577bd-2aed-4842-8e90-1087f953332c","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.249480Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:1977e8b3bbabb1d90bdf314b2cb474efb1c80a780439697e7404a6f5f89abcb3","observation_id":"0dba30e2-25b4-461e-88c4-5c7022836145","resolution":{"observed_at":"2026-08-14T12:32:41.644638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.623860Z","title":null,"venue":null,"work_id":"a9a1283a-57b2-4d81-92a2-963f5c67362b","year":2009},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.256473Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:8e2d1ead7e760eaa8ce5723804e9d00fc50d566f153c23bfd58b44a4cdf7b138","observation_id":"0fbf77f8-2d26-4c74-84bb-23eca167d1c3","resolution":{"observed_at":"2026-08-14T12:32:41.629458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.609520Z","title":"Unsupervised domain adaptation by backpropagation","venue":null,"work_id":"5b48e9fb-a0ed-4d71-b153-7474bb070719","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.263495Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:178224c9371f60460ee9ae1a04609973320a49fa47852ba339e1926b298ee65f","observation_id":"ab4d28ca-1ed6-4844-88a4-38219b608731","resolution":{"observed_at":"2026-08-14T12:32:41.614632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.592187Z","title":"Auditory-visual inte- gration during multimodal object recognition in humans: a behavioral and electrophysiological study","venue":null,"work_id":"3cf4ee14-1f61-4852-8b68-c350d84e88db","year":1999},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.269378Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:3e58c6f2b3b52a1f1d6ad4ad9e03c1fb49ce630dbcf4e146b32a67ee2114754b","observation_id":"3f08e268-2703-4f73-8cf7-420252166d2a","resolution":{"observed_at":"2026-08-14T12:32:41.596764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.576102Z","title":"Deep voice 2: Multi-speaker neural text-to-speech","venue":null,"work_id":"7f6ee221-9bb7-4c97-bd74-8f429cac32e4","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.275156Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:6fb9ec060049cfd4d3d01417a6a2ec21fec9a8c9f83ce0f0bb8297dc32c6a681","observation_id":"f545e8c4-795e-48d1-bde4-d3a0b34a6ae5","resolution":{"observed_at":"2026-08-14T12:32:41.581352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.556751Z","title":"Generative adversarial nets","venue":null,"work_id":"a6086289-429d-4737-8869-fea87e5a3bd2","year":2014},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.280725Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:9ab2cab5e912934b237b914bc00254a2f01085f14127886c7c045c7377cca948","observation_id":"a463a38d-d7be-409b-9e47-46c3bc12fa0b","resolution":{"observed_at":"2026-08-14T12:32:41.565415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.538449Z","title":"Grifﬁn and Jae Lim","venue":null,"work_id":"a4a73569-0914-402d-8df7-2221cb44c6d8","year":1984},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.287396Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:a35dfabc46a2a349cecc0bd334d6d2fbb180c466ef749fa04205f9e7c02d2172","observation_id":"55867ffc-d869-4696-b7f0-c23500615042","resolution":{"observed_at":"2026-08-14T12:32:41.542863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.518573Z","title":null,"venue":null,"work_id":"9f3b5d7d-deda-4677-b443-0f1b654e6da1","year":2016},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.291930Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:0312e7e4efa6c72757f9d9448ba2b1cc38c6ccc9a54bf5d5900f1f7ab3a41132","observation_id":"a9f517cf-adea-4265-83b5-cf604f0182e0","resolution":{"observed_at":"2026-08-14T12:32:41.524456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.502451Z","title":"Deep neural networks for acoustic modeling in speech recognition","venue":null,"work_id":"460bcd74-a7e1-4e77-8098-a187a5f4af44","year":2012},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.299041Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:586211b02ed4aba2c252a6f76fd653d7987468f3f629694907567ab9dde42995","observation_id":"a901f9a3-bdd6-4f8a-9474-2796c9971ffa","resolution":{"observed_at":"2026-08-14T12:32:41.507327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.487653Z","title":"Huang, Z","venue":null,"work_id":"9728d624-7ef1-46c7-8523-74b5b82b9707","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.304045Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:20527061ae71019b102e6b094267a6179d02aa55f6581d67b929f98db38ee046","observation_id":"ec1e21c5-7697-4666-a19b-21c451dc9a46","resolution":{"observed_at":"2026-08-14T12:32:41.492668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.473049Z","title":null,"venue":null,"work_id":"f063fdff-daeb-42e0-84e7-c87c35c12503","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.312903Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:1d867dd9261b7206541df8f5f7385ec1b481acbc743040ff7cf0d41dfcaf49aa","observation_id":"4f98a6bf-714b-4324-b9c3-e4446dd196aa","resolution":{"observed_at":"2026-08-14T12:32:41.477805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.459411Z","title":"Recurrent fusion network for image captioning","venue":null,"work_id":"56897a15-f0b4-4b84-b4aa-520bbe84bbdf","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.318633Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:d8a0947fe3771f8e432a9ae6bf3dcc6f34e8a42e645f4328c46666784915e53a","observation_id":"33c9fec7-9ce1-4584-99ab-329778a5c0b0","resolution":{"observed_at":"2026-08-14T12:32:41.463953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.442544Z","title":"Learning to discover cross-domain relations with generative adversarial networks","venue":null,"work_id":"23e23d63-8efc-4ef7-9bd0-54409c087e22","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.323490Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:3ccf2d36040535f79369d2435d583b01931f7025047cfc8a828c20ae5d556339","observation_id":"6522e939-ca0e-4114-b621-468754b8b2c3","resolution":{"observed_at":"2026-08-14T12:32:41.447931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.328415Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.328415Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:10a81756b4f042671187c1b5dae2e06acc7d8dfc3c8f07d4de6e442d4be057af","observation_id":"3dbaa0dc-3b94-4030-8570-69154d0a83a1","resolution":{"observed_at":"2026-08-14T12:32:40.328415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.411778Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":"fb2a74a9-332d-4a1e-8abb-f7bfbaa238a3","year":2014},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.334491Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:e8167796894e023f143fadb19140df22502d5005b20cc8a67019dddece245618","observation_id":"39a0947e-dbaf-4c35-85a7-b63450f74f29","resolution":{"observed_at":"2026-08-14T12:32:41.416403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.388552Z","title":"Shamma, Michael S","venue":null,"work_id":"a652b435-7f15-4232-823a-1ba20c724e33","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.339109Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:323d96a9114c308713ba7721a0a4d95da9ef334f689e586d0d65d0d1503702fa","observation_id":"d394991e-db9c-4945-9809-0f3aeb1ff483","resolution":{"observed_at":"2026-08-14T12:32:41.398799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09444","last_updated":"2019-02-16T01:19:21Z","snapshot_observed_at":"2026-08-14T20:00:43.392896Z","submitted_at":"2017-12-22T17:42:15Z","title":"Letter-Based Speech Recognition with Gated ConvNets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09444","snapshot_observed_at":"2026-08-14T12:32:40.343688Z","title":"Letter-based speech recognition with gated convnets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.343688Z"},"links":{"cited_paper":"/paper/1712.09444","citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:150660101b9f7820943dbede3c2fe52d7fc48b6b7bd29ac8869d78353d4ab79b","observation_id":"0df4bacb-40aa-4a6b-841f-f526c8ad1899","resolution":{"observed_at":"2026-08-14T12:32:40.343688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.373263Z","title":"DA-GAN: instance-level image","venue":null,"work_id":"51a675d7-9dc2-4b0a-b7c3-6615bc96fa6d","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.349055Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:392723266ba3e523070e78b952d3f897bb152e48ea973f558523ad6fbf4d0705","observation_id":"97f37b93-b26e-48fc-9836-b7d6f98cb6f2","resolution":{"observed_at":"2026-08-14T12:32:41.378509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.357655Z","title":"Neural TTS styl- ization with adversarial and collaborative games","venue":null,"work_id":"115f686e-6f40-4323-8b54-cfe18a5b4720","year":2019},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.354032Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:d90db1e34938c89bfcfe79bf4fb9f9dd78db22c395b7226e1984e43b6c665dd1","observation_id":"a0dc435e-e9af-4f45-a0f4-04a77d8939ee","resolution":{"observed_at":"2026-08-14T12:32:41.363667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.342770Z","title":"Semstyle: Learning to generate stylised image captions using unaligned text","venue":null,"work_id":"df197a28-174f-44ca-b336-8b24a369339a","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.359162Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:48ef83ff27f8365ce60c19d432125c1156d5fcb75f8694f34dc6cf74aeee7825","observation_id":"6c2909de-9943-465a-b9a9-84e0aa189c2b","resolution":{"observed_at":"2026-08-14T12:32:41.347881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.329759Z","title":"Deep multi-scale video prediction beyond mean square error","venue":null,"work_id":"b081ff56-be56-40be-82fa-4961dbe06b45","year":2016},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.363608Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:f50b5184392eb2513db9eb4091a5da5fa7bd609e2155c239a6a19987c0f67b57","observation_id":"e963026b-5cd3-49a3-9fd2-e22378dd0b3b","resolution":{"observed_at":"2026-08-14T12:32:41.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.315417Z","title":"Fitting new speakers based on a short untranscribed sample","venue":null,"work_id":"84543b48-6961-4545-90b0-3b177993e033","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.368936Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:ec0bb8213de79a7d0eb46e22c3df377564feba69efb615a9029cae136f48242a","observation_id":"246b088b-86e9-476a-83d3-30e418bd7a41","resolution":{"observed_at":"2026-08-14T12:32:41.320167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.299401Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"5a7b05a2-be79-41cf-b634-3e24f8682dd9","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.373929Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:3749bbf2aa496233c1677e3434dcce60421e5ebfaaddc616a15b36054ac6e137","observation_id":"183b6c45-042c-45ee-8f6d-f2a6a96a0ba2","resolution":{"observed_at":"2026-08-14T12:32:41.304579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.284536Z","title":"Attend to you: Personalized image captioning with context sequence memory networks","venue":null,"work_id":"b39cb121-ceaf-4f64-9d9c-da33db814065","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.379814Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:52a0901e8dda9503cc6ed55dc5870b40f336aef3aa85f9b2439ed5d9984ce24a","observation_id":"9cf086df-c52c-485a-9e60-b0c2df823191","resolution":{"observed_at":"2026-08-14T12:32:41.289510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.268648Z","title":"Beyond sensory im- ages: Object-based representation in the human ventral path- way","venue":null,"work_id":"b4e65a55-5fe6-4c37-9cd5-fa58025be7fc","year":2004},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.384718Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:7c354cbaffc93c0512c20d1dd06001b3ff28e29d7b9d8340ee17b213a61f39e8","observation_id":"f73743cb-664a-4c60-b154-e764c072554d","resolution":{"observed_at":"2026-08-14T12:32:41.274190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.250139Z","title":"Arik, Ajay Kannan, Sharan Narang, Jonathan Raiman, and John Miller","venue":null,"work_id":"31c1b57c-6b8d-4917-ae1e-2d8b99522c94","year":2000},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.393548Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:bdc52825619a760210ac565566b9c3d9bc65ab060f6dc3049bdebc4fe4b56d9c","observation_id":"2ebac211-0c85-4b2a-a2db-75e0951216f2","resolution":{"observed_at":"2026-08-14T12:32:41.258001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.231120Z","title":"Generative ad- versarial text to image synthesis","venue":null,"work_id":"feca1bf8-b1c4-4e87-a6e3-7fce9202d1cb","year":2016},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.398847Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:77aaaa001f4111156ca00baa07225e24ef68de1009a4aafb96db64b3c1d7f0c7","observation_id":"81148e27-f988-4720-b030-3d5de3180dc6","resolution":{"observed_at":"2026-08-14T12:32:41.237503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.213397Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"1216515e-36b7-44de-aacc-d08acc24ce84","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.403456Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:23cfd779290f56411a417c9cf229f985a55d96587adee221d7f37e3c1db58f3e","observation_id":"1e437235-6436-4bd5-921f-496d3aa71b31","resolution":{"observed_at":"2026-08-14T12:32:41.221378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05884","last_updated":"2018-02-16T01:28:23Z","snapshot_observed_at":"2026-08-14T20:03:06.478622Z","submitted_at":"2017-12-16T00:51:40Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05884","snapshot_observed_at":"2026-08-14T12:32:40.409378Z","title":"Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.409378Z"},"links":{"cited_paper":"/paper/1712.05884","citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:9e56386144216175f814d77a102a0190bccea1f7115358bdb292cf4999d67601","observation_id":"cc08e4ad-b405-4ca7-a066-d8804c3554de","resolution":{"observed_at":"2026-08-14T12:32:40.409378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.197939Z","title":"Char2wav: End-to-end speech synthesis","venue":null,"work_id":"151fe30b-d0e5-4d4a-9818-04b42f89871d","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.415356Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:57d3003142bb02be64cba2bbb8d5216d943df9e418c1c440eb9d8f42bf33a7c1","observation_id":"39f2086d-8a96-4a69-b83e-0abc87399f1f","resolution":{"observed_at":"2026-08-14T12:32:41.202586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.183399Z","title":"Szegedy, Wei Liu, Yangqing Jia, P","venue":null,"work_id":"21f518d4-1222-4f39-80ea-b447dd04ac98","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.420662Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:355e23fb0cf7914afa1c07a8932ef24cd22d26f51aad182b2b74afa2605866f4","observation_id":"15590278-f90c-4c7a-b371-9e1ad76a8ddb","resolution":{"observed_at":"2026-08-14T12:32:41.188088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.165300Z","title":"Unsupervised cross-domain image generation","venue":null,"work_id":"bf4d811f-7d2e-4b02-8168-b78a5c239e60","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.425757Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:0767706a3b9edb863df3e57259bbbf441c0bdfc26c7d3f85078bd245861d07ce","observation_id":"7494df59-bec1-44c6-9b46-d2080ae75d06","resolution":{"observed_at":"2026-08-14T12:32:41.170542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.149244Z","title":"V oiceloop: V oice ﬁtting and synthesis via a phonolog- ical loop","venue":null,"work_id":"7358a348-484b-4da6-800f-cf14ffec08bc","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.430623Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:a581dc9479c2880b1672e7d6c89921829ab5bffd2d5874e52b0d2de48fc5c815","observation_id":"b60e1574-6217-40e3-ac05-4b017bf2481b","resolution":{"observed_at":"2026-08-14T12:32:41.154400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.135473Z","title":"The information bottleneck method","venue":null,"work_id":"e6ca76d7-b17c-4825-8a7a-7a16daa6b5a5","year":1999},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.436106Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:d7c06420836ef3897d5c9e999ff2cf13a98b90bd3418018f75ff335535c9f3a4","observation_id":"d91550cd-0fe8-416f-953a-1b62f9056112","resolution":{"observed_at":"2026-08-14T12:32:41.139967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-13T01:24:25.628327Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-14T12:32:40.440702Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.440702Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:7a7c02d69bd8b2f00694ca02279ffaf48bf9f8ffd5be5b90f03fa1c729200533","observation_id":"b5488199-086e-4b76-b792-c0391b49f077","resolution":{"observed_at":"2026-08-14T12:32:40.440702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.445811Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.445811Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:0f45702689492b758d1ebb6dc9a0549651b71cabb96e92476ac7ae59ffef32ef","observation_id":"beaf1d4a-2160-4e1e-99a8-cc27cecad1aa","resolution":{"observed_at":"2026-08-14T12:32:40.445811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.110995Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"0db93179-61c6-42d5-bd33-b8898d25010c","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.450090Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:bedef170eb246548954817674eff31aa57e87507034f8ac7063b6bfcaebde4e6","observation_id":"c148cdd4-3077-4afe-9cab-f11e86832d9f","resolution":{"observed_at":"2026-08-14T12:32:41.116749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.094458Z","title":null,"venue":null,"work_id":"cf3b319f-1cec-4ebd-9a11-1a4a0f20fd01","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.455622Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:4d0ba8d619f9f7200c7646d9b86b38da6a0c38ff00e3d5001d891dacd98518c5","observation_id":"27f4cf11-4028-4c02-9d5b-7aadf127df87","resolution":{"observed_at":"2026-08-14T12:32:41.098764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.069040Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"f96527eb-1c9a-48e2-8d1a-96469abc1f7a","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.460412Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:566c0028389d30f6646ba54c90d4d1bb010d4abec7138450e5831e2fd887e904","observation_id":"2d9e1973-0cce-46d7-b994-8c91366a3021","resolution":{"observed_at":"2026-08-14T12:32:41.079532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.053482Z","title":"Tacotron: Towards end- to-end speech synthesis","venue":null,"work_id":"044905cd-a950-4a80-9a7f-ef5c377ca40f","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.465080Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:ea1901f3fec3abf6976f34d2765a768050114d4ba54e2a3eb8be64f327f5889f","observation_id":"0689af5f-ddea-4cec-bea7-52183f9196c5","resolution":{"observed_at":"2026-08-14T12:32:41.058522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.036918Z","title":null,"venue":null,"work_id":"9ff3ed85-9081-4be8-9c5e-0b8d82b671e0","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.469470Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:ee28e14d44ec88bbc7a1cbc40bdc75e502978542c223583dfca9e8df2c5a7fe3","observation_id":"7b0e0399-1fdc-4ee2-9582-09cbbd2aeea6","resolution":{"observed_at":"2026-08-14T12:32:41.042059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:41.020224Z","title":"Memory networks","venue":null,"work_id":"4f40246e-acdb-4438-9cce-fa91567d5670","year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.473965Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:7c3855ce6601190425f962c4bc98078b9ea09ca9b193443aac26f1281dd15ec7","observation_id":"f35ff7ab-c1c2-438b-8ad2-39c01ecbca5b","resolution":{"observed_at":"2026-08-14T12:32:41.024937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.478934Z","title":"Courville, Ruslan Salakhutdinov, Richard S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.478934Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:012ef67eb55670f033ce1db8df89222ee4b721c6bdaa4a4fc74896cb5a105517","observation_id":"68744106-0ce7-4a5a-9bdf-fece81af9708","resolution":{"observed_at":"2026-08-14T12:32:40.478934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.982093Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"ca9ad52f-56c9-4742-97c5-3bb1d34e409c","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.482808Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:6ba1329f0ce59bf6bb735006192f6f057a3a9e607464042d4cb1c2db310fb06e","observation_id":"aeedcc49-4e5b-4512-ade5-3389ee9adb75","resolution":{"observed_at":"2026-08-14T12:32:40.989008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.964611Z","title":"Image captioning with semantic attention.CVPR, 2017","venue":null,"work_id":"40b996ba-0e7d-45eb-9345-6f0a972ffa50","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.488513Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:6fc0536a5aa9d1769b4e32bac472c8e654067133c1fb2860eea4139f106c57ea","observation_id":"3e2215f9-f6e5-4012-870b-d75b57324378","resolution":{"observed_at":"2026-08-14T12:32:40.970995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.943272Z","title":"Stackgan: Text to photo-realistic image synthesis with stacked genera- tive adversarial networks","venue":null,"work_id":"f4294c59-63a2-4fce-a811-be69a97d7a2c","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.492506Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:5154f15b1678431f2d5dc608b21910df805c74758487430becd7c3cbd99b18ec","observation_id":"a0e63788-9d66-41a1-a2ca-70f492b48c75","resolution":{"observed_at":"2026-08-14T12:32:40.948778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.496609Z","title":"Visual to sound: Generating natural sound for videos in the wild","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.496609Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:c53fad3adf5e900c235965008c9766ac5330bc5ad7d9cf875a529783c12c18e7","observation_id":"60d31258-403f-42cf-9b6f-f52dcfab64e9","resolution":{"observed_at":"2026-08-14T12:32:40.496609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.914001Z","title":"Im- proving end-to-end speech recognition with policy learning","venue":null,"work_id":"d94a1046-f1b6-4c67-84b1-e2d1faa9f6a1","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.502211Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:e23234fab8302ebc51a818dba65a8ed9b7e9fbf3de88cd42faf61bf62f7247f9","observation_id":"da4a2775-032b-41c5-93ea-9445644bcae2","resolution":{"observed_at":"2026-08-14T12:32:40.921821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.895197Z","title":null,"venue":null,"work_id":"fac7eb33-c3d8-4e30-b344-e92a00029ba0","year":2017},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.507103Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:e833e8352ff119fafc9c371a25842ee2bbb644ac71856c4620135a784ae23fe6","observation_id":"a3c5a992-6bd7-492b-b704-36bc6a53f641","resolution":{"observed_at":"2026-08-14T12:32:40.899587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.879191Z","title":"Efros, Oliver Wang, and Eli Shechtman","venue":null,"work_id":"f09ddc2d-0afb-43b3-910d-2ef5f27b84c6","year":2018},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.512601Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:128d12d11125c577de1581650e7bb872c46c738fd396c4580b19f9a84f692610","observation_id":"ec905cbd-4e7b-4139-94d4-c13339b689f3","resolution":{"observed_at":"2026-08-14T12:32:40.884162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.859291Z","title":"We encour- age the readers to refer to Figure 3 and Figure 4 of our main paper when reading this section","venue":null,"work_id":"31453241-1787-4b68-b8a5-a8a81226edd9","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.517413Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:b70a0543422b01e4b49ca7bd3585dbaf8cc040fab4c63702ca7dc8f880846fc6","observation_id":"1a4ac184-6260-4cac-baf4-fb788c5abeac","resolution":{"observed_at":"2026-08-14T12:32:40.866425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.843973Z","title":null,"venue":null,"work_id":"764ec6cb-d9e7-4951-935c-c557ebddb8df","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.523658Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:750e49a3b9a339e1fe545b66fadb1dcd8dbabab86b12bc53eeb1e9028a86a7de","observation_id":"5399a283-5229-4460-afb4-13fe1a6708d2","resolution":{"observed_at":"2026-08-14T12:32:40.849508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.828860Z","title":null,"venue":null,"work_id":"fb322513-d187-4f78-b5ac-101f7e866a28","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.532088Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:21b6d7273bdc84a7b5e958f9b6be91e0a5529811c6fdee8758bd61904eb87f9a","observation_id":"1cb707da-a64a-4932-b58d-57eddc55bec4","resolution":{"observed_at":"2026-08-14T12:32:40.834024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.811402Z","title":null,"venue":null,"work_id":"6fbf5ef3-3b5d-44af-900d-425796344d4c","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.537200Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:9fd1bb895f88174b088a67268b7cfe6c11f134018fbd7c1d84b6906224aca835","observation_id":"43abc4ef-1f57-4c11-bafb-174ade716b24","resolution":{"observed_at":"2026-08-14T12:32:40.816482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.796013Z","title":null,"venue":null,"work_id":"fccc95ed-2c7b-4deb-903c-aea1c1ce3122","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.542135Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:92a1343bc54c3460f85111101a4f767114b7273c127337c0fb60e82ccf0e044c","observation_id":"224ff9f3-0ebb-4843-8926-383cad96ea42","resolution":{"observed_at":"2026-08-14T12:32:40.800184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.779558Z","title":null,"venue":null,"work_id":"70352090-d700-411e-802b-b47f4e05ad24","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.547781Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:174d7f3fd43a69f8f4e50b2985a8a2f440b35c484d3683947d4c3f174c00597f","observation_id":"c04a12fe-06cb-46ad-b544-7e871c475c59","resolution":{"observed_at":"2026-08-14T12:32:40.784457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.761673Z","title":null,"venue":null,"work_id":"18c20ffd-44cf-4fde-b5e9-a809cfe0e983","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.553877Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:a94c06f7b3f32d8f00a379fc85da29471e3227e0c203b45cc62cfe8d076879a1","observation_id":"c79de29b-7e42-4cd9-a4e7-5369cc87ce5a","resolution":{"observed_at":"2026-08-14T12:32:40.766624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.729779Z","title":null,"venue":null,"work_id":"41aa4f22-1600-4218-a449-a7737224e921","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.564751Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:1330cc3a52fdc3db5b0eebff27aba6230471bebcbd0e40e626d49c59e86eaae0","observation_id":"e3f706e1-9dc3-4c1a-a3c8-f80baa5dbd8a","resolution":{"observed_at":"2026-08-14T12:32:40.735273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.707531Z","title":"dog” and “zebra","venue":null,"work_id":"f72fc3b7-774c-4297-ade7-aa5a62a2b7e3","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.569987Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:21abf936dc9dd922566db46fa4c9d5ecb110ba77abe6cee3dd311a1f12c51f03","observation_id":"e61b71e8-6b17-4bbf-81e9-5fab85ad1eb1","resolution":{"observed_at":"2026-08-14T12:32:40.712826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.690804Z","title":"bottleneck","venue":null,"work_id":"dc24301d-92b0-4615-86a9-79cbbf96bec9","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.579862Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:e6f4d883d7cce36fd923fc8a9f1c8acdb136988a2346e40d45a0223b9cb9d225","observation_id":"33f8c0bb-e942-47d4-b291-eabd291d05b6","resolution":{"observed_at":"2026-08-14T12:32:40.696611Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:32:40.747063Z","title":null,"venue":null,"work_id":"a0ca5af8-d975-441e-a3d9-0ee75e50c0cf","year":null},"citing_paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-14T12:32:40.559055Z"},"links":{"citing_paper":"/paper/1908.07094"},"observation_digest":"sha256:6c7314be794b04d33498f0e72a9913e4f15c5b833c111368961a365bfa6aba5e","observation_id":"7c2b0122-2aba-4a76-a0b5-7d5f60ae7a6a","resolution":{"observed_at":"2026-08-14T12:32:40.751501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.07094","last_updated":"2019-08-19T22:52:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:26:04.712688Z","submitted_at":"2019-08-19T22:52:59Z","title":"Unpaired Image-to-Speech Synthesis with Multimodal Information Bottleneck"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:1908.07094."}