{"as_of":"2026-08-16T18:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8a18a32ddedbb4436397d4e5bbc8e7729c515ea7c705ae889404bc12005c7dc","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:07:22.218205Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.03744/citation-record","integrity":"/paper/1908.03744/integrity","json":"/paper/1908.03744/citation-record.json","paper":"/paper/1908.03744"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-14T21:37:52.670253Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-14T14:07:22.131966Z","title":"Youtube-8m: A large-scale video classiﬁcation benchmark","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.131966Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:8d9637e08c9ccd78eeda71bb5fbf6787622fafd5650cdb4278d0b779b50b04e4","observation_id":"edaa83b7-e2e2-414b-ba1f-b8f6525cfa04","resolution":{"observed_at":"2026-08-14T14:07:22.131966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.479628Z","title":"Understanding affective content of music videos through learned representations","venue":null,"work_id":"fb9e123b-7b98-4a89-b979-8947b9882e29","year":2014},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.136248Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:f7ebe11fea0d411d98bfd9454bf7a68d9f9add6f7a49ed131a268c89c9908219","observation_id":"7e8daf12-f2fc-4bc7-b47b-277d4a194b9d","resolution":{"observed_at":"2026-08-14T14:07:22.483212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.469944Z","title":"Deep canonical correlation analysis","venue":null,"work_id":"b680b531-8b5e-4c2d-8060-ce8a38f1fc1c","year":2013},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.139764Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:5fe949723b5f65860bc6f517ff01112c9e1327fe4705e55843f50f3a841d8489","observation_id":"7dc09abb-bf61-4d7c-adb9-4f432adb04e0","resolution":{"observed_at":"2026-08-14T14:07:22.473211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.459887Z","title":"The sound of an album cover: Probabilistic multimedia and information retrieval","venue":null,"work_id":"1deb363d-2864-47cd-9f40-1cbda6b7c7cb","year":2003},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.143062Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:3efa8825b97d45987751116d14cecc6a1843be374085fb3a5aba435bc8341efc","observation_id":"7837889f-2622-48f0-a313-dcb664155dc3","resolution":{"observed_at":"2026-08-14T14:07:22.463505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.450010Z","title":"An introduction to support vector machines and other kernel-based learning methods","venue":null,"work_id":"dc10c182-d9db-4e0d-8037-b6394ce721ad","year":2000},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.146556Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:4bace4d48f666aa3bd513b275c5c085724a20b86f8cb48dd3e696b932553d276","observation_id":"f7e0b30e-736d-40de-9116-be99f523e36e","resolution":{"observed_at":"2026-08-14T14:07:22.453809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.439354Z","title":"Cross-modal retrieval with correspondence autoencoder","venue":null,"work_id":"5f8d2d80-d2aa-4e66-b283-97b2824440f2","year":2014},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.150546Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:4b55d756b2257a5f0df559a05ef25ae0d80ac5c156b6921147f61366cd08f45f","observation_id":"3dff33df-3ffc-47bb-b821-310b50a8c8e2","resolution":{"observed_at":"2026-08-14T14:07:22.442823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.429892Z","title":"On the correlation of automatic audio and visual segmentations of music videos","venue":null,"work_id":"6c960b26-d54b-44b3-b871-c1e4f225d7b6","year":2007},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.154219Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:5d3f90f838b072caf0313d01b20b0f1d93db30dab4b7c80829e95356679210dc","observation_id":"72938573-be2f-4005-9b99-f253a5dd90bc","resolution":{"observed_at":"2026-08-14T14:07:22.433267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.420069Z","title":"Cnn architectures for large-scale audio classiﬁcation","venue":null,"work_id":"53148f4f-ac71-41f5-bf17-240e0cb5b63b","year":2017},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.157331Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:70319101f1dd36a7da1562fdbc73b0223e9d28ca03346859d579e791b36d5685","observation_id":"8f310d66-a749-41d8-887d-7aad42f42bb8","resolution":{"observed_at":"2026-08-14T14:07:22.423368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.160343Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.160343Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:24767868650aa9ca31d1114c4655cfcdfd3868d57335f78b1d4e057030550b9e","observation_id":"e1d37e28-0f59-49fd-8292-fc5f285a2c26","resolution":{"observed_at":"2026-08-14T14:07:22.160343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.404382Z","title":"Music thumbnail- ing via neural attention modeling of music emotion","venue":null,"work_id":"c8eaac19-c716-43b7-b91b-fffe60113b65","year":2017},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.163376Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:ef1f15a630627f92190e20e7d52bdb1613b3ff57a9333b0d2a66e591ae3ee1ed","observation_id":"028bf625-c259-4770-a099-ad9da76e79b3","resolution":{"observed_at":"2026-08-14T14:07:22.407869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.394243Z","title":"Deep cross-modal hashing","venue":null,"work_id":"b3fcd0c8-b932-4e43-a5a2-f6f9f2a9fdb6","year":2016},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.166491Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:c24b123754d920cc4c25b0111faa339d375ab6ec73964bb84310152a8954fb0b","observation_id":"f7eda8c6-2d04-478c-81ac-67c06bfd4f88","resolution":{"observed_at":"2026-08-14T14:07:22.397516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.05368","last_updated":"2016-07-19T01:55:55Z","snapshot_observed_at":"2026-08-14T21:47:50.795643Z","submitted_at":"2016-07-19T01:55:55Z","title":"An Empirical Evaluation of doc2vec with Practical Insights into Document Embedding Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.05368","snapshot_observed_at":"2026-08-14T14:07:22.169465Z","title":"An empirical evaluation of doc2vec with practical insights into document embedding generation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.169465Z"},"links":{"cited_paper":"/paper/1607.05368","citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:2073a495bff5e56997a48c3f6e4fbb3e50cb11b30050c372ece0eeb1e167b377","observation_id":"f147e022-b61a-4b38-a647-00bc8edafdf4","resolution":{"observed_at":"2026-08-14T14:07:22.169465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.173025Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.173025Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:6842041c4d44e2911f9ef1ec9b6909a1da9a4050850f0c017338533836d1e524","observation_id":"2f7c2056-da49-44cb-88d3-9d2cb30d71d6","resolution":{"observed_at":"2026-08-14T14:07:22.173025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.379067Z","title":"Analysing the similarity of album art with self-organising maps","venue":null,"work_id":"29faec40-8ead-40ff-ab02-0352e00f1406","year":null},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.176259Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:97166df84bdacd185cadfd8ff2da0b722fc15a3f554c510c518e45109b2e353e","observation_id":"b14c390c-240a-47ba-94db-8099a66e412c","resolution":{"observed_at":"2026-08-14T14:07:22.382359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.179410Z","title":"Evaluation: from precision, recall and f-measure to roc, informedness, markedness and correlation","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.179410Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:e69152b80374316401c3d85b0677cb097888ad9a66ea12b90f0728b0189c68fd","observation_id":"d1f5a63a-89a7-4658-8bc9-25906bee9b76","resolution":{"observed_at":"2026-08-14T14:07:22.179410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.364521Z","title":"A new approach to cross-modal multimedia retrieval","venue":null,"work_id":"0eb9dcd6-1215-4adb-a653-0ac7577ed827","year":2010},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.182353Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:c62c354bdd7a0310cfb98d8f6c52250650eb17c1fa4ff99b5f5b1a37dc145750","observation_id":"6f8a3219-647d-4497-a449-cb41a4f12a53","resolution":{"observed_at":"2026-08-14T14:07:22.367457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.356033Z","title":"Cluster canonical correlation analysis","venue":null,"work_id":"920ef484-bb00-4cb0-b8c8-077a836e771b","year":2014},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.185564Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:5c6c1ecde60ea3b93d7dc67c08a6830c1e451320e1467c0d4ec013e8149eea7a","observation_id":"ebf0375b-db9e-4deb-bcf0-72f45119dc71","resolution":{"observed_at":"2026-08-14T14:07:22.358840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.346690Z","title":"Advisor: Person- alized video soundtrack recommendation by late fusion with heuristic rankings","venue":null,"work_id":"d4f97c96-671b-45f6-ba04-3fcfd7589652","year":2014},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.188650Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:21191113c66418c184b6acb6882e47d9ff1dbcc99c393dfc5dce0e9bf0343efd","observation_id":"072cdb07-74bd-4a30-990c-9de01c336069","resolution":{"observed_at":"2026-08-14T14:07:22.350148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T14:07:22.192128Z","title":"Very deep convolu- tional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.192128Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:33b7b30cfac2443aac84317d8d4e4283e5cba3193cb85aae905ef16f8236f4a8","observation_id":"7a9cfa24-dc09-4e05-8cd2-98a0f9a5a1f7","resolution":{"observed_at":"2026-08-14T14:07:22.192128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.337838Z","title":"Canonical correlation analysis","venue":null,"work_id":"8e336b08-f8e0-448c-bc79-639a15102aba","year":2005},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.195799Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:e76149773258602f0ea9e54816d64307ce58751ee3150d5f9c68fc4f8c34dd33","observation_id":"1a662c09-06b0-4fce-acc9-8baa0052e029","resolution":{"observed_at":"2026-08-14T14:07:22.340817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.327741Z","title":"Learning deep structure- preserving image-text embeddings","venue":null,"work_id":"4f7e937b-5637-46dd-b7e9-b4ec74bdb029","year":2016},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.198917Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:36b59bbe761ff5c922aeb68aaf4b93ef3c18f7ac0ecdaf7e00d477986320de65","observation_id":"b98ac8e9-e402-45a3-9ae4-a1c9e39a7d5e","resolution":{"observed_at":"2026-08-14T14:07:22.331319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.317596Z","title":"Automatic music sound- track generation for outdoor videos from contextual sensor information","venue":null,"work_id":"0a1f9058-216d-4401-a017-29d75369ecea","year":2012},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.202415Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:5c77cbcd996ac3feb60346373db4df934c44bff53bf3d59da1e48828fb734fe3","observation_id":"a924905b-ff45-4798-9956-4b15d66ed2d0","resolution":{"observed_at":"2026-08-14T14:07:22.321081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.307001Z","title":"Venuenet: Fine-grained venue discovery by deep correlation learning","venue":null,"work_id":"82c0573b-bbeb-435d-a913-6c995d536edb","year":2017},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.205513Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:f9a7c36a8def3e5aa31482982546fe822095a7bb37b9f3cac95d7ae92e4c6d6e","observation_id":"5db56d1a-31c2-4608-aced-c673483c5cca","resolution":{"observed_at":"2026-08-14T14:07:22.311101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.296991Z","title":"Category- based deep cca for ﬁne-grained venue discovery from multimodal data","venue":null,"work_id":"b35f2367-6a56-41e6-91d8-95ae2477c09b","year":2018},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.208647Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:56fb766f003254742d15806d7b65da63b0395f2c15b69bf55342cf62da6a52bd","observation_id":"34c9985f-f21a-44e4-b392-f4764cd7da2e","resolution":{"observed_at":"2026-08-14T14:07:22.300623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.287155Z","title":"Deep cross- modal correlation learning for audio and lyrics in music retrieval","venue":null,"work_id":"7fc7d19f-e940-4f10-a908-a77a9b6e7a5e","year":2017},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.211745Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:eacc2cbb0ab4e130db9e2a620a2d0a0d74afc5503e04773cbdae0fff2758923e","observation_id":"90f1c88c-60d5-4801-9d5e-8e9117e7d895","resolution":{"observed_at":"2026-08-14T14:07:22.290529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02947","last_updated":"2017-07-25T10:12:31Z","snapshot_observed_at":"2026-08-14T21:35:55.476144Z","submitted_at":"2016-10-10T15:03:15Z","title":"End-to-end Concept Word Detection for Video Captioning, Retrieval, and Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02947","snapshot_observed_at":"2026-08-14T14:07:22.214925Z","title":"Video captioning and retrieval models with semantic attention","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.214925Z"},"links":{"cited_paper":"/paper/1610.02947","citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:9760d6c3df0535522fcb307c42ac31b72b5838277f7e3f88ecc7e05b2297ca39","observation_id":"f1aaf072-eba7-4ebe-a8fa-857543c9aab4","resolution":{"observed_at":"2026-08-14T14:07:22.214925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:07:22.276034Z","title":"Multi-view learning overview: Recent progress and new challenges","venue":null,"work_id":"1e7bae35-4081-4cbe-b48c-d500765490b7","year":2017},"citing_paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:07:22.218205Z"},"links":{"citing_paper":"/paper/1908.03744"},"observation_digest":"sha256:d37a09e056949d857d72180ed8f355b3f49e6afe2f313936e98a12ffbad43498","observation_id":"094eae7b-7d81-4126-a158-60d105936b4c","resolution":{"observed_at":"2026-08-14T14:07:22.280948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03744","last_updated":"2019-08-10T12:29:05Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T10:57:02.472516Z","submitted_at":"2019-08-10T12:29:05Z","title":"Audio-Visual Embedding for Cross-Modal MusicVideo Retrieval through Supervised Deep CCA"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:1908.03744."}