{"as_of":"2026-08-16T18:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12595bf9d04f10ad2242bdf8be162d587723a25b8b4b58fe7a5599b796d5e3d0","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:16:24.593576Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.07673/citation-record","integrity":"/paper/1908.07673/integrity","json":"/paper/1908.07673/citation-record.json","paper":"/paper/1908.07673"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.783614Z","title":"Automatic music soundtrack generation for outdoor videos from contextual sensor information,","venue":null,"work_id":"6d0f3005-1bdd-44cf-a8d5-2a441e049325","year":2012},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.546392Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:297d89fe2db5a540acd44923361edd72c708c8e7168e18ad0560c9425caba015","observation_id":"d238aa03-55ca-4e6e-8129-71be889206dc","resolution":{"observed_at":"2026-08-14T12:16:24.787979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.768837Z","title":"Learning from between- class examples for deep sound recognition,","venue":null,"work_id":"0f59f2fb-3d3b-4095-9ede-04834c189a8a","year":2018},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.551304Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:9c6aa310c162f088cb493509048c82058c40dc08910f8225924fc6acf4f2b28c","observation_id":"9b1efe76-7671-4a67-86df-9f1ab3ba81af","resolution":{"observed_at":"2026-08-14T12:16:24.773698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.756897Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"f4c4ca99-d751-41b9-b311-ad5adf3f2580","year":2017},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.555184Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:e678b4d9675278d2e2831edbbb1edf6b7d7386afc7d2ce9a301b645526a2ad57","observation_id":"e03d3be8-3935-4476-ac10-8b7ef7242f62","resolution":{"observed_at":"2026-08-14T12:16:24.760890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.744874Z","title":"Learnable pooling with context gating for video classiﬁcation,","venue":null,"work_id":"fd11844c-1577-47ed-93ad-06060fe183bc","year":2017},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.559381Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:9f575c641a6ff4228bd930a6db709147f7a0b54a6d230d2a996264c704847d0b","observation_id":"b5fc887b-d16d-4dfb-a876-6bf09d20996e","resolution":{"observed_at":"2026-08-14T12:16:24.748867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.732315Z","title":"Canonical corre- lation analysis: An overview with application to learning methods,","venue":null,"work_id":"4d4a7bda-9c84-4e38-b66a-f4bd72e49172","year":2004},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.563378Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:a6c4fbc703a3b83df8fcc6ee1e0406bd3ad2bc548ca370cbed1b43a9cc431c15","observation_id":"fc98061d-f465-4767-b891-f5e8b9ce0585","resolution":{"observed_at":"2026-08-14T12:16:24.736801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.718502Z","title":"Deep cross-modal correlation learning for audio and lyrics in music retrieval,","venue":null,"work_id":"7bb12f0d-f979-4e88-9303-cb7dbaad824b","year":null},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.567716Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:f465dc4b9f520d0c4dea29c6ba32ffabe3e7753c6a6e61c44172266ae807a445","observation_id":"76428757-470b-479c-b050-2776bb5f2875","resolution":{"observed_at":"2026-08-14T12:16:24.723292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.704279Z","title":"Deep canonical cor- relation analysis,","venue":null,"work_id":"159ffd76-21f2-4863-a068-e9557a9381f7","year":2013},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.571545Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:1caea7cc5173893f670d0fdc74cce4eb131757ce5a43d2019a73f5605938e6b3","observation_id":"5cedddd4-a1fc-4aff-8323-da6f08938d47","resolution":{"observed_at":"2026-08-14T12:16:24.709204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.690512Z","title":"Cluster canonical correlation analysis,","venue":null,"work_id":"ac58f5d5-8bcb-431e-88fa-4fcf006fb780","year":2014},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.575675Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:6c5986c1d6d02ad005a29f0ccb909c0af4336ecaae2d3e5b0c9df66e4cf67fcf","observation_id":"ed8844c9-040a-4842-b7c6-67c28acdf6d1","resolution":{"observed_at":"2026-08-14T12:16:24.694975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.675468Z","title":"Category-based deep cca for ﬁne-grained venue discovery from multimodal data,","venue":null,"work_id":"02a45a9a-f5e3-45d2-b68f-8cd08f2f87d5","year":2019},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.580262Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:f239546731cd005923c9d4f8df96eb10c5ce55f2503e0e786e7bf9cca7ca9bba","observation_id":"c76dbd56-44b0-4b03-a822-71db1087e6af","resolution":{"observed_at":"2026-08-14T12:16:24.680522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.662077Z","title":"Visual to sound: Generating natural sound for videos in the wild,","venue":null,"work_id":"f3e4bc02-2298-4780-b25e-656d02d26f37","year":2018},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.584317Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:3551e5c2c26f63ef48afa3bfef63953e84a16d2d46422b200a607dc867511093","observation_id":"4e9ec701-28e4-4067-bac8-fcba0c4e53a2","resolution":{"observed_at":"2026-08-14T12:16:24.666533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T12:16:24.648889Z","title":"Audio-visual embedding for cross- modal music video retrieval through supervised deep cca","venue":null,"work_id":"30967eba-68f2-4968-bf00-48a17c6c2c59","year":2018},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.588888Z"},"links":{"citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:da0c7558ffceea4547805350c7bb6c2fcd99cfe02eada79b92d00c7ccaa20ad0","observation_id":"1e2aac7b-6bc8-415a-901f-15fff455c26d","resolution":{"observed_at":"2026-08-14T12:16:24.653526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03737","last_updated":"2021-05-05T17:07:43Z","snapshot_observed_at":"2026-08-16T02:25:15.919727Z","submitted_at":"2019-08-10T12:03:48Z","title":"Deep Triplet Neural Networks with Cluster-CCA for Audio-Visual Cross-modal Retrieval","version":3},"cited_work":{"arxiv_id":"1908.03737","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.03737","snapshot_observed_at":"2026-08-14T12:16:24.630242Z","title":"Deep Triplet Neural Networks with Cluster-CCA for Audio-Visual Cross-modal Retrieval","venue":"cs.MM","work_id":"91a67e03-8722-46fd-81d0-b0d999a9c1fa","year":2019},"citing_paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T12:16:24.593576Z"},"links":{"cited_paper":"/paper/1908.03737","citing_paper":"/paper/1908.07673"},"observation_digest":"sha256:3180a2e2b190bd77f7b10d3c8557b06b78e56b2ca308e43c2598c4e628241612","observation_id":"eac51361-2138-49b5-9d5f-a0a244d53a8b","resolution":{"observed_at":"2026-08-14T12:16:24.638969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.07673","last_updated":"2019-08-21T02:04:18Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-14T11:57:48.382261Z","submitted_at":"2019-08-21T02:04:18Z","title":"Learning Joint Embedding for Cross-Modal Retrieval"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:1908.07673."}