{"as_of":"2026-08-16T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb8d7be94a94c6a8250f1f7a117fcd99c6fc4622690a0379f1cd15245312f99a","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:47:25.822224Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.10534/citation-record","integrity":"/paper/1908.10534/integrity","json":"/paper/1908.10534/citation-record.json","paper":"/paper/1908.10534"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.118924Z","title":"Evaluation of output embeddings for ﬁne- grained image classiﬁcation","venue":null,"work_id":"c84c93ff-94d3-4e04-9080-c827883be9b9","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.447635Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:835d5bb971e2cab603c32b16c22d8e75a0835418d35c84407dd634520b4fa38d","observation_id":"5e213093-dd5b-48d6-ad22-07cc48489788","resolution":{"observed_at":"2026-08-14T10:47:27.124177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.103281Z","title":"VQA: Visual question answering","venue":null,"work_id":"da415ffe-04e4-4069-9371-a7d9bf175601","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.453319Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:fe816bacd094bed24ba09e4df236b9c248954f77c73201ce92a709fad3834e45","observation_id":"1bda83a9-f9f5-4b06-96c5-dcc7294e0fd4","resolution":{"observed_at":"2026-08-14T10:47:27.108531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.087761Z","title":"Curriculum learning","venue":null,"work_id":"75505f81-0b15-4e8a-b61c-cb025dc3546a","year":2009},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.458614Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:88527d702b04cb5fd7b558c7cb2a80d6a29660b4efe16759a3f5de839abe00db","observation_id":"89c62fc9-0040-46b3-8181-74800d201adb","resolution":{"observed_at":"2026-08-14T10:47:27.092882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.071513Z","title":"Deep visual-semantic hashing for cross-modal retrieval","venue":null,"work_id":"5b27b1b5-6316-4cce-938c-b6086e025023","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.464529Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5876d8651d163ba4229bc39ca894be64789e964281b84d7f26937c0e12e91728","observation_id":"7cfe122e-5f73-4164-b2ab-95538506e28f","resolution":{"observed_at":"2026-08-14T10:47:27.076772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.049068Z","title":"Partial adversarial domain adaptation","venue":null,"work_id":"9ab4e682-a076-4ffe-84f7-22f6e042690c","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.470068Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:eb3979131f5939e7029ca4ac84cb78af32bb665ab12d1f050eda11bac5c95c51","observation_id":"d1bd34cb-a02f-43c3-84e3-1b4422a18e1c","resolution":{"observed_at":"2026-08-14T10:47:27.059321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.029858Z","title":"Improving deep visual representation for person re-identiﬁcation by global and local image-language association","venue":null,"work_id":"451fb840-df22-4ff9-9321-47c7687208a5","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.474987Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5031b940d174422feaddeffd5f6b598ae497bf67a985c45e5f7d6a632403b59c","observation_id":"c2ec46fd-0dbf-4ac9-87ab-7d60e83b2c88","resolution":{"observed_at":"2026-08-14T10:47:27.035298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:27.013896Z","title":"Improving text-based person search by spatial matching and adaptive threshold","venue":null,"work_id":"6108e5c7-101f-4549-a5ae-430fb702e2f4","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.479966Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1fe01252862172566d166a9efe237f9c8d70a57455f01eadeecb935fac61622c","observation_id":"dde8ecd2-c407-43c4-9286-77252a524baa","resolution":{"observed_at":"2026-08-14T10:47:27.019054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.997239Z","title":"Beyond triplet loss: A deep quadruplet network for person re-identiﬁcation","venue":null,"work_id":"4d187b27-e60d-471a-9aec-338d1cbe6bf5","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.485180Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:c88dd2787f651643c2b1cc6e1d996e5c6c248f79f641f98fa48ea5d9cbbbad70","observation_id":"603626df-34b6-48b2-915a-8a4a613d8db1","resolution":{"observed_at":"2026-08-14T10:47:27.002916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.981242Z","title":"How to train a GAN? Tips and tricks to make GANs work","venue":null,"work_id":"2148d5d2-110a-4efe-8b9e-02c72588a895","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.489998Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:2c2e84147815bc66fbe1177cf150c115a9fadf98325e2bd8a8f43aabd8368b45","observation_id":"4181f257-6ea1-4347-a91f-8bb9cb8d13b9","resolution":{"observed_at":"2026-08-14T10:47:26.986827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T10:47:25.494828Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.494828Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:06cd2c9f08151d1fba3ab920aac8e0d58eedcdd2a84be7eabd85787bf2c0955b","observation_id":"6d2cedf7-30dd-498f-9d52-3fd136bbf485","resolution":{"observed_at":"2026-08-14T10:47:25.494828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.964334Z","title":"Class rectiﬁ- cation hard mining for imbalanced deep learning","venue":null,"work_id":"e1904392-ec70-47b2-9267-4a666c37f9a7","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.500174Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:e88767add953e6ef79b5e1815918aeb502e0d57204374b3a229aa39b553813b9","observation_id":"42ac48ff-9e65-4233-9fc0-9136c2feca9a","resolution":{"observed_at":"2026-08-14T10:47:26.969793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.948007Z","title":"VSE++: Improved visual-semantic embeddings","venue":null,"work_id":"53c16ab2-c6b7-48d2-a8d1-4aa983236b84","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.505002Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:3eed6593f68245eb3718c3e9af971042a53c4b290d33231be04a3b13a40bdb29","observation_id":"328afce4-67be-465b-9f2c-b90dd14e4ea6","resolution":{"observed_at":"2026-08-14T10:47:26.953156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.931764Z","title":"Unsupervised domain adaptation by backpropagation","venue":null,"work_id":"eeb716bf-6086-49f9-b988-a2b40d6503d7","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.509913Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:b919f9736c23707bdbb7290b167a3aeb59a9894a7f2d62d79fdb168bfb391204","observation_id":"7a14bbec-c011-4774-b6ed-81cf4f02a603","resolution":{"observed_at":"2026-08-14T10:47:26.937108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.915499Z","title":"Generative adversarial nets","venue":null,"work_id":"d389a05e-f491-4a89-93f4-b65fb6261be8","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.514695Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:815147dbb3db460c08b17286226f24d65209b370f127e65f23b8d647faa3e2c5","observation_id":"060b2c0c-ec83-4768-941b-d4510805e222","resolution":{"observed_at":"2026-08-14T10:47:26.920837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.900028Z","title":"Look, imagine and match: Improving textual-visual cross-modal retrieval with generative models","venue":null,"work_id":"0bb9bae0-02d9-4e83-9597-440e8c8bdf5b","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.519728Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:175dfa7ba0c1f14c5f7edff3759cf73cfaf9cbc2c88501ac71d9310bb23ce221","observation_id":"c47dc8d4-e915-45d7-aeb6-7e1fd8f98eeb","resolution":{"observed_at":"2026-08-14T10:47:26.904883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.883998Z","title":"Unsupervised cross-modal retrieval through adversarial learning","venue":null,"work_id":"685e0daf-00a6-4881-98c2-7eed4dee5879","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.524375Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:6cc61177f1d98a77b3743c060a286edc63b0e63c7289f8d8363b9b0056322d27","observation_id":"4efd3688-9730-4040-a0f5-669d3f3d801f","resolution":{"observed_at":"2026-08-14T10:47:26.889720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.868545Z","title":"Long short-term memory","venue":null,"work_id":"bff0c3c6-378a-4e58-ba07-b856a8ff84b9","year":1997},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.529153Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:74623895523e58989b7fd35fec6b3396c412beae5fe4763b5920d023e5c22e36","observation_id":"5b9be873-ee6f-49ac-9b3f-c7838e179dbf","resolution":{"observed_at":"2026-08-14T10:47:26.873186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.853013Z","title":"Learning deep representation for imbalanced classiﬁ- cation","venue":null,"work_id":"1f424482-5356-4aae-8928-3273dcac92f1","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.534101Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:6b1545348a4977b5ca1a993920f9572405db75f41b9671378f4226818789b71e","observation_id":"0d28018c-f5ad-40de-ac77-28cb8c0ccdef","resolution":{"observed_at":"2026-08-14T10:47:26.858144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.836844Z","title":"Bi-directional spatial-semantic attention networks for image-text matching","venue":null,"work_id":"298e66fa-5508-4733-9273-07a0814d7d32","year":2008},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.538786Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5bdee70b476d4e782abdc497a79a32954cce576ef9a40061d6282f031bd0fd1c","observation_id":"2cbf248d-4a87-4b41-b5b2-d0304ba56430","resolution":{"observed_at":"2026-08-14T10:47:26.842172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.820520Z","title":"Instance-aware im- age and sentence matching with selective multimodal LSTM","venue":null,"work_id":"283b7966-4faa-457c-87b9-7335316c5bf1","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.543902Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1dc997719f9c43b35d7119c92b66c94adc97f7a1ef2ab092a991227f7ed3e466","observation_id":"efe864af-0ab9-422c-94a8-76038bdaa2e4","resolution":{"observed_at":"2026-08-14T10:47:26.825853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.804963Z","title":"Learning semantic concepts and order for image and sen- tence matching","venue":null,"work_id":"d1e70105-400c-4539-8566-c2608fbb5e19","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.549136Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:b3305c2af5aeb2592a3f3e2ea404f278c2c46ea2028aba45e94109d3c7965b4c","observation_id":"1580d3b3-974e-46b1-9220-3d889e44d014","resolution":{"observed_at":"2026-08-14T10:47:26.810056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08440","last_updated":"2019-11-27T03:03:21Z","snapshot_observed_at":"2026-08-14T18:24:59.614251Z","submitted_at":"2018-09-22T14:18:41Z","title":"Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search","version":3},"cited_work":{"arxiv_id":"1809.08440","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.08440","snapshot_observed_at":"2026-08-14T10:47:25.978839Z","title":"Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search","venue":"cs.CV","work_id":"81532e90-e366-473e-aeb9-c64564c49f36","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.554205Z"},"links":{"cited_paper":"/paper/1809.08440","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ccd32b45381e196df2f29f96a87e07e64f6f9be94eb1890eb9e11c9671083c05","observation_id":"eb51cf19-f456-44ef-9c02-c9e6ab0cbfb6","resolution":{"observed_at":"2026-08-14T10:47:25.984639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.789187Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"ad385ee4-4562-4b61-bdae-6c3603bdd98a","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.559316Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:da29c596d6c4e8f42372cd6e34253b0847a956e290e4b7ccd0af184947d604ae","observation_id":"00b0eb93-f9cf-4966-8a4e-24092bdfd008","resolution":{"observed_at":"2026-08-14T10:47:26.794296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T10:47:25.564546Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.564546Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:b4febeb734680ac9ad610f6893aa60d1f384f8d9e2c12061c7015a2dcd2e2b3c","observation_id":"83346346-8060-4778-8a7c-cc408e82f637","resolution":{"observed_at":"2026-08-14T10:47:25.564546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.773246Z","title":"Asso- ciating neural word embeddings with deep image represen- tations using ﬁsher vectors","venue":null,"work_id":"6120cbb4-c27d-4f5e-a84e-e88110506203","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.570271Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1418027b95c26f9c96fde3e01717b88a540e4519fe62742fa3b5876a93d5029e","observation_id":"e5b5f5d7-04e1-4d4b-85b7-1561adc9b8a8","resolution":{"observed_at":"2026-08-14T10:47:26.778824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.757092Z","title":"Self-supervised adversarial hashing networks for cross-modal retrieval","venue":null,"work_id":"cd21d0e8-1537-47a2-97bd-80bd6a620ed2","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.575388Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:b9dc9aa4cd198962724485492ef83fc117a0736e8bc63f33df1e294a12ef2d0d","observation_id":"e1c57e7c-d209-435f-8a6a-2fb3dd2de2f5","resolution":{"observed_at":"2026-08-14T10:47:26.762710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.739015Z","title":"Identity-aware textual-visual matching with la- tent co-attention","venue":null,"work_id":"8a27ecba-8079-4dd1-8aef-0df6f0fdfd93","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.580422Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ce46d93f4f1d452aa3834fa80f65e2b1ed4b282ef945f323067b58ed06a5904d","observation_id":"29637dfb-486a-4336-a83f-5e3fa5d3f24c","resolution":{"observed_at":"2026-08-14T10:47:26.745081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.722873Z","title":"Person search with natural lan- guage description","venue":null,"work_id":"f000b86d-1f4d-4894-b9b9-6cb95020def7","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.585291Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:667dd26e2937306316c6e741c9662227f963c2a26cbc95fd3d9b879107a888c8","observation_id":"c553a3ab-d922-4d93-9edc-ca2553cdcc14","resolution":{"observed_at":"2026-08-14T10:47:26.728140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.706849Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"d85cf058-b9dd-413c-b628-4e168882c30d","year":2014},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.590480Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:606bd7d9ac85b66ae4155a0691d6bb0cc6891015edb7ecc9af77bb8887a075b2","observation_id":"10a7048c-5d67-4708-add4-a6dec3fa807f","resolution":{"observed_at":"2026-08-14T10:47:26.712155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.691246Z","title":"Leveraging visual question an- swering for image-caption ranking","venue":null,"work_id":"b49b630c-0a57-421b-b2bc-1acd47351c0a","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.595876Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:0c28571fd58580700c5177699e12a6e8b77223b41d66bfad8e7570322f6289e2","observation_id":"459de293-01f7-4f46-993a-75e8fa349c48","resolution":{"observed_at":"2026-08-14T10:47:26.696491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.674794Z","title":"A neighbor-aware approach for image-text matching","venue":null,"work_id":"2efde940-c41f-4656-a89c-7b7dc791833b","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.601000Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:82aa9ae96e567052bae00dc6161c43cf0856f730e32cae3d31295febdbbe2c4c","observation_id":"c864911f-2a71-4963-b59b-ce1748c3a9db","resolution":{"observed_at":"2026-08-14T10:47:26.680217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.657323Z","title":"Sphereface: Deep hypersphere embed- ding for face recognition","venue":null,"work_id":"26bbdeab-8060-4b42-9123-80fc20677691","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.607524Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:c8f58784f838c7f83371b6fe608983fbe0321193dc846515ae97f0f3e118450a","observation_id":"e0cd1e31-6c7a-4c96-b8b4-3805eb72ec83","resolution":{"observed_at":"2026-08-14T10:47:26.662837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.641972Z","title":"Learning a recurrent residual fusion network for multimodal matching","venue":null,"work_id":"3a67fe59-48ce-4337-87ce-6c623c26f0b7","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.612689Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:bbccbaee894a0de80a1a62c6c9de3d889a5d6b5f1f7e71c1c28aed08e6b5ff57","observation_id":"2eb77bc6-0eb1-4d5a-9947-10f86e1e2708","resolution":{"observed_at":"2026-08-14T10:47:26.646909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.626237Z","title":"Mul- timodal convolutional neural networks for matching image and sentence","venue":null,"work_id":"07ea33a3-5012-4228-b393-ddb70cc848af","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.617618Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:fee470c2a50880fa96cb94dc8b4e17a09fc436cc1fa9c55de84515008fa43c6b","observation_id":"a4377aaf-a9c4-41f2-92b7-c55d5bb9dade","resolution":{"observed_at":"2026-08-14T10:47:26.631168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.610773Z","title":"Deep captioning with multimodal recurrent neural networks (m-RNN)","venue":null,"work_id":"14458855-8f02-4015-9add-dd269e311753","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.622798Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1932e3b5072a9aa427cccf3a7ea07084a332245349a65f43ee4fb726dc34d61e","observation_id":"5ab8a181-3792-40e4-a373-c157979c1804","resolution":{"observed_at":"2026-08-14T10:47:26.615758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.595202Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":"373d2ad2-64a3-416f-9a63-66e081a02c62","year":2013},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.627703Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:b438906488dbd1f67a3dfa6926205c73110fb1b7006dd93cafe8ddedc309776a","observation_id":"34194aee-ca0e-4c75-8b2e-03165de37240","resolution":{"observed_at":"2026-08-14T10:47:26.600295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.578361Z","title":"Learnable PINs: Cross-modal embeddings for person iden- tity","venue":null,"work_id":"79a1fe0c-3328-4771-a246-c4f092e05817","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.632807Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:8cf695ca90a4dc4f0ed9d01d13ad88fc1f45a692ef945fb473ed117c0773c8ad","observation_id":"b882893b-e753-4e5e-8620-1fa7253a9b86","resolution":{"observed_at":"2026-08-14T10:47:26.584240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.561824Z","title":"Dual attention networks for multimodal reasoning and matching","venue":null,"work_id":"9b402ee2-e0d5-4aa8-93cc-c8fc08da3c4a","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.637459Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:423c0ada2022749d6daaafb91b7cf13847bd7c4bf50f32d30ad46dabff9767d3","observation_id":"e3ec94cc-eeba-42cd-8b9d-b0a02185df62","resolution":{"observed_at":"2026-08-14T10:47:26.566843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.545688Z","title":"Cm-gans: cross-modal genera- tive adversarial networks for common representation learn- ing","venue":null,"work_id":"9bcd5e10-8d87-4773-8f59-f3322b18bc57","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.642292Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:0bc798074cb44ba8cff8ce0f41acd0936722316d61eba65219bccd2246173705","observation_id":"714f20cc-b054-4402-9cad-160a5cf14321","resolution":{"observed_at":"2026-08-14T10:47:26.550984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.529501Z","title":"Deep contextualized word representations","venue":null,"work_id":"1a5382e0-dfd9-4483-8862-5526df7e1f45","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.647342Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1e9ede54dba596a90a38fc6fc43c68518babae1c24cbea016149191bc0e9903b","observation_id":"90659941-0879-4284-8990-7da62ebcb5d3","resolution":{"observed_at":"2026-08-14T10:47:26.534529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.512757Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"57ecc727-f46b-4495-960d-75edc9a7e1e9","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.652388Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:a22126c8ad4bfeba793b7843e970db92714c46f6abf07970b4c5564394edcbec","observation_id":"8f757e16-94c4-42fb-ab70-0e31b9900125","resolution":{"observed_at":"2026-08-14T10:47:26.518111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.496429Z","title":"MirrorGAN: Learning text-to-image generation by re- description","venue":null,"work_id":"2acd88cb-34a2-46f6-9fcf-9abb8d053a5b","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.658461Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:905731d17b8d0e8ed29d400ff7535628470ff2b465774f87b435c1f643023c19","observation_id":"98b4b943-00de-4588-a475-6f9aff56e535","resolution":{"observed_at":"2026-08-14T10:47:26.501737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:25.663249Z","title":"Improving language understanding with unsuper- vised learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.663249Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:4010dab1c19957d0065bc41cd1556b0142c1ab4ae3f18160953e0e6f47f81559","observation_id":"5e252971-fba3-43b8-a2f8-a680906a5410","resolution":{"observed_at":"2026-08-14T10:47:25.663249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.470171Z","title":"Learning deep representations of ﬁne-grained visual descrip- tions","venue":null,"work_id":"c8c27caf-6c88-4db4-880b-202fba79c18c","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.668076Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:1258375cb220f2b65e0870325a3ce33c0c37adedd91bf11414630af0e195fab8","observation_id":"02a71180-cdff-4ebd-ad46-67ba96e5e2d8","resolution":{"observed_at":"2026-08-14T10:47:26.475119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.454145Z","title":"Cur- riculum learning for multi-task classiﬁcation of visual attributes","venue":null,"work_id":"0f850bb6-b539-4b98-a269-d34a73a92e1c","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.673146Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:b8356d411c0fd821eb4797f8746d1dc085683b0fbe93f894e080ba79f0abfdaa","observation_id":"17259303-cc29-4588-9a76-f34961909d7b","resolution":{"observed_at":"2026-08-14T10:47:26.459714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.438438Z","title":"Cur- riculum learning of visual attribute clusters for multi-task classiﬁcation","venue":null,"work_id":"87457554-8ad0-4b52-8379-f6c5504bcfdf","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.677885Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:42e806a466a9d1ebe5209fd1c2cb73398c93b4355ce37b10897c89bab0500ea5","observation_id":"7c0a53a3-3580-4133-a332-8a28dc14209d","resolution":{"observed_at":"2026-08-14T10:47:26.443914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.423163Z","title":"Deep imbalanced attribute classiﬁcation using visual atten- tion aggregation","venue":null,"work_id":"1c64fde3-0aba-4a22-b62a-bf7d5104d6bf","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.682505Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5ae47e6919c2073895001d2e465aff558e851ff253bbe419d001cce0502c0921","observation_id":"901523ab-e731-4a88-b99c-6f83d6941101","resolution":{"observed_at":"2026-08-14T10:47:26.428099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.407369Z","title":"Facenet: A uniﬁed embedding for face recognition and clus- tering","venue":null,"work_id":"84116737-7c06-470b-8fbd-d39ca8c63b2d","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.687743Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:f381bce9fecae3597dd0ff02a80277267d6f2f567e80e6e6e9c69f6ac68aa85f","observation_id":"6031bba0-2f59-4950-9d6a-f897a8957095","resolution":{"observed_at":"2026-08-14T10:47:26.412490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.391786Z","title":"Video google: A text retrieval approach to object matching in videos","venue":null,"work_id":"e9691d23-ad99-4041-8ae0-fa38f6278871","year":2003},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.692329Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:937ba1e2da86b3d9afaa1cb9d849902702937585a83f5acf2e8b7281caeed6bd","observation_id":"3755febd-d215-4f72-838d-4c8e037c0409","resolution":{"observed_at":"2026-08-14T10:47:26.396796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.375518Z","title":"Improved deep metric learning with multi- class n-pair loss objective","venue":null,"work_id":"8cc35377-8083-4829-82a9-48c643af853a","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.697003Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:fbc19700f82e9f149eeda93f2ac32786658e172ba3dce774b455698e01e1dd21","observation_id":"3e6b5a59-57f4-4baa-ba3c-040e7823244a","resolution":{"observed_at":"2026-08-14T10:47:26.381087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.359265Z","title":"Polysemous visual- semantic embedding for cross-modal retrieval","venue":null,"work_id":"dd409fa9-a91b-44f6-9b8c-65accdf70481","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.701765Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:17504bb2e1fa6d797630d7f754e5a2be0e78b9460533bb53a66aae908efb8d6d","observation_id":"87f8e74b-c3b7-4c72-9168-ea20f362eeb7","resolution":{"observed_at":"2026-08-14T10:47:26.364325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08616","last_updated":"2020-03-02T17:08:34Z","snapshot_observed_at":"2026-08-14T17:26:15.893720Z","submitted_at":"2019-01-24T19:19:31Z","title":"Boosting Standard Classification Architectures Through a Ranking Regularizer","version":3},"cited_work":{"arxiv_id":"1901.08616","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.08616","snapshot_observed_at":"2026-08-14T10:47:25.932446Z","title":"Boosting Standard Classification Architectures Through a Ranking Regularizer","venue":"cs.CV","work_id":"fbd17dd0-9f2a-4f32-8aef-5cfe032283a3","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.706885Z"},"links":{"cited_paper":"/paper/1901.08616","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:f7ec76073a1d06a69f7fa757e204a19f46c6738ce047cce5dde459499ea529d6","observation_id":"393f018c-b7fe-48f7-9b97-29f3696bcbd8","resolution":{"observed_at":"2026-08-14T10:47:25.941177Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.343529Z","title":"Simultaneous deep transfer across domains and tasks","venue":null,"work_id":"e9792649-520e-47d2-8014-c16857bc9cb2","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.712752Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:29e6d33ded26888103e4a42082b4943073424889c52df6aa92b11cd664571e58","observation_id":"e771b105-e84d-49cc-ba5f-3928ee4e69c0","resolution":{"observed_at":"2026-08-14T10:47:26.348676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.328015Z","title":"Learning deep embeddings with histogram loss","venue":null,"work_id":"e38cf756-3ecf-4384-b54f-b3e5138a45ee","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.717862Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:2de9b66b879ba41b45db463e40bf1c8d72b9fb691a3080bf6a3b5dcb1ada8954","observation_id":"8d5940ef-a144-4723-94f1-74b69dcb07f4","resolution":{"observed_at":"2026-08-14T10:47:26.333228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.311545Z","title":"Attention is all you need","venue":null,"work_id":"883f414f-578a-418b-8f78-95cf73270b11","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.722734Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:2a4303cc8e60e96d10d9537f9e79e4d7ad6b9b8f27c014dcd1d7663e944a9911","observation_id":"77d07bf8-b3fb-41fb-a216-c567fa20d595","resolution":{"observed_at":"2026-08-14T10:47:26.316580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.295468Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"58ab87f1-15c4-49fd-9bf9-80ceca51186a","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.727354Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:deb1a30c65be5c014be255b02ec75748aa6de8c51a4f3ebce889e3db4bb04f54","observation_id":"d83f70f2-f718-4cb6-a0d4-aefe27da0af1","resolution":{"observed_at":"2026-08-14T10:47:26.300862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.279140Z","title":"Adversarial cross-modal retrieval","venue":null,"work_id":"5a329179-9a48-4098-88ee-ba04ed17abea","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.732761Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:6d0f00b6fef16108475f6b09005cd0093e13add95cec357b28ccd68344fb156b","observation_id":"29230eef-74ff-4be1-b209-e7e2d91fa404","resolution":{"observed_at":"2026-08-14T10:47:26.284393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.263259Z","title":"Normface: l 2 hypersphere embedding for face veriﬁ- cation","venue":null,"work_id":"4d6f6195-97f4-428f-a966-f7965916713a","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.738438Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:ea0976245f87e8d904fda27953acfb1ea8ab7b1a51cd5906a2e4aa88f42714dc","observation_id":"5e4da735-8a23-4e37-9d94-f092c7a9484b","resolution":{"observed_at":"2026-08-14T10:47:26.268290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.245978Z","title":"Learning deep structure-preserving image-text embeddings","venue":null,"work_id":"3d4e5918-7ef0-4073-837b-d983ac395cff","year":2016},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.743114Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:00c435e4f51cf83a7ec6aa5292e5c57e561e60156a584209e126330607329f5c","observation_id":"05cb247a-0b19-4a07-8437-7d336161e702","resolution":{"observed_at":"2026-08-14T10:47:26.252269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.229440Z","title":"Joint global and co-attentive represen- tation learning for image-sentence retrieval","venue":null,"work_id":"0e41df89-f540-4a43-8235-28f9956c7d05","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.747915Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:eebf7d402bd0409191a2aad4a78cce4ebbd9807d6c899c87ca03a88667940d6f","observation_id":"1fa46f48-b9e1-4949-8101-596e7c01f177","resolution":{"observed_at":"2026-08-14T10:47:26.234538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.213496Z","title":"Multilevel language and vision integration for text-to-clip re- trieval","venue":null,"work_id":"2caa93d2-17c1-40ac-8085-39b7919c5187","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.753059Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:bdf52cd9048b952024d30b8c598c57b11ded54cbb03c247b79f557d5b9eb2c37","observation_id":"fe1016af-796b-4226-9b78-68512094e660","resolution":{"observed_at":"2026-08-14T10:47:26.218505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.195594Z","title":"Attngan: Fine- grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":"daf626ed-7e22-4bc0-84bf-8fe002d5a044","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.757864Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:6a5949e54ec77731001c81441e19090c46a498ada696ead2e6d5b16a9ae34620","observation_id":"205ed384-1f99-4a09-aeb8-4093a68e3a60","resolution":{"observed_at":"2026-08-14T10:47:26.201198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.178778Z","title":"Deep adversarial metric learning for cross-modal retrieval","venue":null,"work_id":"49fd9243-dbcb-4e19-bfe7-31d960f6c9de","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.762447Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:843643b875b1553093c9e187002e97f708fdedce13ee7534c346a7bbe8297983","observation_id":"4ba08573-8fa5-407f-87eb-9023825e7bf5","resolution":{"observed_at":"2026-08-14T10:47:26.184341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.162570Z","title":"Evaluation of a 3D-aided pose invariant 2D face recognition system","venue":null,"work_id":"581effc8-1562-4b0a-a805-782879f823b3","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.767176Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:28e1ee2f641d2efd64134d419e6a24aeda2e4b934caf54d96e194655450de574","observation_id":"23ce2771-e729-4728-98fd-23e5315dbeac","resolution":{"observed_at":"2026-08-14T10:47:26.167723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.146432Z","title":"d-SNE: Domain adap- tation using stochastic neighborhood embedding","venue":null,"work_id":"e5fee5a3-53e7-4001-bbc0-55881d4fd65b","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.772167Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:056b061aa5172a1ac41b797063c150a65d572bd7e8e7f7acb7c167728deb60c3","observation_id":"5419cee9-009a-47aa-ba4a-bb9b8cafc7be","resolution":{"observed_at":"2026-08-14T10:47:26.151402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.129337Z","title":"Deep correlation for matching images and text","venue":null,"work_id":"1ff15eb1-0a86-470d-9105-49cfa2cfbb6d","year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.777113Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:9419803849d544316d283e3ad4b243227f33d3aa9d1bf9448e3e3725373f666e","observation_id":"c4678ad7-137d-474d-acbe-fef47ae86a5f","resolution":{"observed_at":"2026-08-14T10:47:26.135034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:25.782027Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.782027Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:944f33eaa0be98d33c26889664aa4fa5d4b7a841eab2026de7e8407f166586f6","observation_id":"967b307f-8b1c-493f-a9aa-513ef45ba84f","resolution":{"observed_at":"2026-08-14T10:47:25.782027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.100867Z","title":"Cross-modal and hierarchical modeling of video and text","venue":null,"work_id":"172cb218-1848-4ff3-a8f3-92cdc9b1dab4","year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.786753Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:5ac8498a00d777dbfe24bf72f852985404e6270c736f43ba95ad1cdbe1c87c42","observation_id":"ccafdcd6-8a0c-41b9-947b-55f0e264a5cf","resolution":{"observed_at":"2026-08-14T10:47:26.107039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00087","last_updated":"2019-05-17T23:15:57Z","snapshot_observed_at":"2026-08-14T17:50:19.265807Z","submitted_at":"2018-11-30T23:04:10Z","title":"MAN: Moment Alignment Network for Natural Language Moment Retrieval via Iterative Graph Adjustment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.00087","snapshot_observed_at":"2026-08-14T10:47:25.791817Z","title":"Man: Moment alignment network for natu- ral language moment retrieval via iterative graph adjustment","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.791817Z"},"links":{"cited_paper":"/paper/1812.00087","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:758c33d4e8ed4ea3eb1649256c78951a45a864113a4a09a91f3309942411e20d","observation_id":"c72ec8c4-f433-4edf-ab3f-0cfd0cf0917c","resolution":{"observed_at":"2026-08-14T10:47:25.791817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.082255Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"117112d2-d370-49f0-8bc1-db6a154989f2","year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.796846Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:19c9ca835a22505a743e06ef94d7b2773a11b6d428bcbc08260f2cbbec9ac4a7","observation_id":"153d570f-6054-4473-b1fe-cf5287c634ea","resolution":{"observed_at":"2026-08-14T10:47:26.087947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.061161Z","title":"Deep cross-modal projection learning for image-text matching","venue":null,"work_id":"f5628317-c20f-4a39-b486-ac61e7c5f458","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.801464Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:2d3ce853119c35ac2b257e14c2a994dca66e5aa183df50771327f884a260d7d7","observation_id":"728443bb-f9bf-4a5b-9942-a4e9c822a7cd","resolution":{"observed_at":"2026-08-14T10:47:26.070212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05535","last_updated":"2021-07-27T07:45:26Z","snapshot_observed_at":"2026-08-14T20:13:29.131358Z","submitted_at":"2017-11-15T12:40:11Z","title":"Dual-Path Convolutional Image-Text Embeddings with Instance Loss","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05535","snapshot_observed_at":"2026-08-14T10:47:25.810913Z","title":"Dual-path convolutional image- text embedding with instance loss","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.810913Z"},"links":{"cited_paper":"/paper/1711.05535","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:7ca8a986717b236add4fc1ef7925a6df4728922a4e47acae1712f83c4b71603a","observation_id":"6b28dac3-76b1-4bfb-8d07-437843ed5c37","resolution":{"observed_at":"2026-08-14T10:47:25.810913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02167","last_updated":"2015-12-15T05:17:49Z","snapshot_observed_at":"2026-08-14T22:19:39.710069Z","submitted_at":"2015-12-07T19:00:54Z","title":"Simple Baseline for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02167","snapshot_observed_at":"2026-08-14T10:47:25.816926Z","title":"Simple baseline for visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.816926Z"},"links":{"cited_paper":"/paper/1512.02167","citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:e6c80754b8f9f38d4a4f70afc489bb3b723bed2cf1d96d12cba09df3f8cbf80a","observation_id":"693a215d-86c1-49b6-92b3-a46ac9131ed1","resolution":{"observed_at":"2026-08-14T10:47:25.816926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.019200Z","title":"R2GAN: Cross-modal recipe retrieval with generative adver- sarial network","venue":null,"work_id":"4430e42b-25e8-4ebc-8f52-addfa9517ada","year":2019},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.822224Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:a9edb5cd94c6cc379bee7e011da4dceb31e689de5a9d031251a281588d7504f2","observation_id":"de35d3e4-1003-4567-9bd5-218d88ef8460","resolution":{"observed_at":"2026-08-14T10:47:26.025297Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:47:26.038378Z","title":null,"venue":null,"work_id":"c4914389-ad27-442e-8648-fb2d630edd90","year":null},"citing_paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T10:47:25.806242Z"},"links":{"citing_paper":"/paper/1908.10534"},"observation_digest":"sha256:2a2bf298b5a40439e7ef81e69589a91415bc282a860b15a3e26c36b64eb8fc36","observation_id":"96237542-414a-4caa-85e8-95744dbc61cc","resolution":{"observed_at":"2026-08-14T10:47:26.046191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.10534","last_updated":"2019-08-28T03:25:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:38:43.273006Z","submitted_at":"2019-08-28T03:25:13Z","title":"Adversarial Representation Learning for Text-to-Image Matching"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":64},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:1908.10534."}