{"as_of":"2026-08-08T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d5777db7ad73add5ba6453badd0fec1b5a542d87d193dfe27265915745791da","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:29:26.022916Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10575/citation-record","integrity":"/paper/2506.10575/integrity","json":"/paper/2506.10575/citation-record.json","paper":"/paper/2506.10575"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.731807Z","title":"Flamingo: a visual language model for few- shot learning.Advances in Neural Information Processing Systems, 35:23716–23736, 2022","venue":null,"work_id":"d9325859-7a20-4160-af23-fd3afe851a2a","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:20.912833Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:24070aee6fd717c6883b2b1c9938843cec0175709df1154d3fba8d72feea8f6f","observation_id":"24aece88-8079-4a30-ba7c-32df2a373b82","resolution":{"observed_at":"2026-08-07T04:29:33.806086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.592564Z","title":"Laso: Label-set operations networks for multi-label few-shot learning","venue":null,"work_id":"2f0b53b3-0d77-4b4f-966c-eee8a963fba0","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:20.985698Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:89d3618d386eea724c910a9abe1db7ef76efca73eb8082931b7c6000a44bf20d","observation_id":"1552687b-5962-46d6-aecc-2cb2e60d956b","resolution":{"observed_at":"2026-08-07T04:29:33.647913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.446468Z","title":"Structured semantic transfer for multi-label recognition with partial labels","venue":null,"work_id":"e3bec574-5dfc-4156-aa91-457637a9b7ba","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.065735Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:52025ee7091578a7299c574be82ecf20f2e835726b072648797cba4c36acd81c","observation_id":"5efae362-3a40-4e91-b222-daec85b6a6d3","resolution":{"observed_at":"2026-08-07T04:29:33.518040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:33.194849Z","title":"Recurrent attentional reinforcement learning for multi-label image recognition","venue":null,"work_id":"f38f7a0b-230b-4432-a854-b7f7a2a2d4fe","year":2018},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.140117Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:446bcfc8b1d07781378765589c13fd3d5de9bc82e901f4b398afd03906106390","observation_id":"a6051b62-25ce-4961-a61e-9d26f9b257e2","resolution":{"observed_at":"2026-08-07T04:29:33.309046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.935915Z","title":"Learning semantic-specific graph representation for multi-label image recognition","venue":null,"work_id":"e4203bfa-e044-4d2d-91c8-b49e0fc787b1","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.302799Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0b24cc4b9540a71693db65c7776145bba3e34fb88eaef820f7eafdd7c1b306b2","observation_id":"048f16a2-88e9-4802-8a94-4b8d63e5d365","resolution":{"observed_at":"2026-08-07T04:29:33.067742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.661385Z","title":"Multi- label image recognition with graph convolutional networks","venue":null,"work_id":"8011913c-95e8-4c17-a150-bac7830f8214","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.394607Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:e5ca4634c8349c97e39b3e9b6c858a20f9e6e97dceb41113d0aeba18be62c825","observation_id":"39eed48b-0cdf-4cb1-824d-24101b2bda98","resolution":{"observed_at":"2026-08-07T04:29:32.749727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:21.467483Z","title":"Stargan v2: Diverse image synthesis for multiple domains","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.467483Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:c8d8bd2f21edee10606e7cb4449877c1979c18ebf0ebda9165cea543afd47783","observation_id":"235e497b-5f42-4b70-a15f-61e19b4031f5","resolution":{"observed_at":"2026-08-07T04:29:21.467483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.335862Z","title":"Nus-wide: a real-world web image database from national university of singapore","venue":null,"work_id":"78c3e094-dcc6-426d-99af-36500038c481","year":2009},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.545489Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:65af835940d03f11d6612b9cb51ea3fde037743ea13f9e36adc7e141f55045bb","observation_id":"5945c96b-80b9-4135-8f0b-7f51c38f2fa0","resolution":{"observed_at":"2026-08-07T04:29:32.482326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02390","last_updated":"2023-08-20T13:08:34Z","snapshot_observed_at":"2026-07-06T14:00:01.450718Z","submitted_at":"2022-10-05T17:05:56Z","title":"Bayesian Prompt Learning for Image-Language Model Generalization","version":3},"cited_work":{"arxiv_id":"2210.02390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.02390","snapshot_observed_at":"2026-08-07T04:29:27.454953Z","title":"Bayesian Prompt Learning for Image-Language Model Generalization","venue":"cs.CV","work_id":"af65bf33-0c9c-460d-8f31-b89a71c0445f","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.628262Z"},"links":{"cited_paper":"/paper/2210.02390","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:7bbf3cbfb6c2a5583b9a073de8f41912cb380b77fa6fbd810396190001265a04","observation_id":"e41dbda1-01c0-46d6-9b8d-a374b62d3df8","resolution":{"observed_at":"2026-08-07T04:29:27.519841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.177234Z","title":"Learning a deep convnet for multi-label classification with partial labels","venue":null,"work_id":"1eb4c916-d320-42f4-ab39-53a39c595f78","year":2019},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.708820Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:66691f01f5dc26283e15fe47440cd4ef38223af45c32cdab1d5e72a3a741a0cb","observation_id":"422915f3-7be1-4344-8f8b-0645292626ed","resolution":{"observed_at":"2026-08-07T04:29:32.223302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:32.045732Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"633b69b6-4e0d-4515-8040-4437ad0e231e","year":2010},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.758256Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:499749d75e76c246e5815654c61a2d3d92770cb1fc39971840c8a8c328fb72bc","observation_id":"1dea58b2-387b-4247-b1cb-07baa7981e5a","resolution":{"observed_at":"2026-08-07T04:29:32.110623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.921836Z","title":"Learning federated visual prompt in null space for mri reconstruction","venue":null,"work_id":"27b63fa5-cf80-481d-ae2c-1c1cf879d02d","year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.841049Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:cfebe7180e1a2a037179f05280473d916b5944bffaff5b085855b434c3b40433","observation_id":"df16fc1f-6483-4425-bf26-883dbb59b702","resolution":{"observed_at":"2026-08-07T04:29:31.979476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.738302Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tuning","venue":null,"work_id":"011b2144-533f-42bf-843f-7f87a878f117","year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:21.916666Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:9e30c008781a37021bc4a76ad20ce1b92062092fe47e22db90b9d37c7e30f811","observation_id":"c93a5f1e-5710-4697-bdcc-ae4a8987fc02","resolution":{"observed_at":"2026-08-07T04:29:31.848906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4894","last_updated":"2014-04-14T19:21:13Z","snapshot_observed_at":"2026-07-06T03:31:09.551860Z","submitted_at":"2013-12-17T19:00:50Z","title":"Deep Convolutional Ranking for Multilabel Image Annotation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4894","snapshot_observed_at":"2026-08-07T04:29:22.002407Z","title":"Deep convolutional ranking for multilabel image annotation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.002407Z"},"links":{"cited_paper":"/paper/1312.4894","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:bce96b05366ae39f7b1be83c46e35acc4dbe4bd930c140cd553302816b8a7444","observation_id":"1cc7885b-241b-46f2-bae0-8af644ddc3e6","resolution":{"observed_at":"2026-08-07T04:29:22.002407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.613613Z","title":"Gener- ative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":"1ffe3757-ef81-4fa7-830c-023514345c0f","year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.076053Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:4272d0f74b4cfe6eeb1e785046ceba6439eb7cbbc3cc7cbad6af3cf0c1fdeb79","observation_id":"925ea13d-e7ed-4268-9490-fc6d23eebb5b","resolution":{"observed_at":"2026-08-07T04:29:31.670788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09778","last_updated":"2023-08-18T23:43:42Z","snapshot_observed_at":"2026-07-06T14:19:59.628326Z","submitted_at":"2022-11-17T18:52:19Z","title":"I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision","version":4},"cited_work":{"arxiv_id":"2211.09778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09778","snapshot_observed_at":"2026-08-07T04:29:27.180364Z","title":"I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision","venue":"cs.CV","work_id":"c0fbfda9-5656-4639-93b3-bc12a8abaf3c","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.172146Z"},"links":{"cited_paper":"/paper/2211.09778","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:231155add1be938b57009780eca6a194934c17502aa48a99dbc7fd8fbe6e50c6","observation_id":"a135c362-b34c-441a-b0e1-d298e75e8688","resolution":{"observed_at":"2026-08-07T04:29:27.334748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12739","last_updated":"2022-12-20T05:45:27Z","snapshot_observed_at":"2026-07-06T14:22:04.764657Z","submitted_at":"2022-11-23T07:00:11Z","title":"Texts as Images in Prompt Tuning for Multi-Label Image Recognition","version":2},"cited_work":{"arxiv_id":"2211.12739","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.12739","snapshot_observed_at":"2026-08-07T04:29:26.971212Z","title":"Texts as Images in Prompt Tuning for Multi-Label Image Recognition","venue":"cs.CV","work_id":"1aaa8d3c-bc51-4613-aa37-b0c5096b813a","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.246265Z"},"links":{"cited_paper":"/paper/2211.12739","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:2a28d9fa44cd55d33656a77da84b1f1996435b561f8f1047930219052c5c17e8","observation_id":"43de6bae-3c0d-4fa4-8064-fc9267afba04","resolution":{"observed_at":"2026-08-07T04:29:27.005782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T04:29:22.304194Z","title":"Imagen video: High definition video generation with diffusion models.arXiv preprint arXiv:2210.02303, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.304194Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:5116494122bb8e9bf6da6000406f9cac3079bc38618ec954110edc3a63fd4092","observation_id":"54d438c6-cdf6-4d65-82f8-29d6c4fc8afe","resolution":{"observed_at":"2026-08-07T04:29:22.304194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01598","last_updated":"2024-12-04T07:36:46Z","snapshot_observed_at":"2026-08-02T18:59:34.858726Z","submitted_at":"2024-01-03T07:59:17Z","title":"Learning Prompt with Distribution-Based Feature Replay for Few-Shot Class-Incremental Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01598","snapshot_observed_at":"2026-08-07T04:29:22.377613Z","title":"Learning prompt with distribution-based feature replay for few-shot class-incremental learning.arXiv preprint arXiv:2401.01598, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.377613Z"},"links":{"cited_paper":"/paper/2401.01598","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:86cd59a6de8b518e5dbb6283bca885f0d81c3e5167b0509f32081c4cedea08ef","observation_id":"cac53a72-af1a-4bcd-8974-9ffe1b0e1fef","resolution":{"observed_at":"2026-08-07T04:29:22.377613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.436062Z","title":"Class concept rep- resentation from contextual texts for training-free multi-label recognition","venue":null,"work_id":"8904807b-226e-4a19-8f3b-eb1a47eb1294","year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.437023Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:5c19b84200c9741dfd2319744cc85b82054a74b1fd2c404cf8f13942bfcf72ce","observation_id":"759e43e3-18a9-41aa-9f15-c2db223297a5","resolution":{"observed_at":"2026-08-07T04:29:31.536598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:31.166473Z","title":"Enhancing clip conceptual embedding through knowl- edge distillation, 2024","venue":null,"work_id":"55c0545e-dbe6-4f07-95fd-5da5f3c87e6c","year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.529549Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:cd5a71ee127f9d81c6fab3e80b2afb050dbd64e73e471db2e063887886e36b50","observation_id":"151bea06-1562-4acc-b5f9-115f8abc2da4","resolution":{"observed_at":"2026-08-07T04:29:31.301209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T04:29:22.608769Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.608769Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:d36486aafd7bd1bbdea5165ec62a8c564a7cc03be1de56d9e27329a17a7bd8df","observation_id":"99c04b5b-f88f-4d51-95c0-fcaf71f40039","resolution":{"observed_at":"2026-08-07T04:29:22.608769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T04:29:22.693267Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.693267Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:886a179e4d23490780fa29df0882fd352afbbb1aa28ade4b824249d4aa8a983c","observation_id":"52dbb060-3b2b-477f-a02b-be5cbc2d169c","resolution":{"observed_at":"2026-08-07T04:29:22.693267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.957609Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification.Dataset available from https://github","venue":null,"work_id":"94ecdd9f-f25c-481a-8204-10d32f1d49af","year":2017},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.787514Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0e20c8def6301d72c2d11a9a2964fc5ea1fc412ca879c843e54c709b812a2756","observation_id":"d2f91786-85d5-485a-b6e4-ee057a6ffe95","resolution":{"observed_at":"2026-08-07T04:29:30.991687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:22.866684Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.866684Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:67c42ba5e23a9ed5334563537eb3fec69e5052aa265a32cd551d66c194add886","observation_id":"9325cba4-ff10-48d2-a049-c1ef4caf4611","resolution":{"observed_at":"2026-08-07T04:29:22.866684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:22.937312Z","title":"Compositional visual generation with composable diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.937312Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:226f8630eaf066b712a71b75ece1ac9c9bb853b00597a1d82db1f5b0e1bd6235","observation_id":"8f654f19-4017-4f3f-9870-981ca8d86a5f","resolution":{"observed_at":"2026-08-07T04:29:22.937312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.761028Z","title":"Multi-label image classification via knowledge distillation from weakly-supervised detection","venue":null,"work_id":"6e2b1f37-e0f6-4fd1-b8d4-68e27342b81e","year":2018},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:22.992006Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:045393d9bf193ff6052c2ec15cab01be54894cb32542124782c7dbb7d80fa8a7","observation_id":"174fc98a-68c0-4902-95e4-34ca7f7c42b2","resolution":{"observed_at":"2026-08-07T04:29:30.851628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:29:23.154171Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.154171Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:94ef74c4a5d2e99153d484d6a33edf85fd95d3f098100cf8cfeb0fd578fdeb4b","observation_id":"940ac585-f768-4090-b721-ff3dd2c0cd50","resolution":{"observed_at":"2026-08-07T04:29:23.154171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-07T04:29:23.300405Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models.arXiv preprint arXiv:2302.08453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.300405Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:90b3702e996964aeec18a5729d26d34abeb9bf4ea941533f8d9dd60b44c731c1","observation_id":"60b3b8b3-01c9-4ce7-8665-67607d9997c3","resolution":{"observed_at":"2026-08-07T04:29:23.300405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.553439Z","title":"Discriminative region-based multi- label zero-shot learning","venue":null,"work_id":"2a39eb02-edfb-42d9-8a6b-eecd55d13132","year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.497066Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:fcfbd4072c74f6e916190f9e1203dc1c8f2f5582eaeb7dc1df66b32638a31e71","observation_id":"e145ff17-4e59-44aa-8190-0fecda34f588","resolution":{"observed_at":"2026-08-07T04:29:30.640677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T04:29:23.648601Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.648601Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:4825950981c347e164f5cadeee3982e3c11c1bb014b78013cfbd7d0fd34ae1aa","observation_id":"4bd800af-6817-439b-aa85-83e068109af3","resolution":{"observed_at":"2026-08-07T04:29:23.648601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00575","last_updated":"2022-11-01T16:36:01Z","snapshot_observed_at":"2026-07-06T14:13:07.158001Z","submitted_at":"2022-11-01T16:36:01Z","title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00575","snapshot_observed_at":"2026-08-07T04:29:23.701411Z","title":"Text-only train- ing for image captioning using noise-injected clip.arXiv preprint arXiv:2211.00575, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.701411Z"},"links":{"cited_paper":"/paper/2211.00575","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:99cfb877f3faaa569b45d31c1b62c90791cd71b46038b7c0adfeb95f60ad2828","observation_id":"09055feb-c934-45bb-b5b2-a5b9304eaafe","resolution":{"observed_at":"2026-08-07T04:29:23.701411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:23.757452Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.757452Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:dd797a7c446f42054170eb845cf96e70f6d4911d79630205aae2573297246507","observation_id":"9c55f7d6-eb43-4fbc-9bec-9eddc3062d8f","resolution":{"observed_at":"2026-08-07T04:29:23.757452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.341623Z","title":"Semantic-aware representation blending for multi-label image recognition with partial labels","venue":null,"work_id":"3ad59562-c746-4cb9-b46b-5add8d4906c2","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.827478Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:77e80b568fcd453f125f399ca73199e3419ac72b1b68bc55b21d8c52e7bb1f58","observation_id":"ad348d85-18e1-4a2d-8f9e-f92ce3949f50","resolution":{"observed_at":"2026-08-07T04:29:30.451465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:23.905795Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.905795Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:4bd7ee0392a44da51ca934465d41c8cf4db08e62d3528aedb1acc957314abcd2","observation_id":"c98aeb9a-3e22-4866-98ec-8e79f405e115","resolution":{"observed_at":"2026-08-07T04:29:23.905795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T04:29:23.971618Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:23.971618Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:64014ef319f76b6a9f098b1313d4cf356f2e9867204e26cc6a392a8440e83882","observation_id":"93cbaf98-1dac-440e-8fe9-4168ea114428","resolution":{"observed_at":"2026-08-07T04:29:23.971618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08381","last_updated":"2024-09-12T20:02:51Z","snapshot_observed_at":"2026-08-07T12:13:12.051860Z","submitted_at":"2024-09-12T20:02:51Z","title":"Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations","version":1},"cited_work":{"arxiv_id":"2409.08381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08381","snapshot_observed_at":"2026-08-07T04:29:26.642807Z","title":"Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations","venue":"cs.CV","work_id":"4761f59a-223d-46f6-b7f4-03abce87f5dd","year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.067977Z"},"links":{"cited_paper":"/paper/2409.08381","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:0afc1bd1bcbed1a25cc3a026ee0be63c4de500a8611a966c510fab85db5b5554","observation_id":"67c2f28a-8042-4ba4-83f8-7b31737b9bfc","resolution":{"observed_at":"2026-08-07T04:29:26.741089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:24.140777Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.140777Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:c8923db1a8f2224af952519222eac050a778d1225b9e8cef24a508706b457b00","observation_id":"3e5370b9-3067-4406-b06a-7fa346309749","resolution":{"observed_at":"2026-08-07T04:29:24.140777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12242","last_updated":"2023-03-15T17:52:27Z","snapshot_observed_at":"2026-07-06T13:45:31.237782Z","submitted_at":"2022-08-25T17:45:49Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12242","snapshot_observed_at":"2026-08-07T04:29:24.201454Z","title":"Dreambooth: Fine tuning text-to- image diffusion models for subject-driven generation.arXiv preprint arXiv:2208.12242, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.201454Z"},"links":{"cited_paper":"/paper/2208.12242","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:86756b8a7e495da1c68213286abf268b979b6b42da84c9e33f257a6e6cd40906","observation_id":"6e4f146f-2784-4af2-8e8a-503d755e9b84","resolution":{"observed_at":"2026-08-07T04:29:24.201454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:24.328312Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in Neural Information Processing Systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.328312Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:c9ced0db2e8c14ac04ea432efdb7f0778a021567bf2607b2e17d6f00222fc98b","observation_id":"4f3c9b3c-79d2-489f-ab99-da2bca4e214d","resolution":{"observed_at":"2026-08-07T04:29:24.328312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:30.094817Z","title":"Meta-learning for multi-label few-shot classification","venue":null,"work_id":"4883593a-dbb7-4e1f-bdf0-1bb635fdeda2","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.397782Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:47fb5842fab45aa63213b24727a543072520ca3973fd474ed88668080350ffa1","observation_id":"b82ffa68-b37d-4f30-be73-b103de74c0ae","resolution":{"observed_at":"2026-08-07T04:29:30.155597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.854301Z","title":"D2c: Diffusion-decoding models for few-shot conditional generation.Advances in Neural Information Processing Systems, 34:12533–12548, 2021","venue":null,"work_id":"efec1adb-c51a-4652-a3a7-7e20326aaf03","year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.456552Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:b02b019ab7b33b35db7c1aa75eb28a037fa4d286f84ecbfbff788a34bcadeef1","observation_id":"92e242d5-05a3-4554-919b-970c885771cd","resolution":{"observed_at":"2026-08-07T04:29:29.964146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09541","last_updated":"2022-06-20T02:36:54Z","snapshot_observed_at":"2026-07-06T13:22:31.744348Z","submitted_at":"2022-06-20T02:36:54Z","title":"DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations","version":1},"cited_work":{"arxiv_id":"2206.09541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.09541","snapshot_observed_at":"2026-08-07T04:29:26.436518Z","title":"DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations","venue":"cs.CV","work_id":"d73e06de-9302-4564-ac8b-d53fc884f0bb","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.565152Z"},"links":{"cited_paper":"/paper/2206.09541","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:fd3add7d4ef85150c9f44cf654b5c83aae4cf36bba141183010b1bfc2d9c052e","observation_id":"2bce9440-2692-46ef-9e32-e27523688dcd","resolution":{"observed_at":"2026-08-07T04:29:26.503407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.620212Z","title":"Vl-adapter: Parameter- efficient transfer learning for vision-and-language tasks","venue":null,"work_id":"0117fa6a-e776-4bcb-8243-79d8fe7f6fde","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.669507Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:df0ff1788fffc44ad868ad8adc12ee9be86687e3157b020591809335f93aa914","observation_id":"6fdb1315-0afe-44f3-9465-a167a5c433b5","resolution":{"observed_at":"2026-08-07T04:29:29.756867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:29:24.742090Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.742090Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:ce656e7cc0fe201e6c5cc1984ad4deaaa2e9158512b71075d3bbe6b824ae8d30","observation_id":"af3ca6be-ea1e-4188-859c-f811ac3a0582","resolution":{"observed_at":"2026-08-07T04:29:24.742090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.390685Z","title":"Schwing, and Heng Ji","venue":null,"work_id":"68ff7015-78de-4afd-8ff2-bfb5a0c8cb21","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.822899Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:476d175f560be5aa6455c2430b662ae68e3b44a6fa0b36134388359c853e3abd","observation_id":"69079c93-4405-4a67-b3dd-facb53320b39","resolution":{"observed_at":"2026-08-07T04:29:29.467747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:29.167556Z","title":"Cnn-rnn: A unified framework for multi-label image classification","venue":null,"work_id":"92ec02cc-6167-42cc-85d7-c03b03edd559","year":2016},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:24.906797Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:37937f1c0604531d965f7a49c3791bf1e5806a66a4d882fc417db5e710fb5279","observation_id":"22bd1813-84d4-49b2-b047-f7026cd06b86","resolution":{"observed_at":"2026-08-07T04:29:29.250117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.950256Z","title":"Beyond object proposals: Random crop pooling for multi-label image recognition.IEEE Transactions on Image Processing, 25(12):5678–5688, 2016","venue":null,"work_id":"4d9bac83-cb11-4c9a-93e7-60a5b389cef8","year":2016},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.011815Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:1a75cb6532ffe5a01c86e4078afc5e3ccebf2adce79b463e25318bb509b56eea","observation_id":"174fdf45-c604-41ac-b7e2-25289eee0a40","resolution":{"observed_at":"2026-08-07T04:29:29.090608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.662683Z","title":"Multi-label classification with label graph superimposing","venue":null,"work_id":"41bed999-6162-466c-b2b9-c9f7d16158cb","year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.068637Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:5732a855e4a0b33d4e167b6d8a1361e5ff5930456949ca6a9ea5c4096f1eded2","observation_id":"dce809da-2730-4619-affa-4980c9be33dd","resolution":{"observed_at":"2026-08-07T04:29:28.742045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.413928Z","title":"Multi-label image recognition by recurrently discovering attentional regions","venue":null,"work_id":"ae0cc5bc-366c-466a-b00d-52ba310a14b5","year":2017},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.215372Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:afe865cfafc244f6c3db7ebc2fcbeff653dc4bf3e9dc89ca9cd83b5a68f75063","observation_id":"48618230-4984-4bd0-acf7-75eadd39a688","resolution":{"observed_at":"2026-08-07T04:29:28.509634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06926","last_updated":"2024-05-11T06:11:42Z","snapshot_observed_at":"2026-07-06T18:12:55.888082Z","submitted_at":"2024-05-11T06:11:42Z","title":"TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06926","snapshot_observed_at":"2026-08-07T04:29:25.323228Z","title":"Tai++: Text as image for multi-label image classification by co-learning transferable prompt.arXiv preprint arXiv:2405.06926, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.323228Z"},"links":{"cited_paper":"/paper/2405.06926","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:f284fbd082c42e4a1266747a91d064a37659133d3f14d19e42f539f16a8ab7e9","observation_id":"fb074065-6d3a-4991-9b4d-40e4d1514758","resolution":{"observed_at":"2026-08-07T04:29:25.323228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:28.129122Z","title":"Orderless recurrent models for multi-label classification","venue":null,"work_id":"89ff5ca3-4a86-466d-a0e3-8f505ba065c7","year":2020},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.508076Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:d3bc3d02b84b9388a1c2a4d023a0171d58d122036600378140928957177e802d","observation_id":"dbdbd1f7-a38c-4168-9111-1df0ebb44a80","resolution":{"observed_at":"2026-08-07T04:29:28.291057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:27.886933Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":"4bf0c1d5-34d0-4927-be89-93fc022e13c7","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.657227Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:f6cbc44bb8787220c53202537ca9091375395905bac31323d117bdc2ab747675","observation_id":"7ca2c462-991a-4087-9e94-b6d750d30dbb","resolution":{"observed_at":"2026-08-07T04:29:28.026308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:27.652117Z","title":"Transformer-based dual relation graph for multi-label image recognition","venue":null,"work_id":"74c164e5-94c6-4ee2-8ac5-00f8d2805f54","year":2021},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.787028Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:1199f07b7a947e301d5f7b96f4350497a0b97ce1390a5265c5240c11dd6fd7b5","observation_id":"34f917ba-feac-407e-b5f9-f4cd954240b7","resolution":{"observed_at":"2026-08-07T04:29:27.754042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:25.856436Z","title":"Con- ditional prompt learning for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.856436Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:ac841c3d2765755c7758e650dedf67fc0b16b99ba6efeeec89484754cd6cf5b1","observation_id":"786f5b84-e50e-41b7-84be-a94a0819c3be","resolution":{"observed_at":"2026-08-07T04:29:25.856436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:29:25.936192Z","title":"Learning to prompt for vision-language models.International Journal of Computer Vision, 130(9):2337–2348, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:25.936192Z"},"links":{"citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:d18fc48c9cab813e6adb273aa6eba7dbc28b688e81d5dec524937399bd039404","observation_id":"2320c6c6-4efe-499d-b709-e6fc9b5d7e67","resolution":{"observed_at":"2026-08-07T04:29:25.936192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14865","last_updated":"2025-08-13T06:38:43Z","snapshot_observed_at":"2026-07-06T13:15:17.438229Z","submitted_at":"2022-05-30T06:05:21Z","title":"Prompt-aligned Gradient for Prompt Tuning","version":4},"cited_work":{"arxiv_id":"2205.14865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.14865","snapshot_observed_at":"2026-08-07T04:29:26.183084Z","title":"Prompt-aligned Gradient for Prompt Tuning","venue":"cs.CV","work_id":"1bf11ef7-e269-46e4-9f7f-946101cd12dc","year":2022},"citing_paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:26.022916Z"},"links":{"cited_paper":"/paper/2205.14865","citing_paper":"/paper/2506.10575"},"observation_digest":"sha256:269756886998793f8a14835636561b1e920fc90eedd16f44cccc5701184eb4d9","observation_id":"c164c584-c577-4927-b2c5-dd84080dafe2","resolution":{"observed_at":"2026-08-07T04:29:26.267957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10575","last_updated":"2025-06-12T11:09:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:42:07.009165Z","submitted_at":"2025-06-12T11:09:49Z","title":"Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.10575."}