{"as_of":"2026-08-09T11:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d495622610042c49f4598e23537cb78c1477deb2e8f60e303abe388152a3c484","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:58:49.782338Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13192/citation-record","integrity":"/paper/2607.13192/integrity","json":"/paper/2607.13192/citation-record.json","paper":"/paper/2607.13192"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T05:58:40.321323Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.321323Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:9ba2aa0670746d06d1ba007bcf49d656b7dcfa200be4b342fa48dc7cd5fb7634","observation_id":"4f04a85d-f721-4118-ab82-9cd701d6708e","resolution":{"observed_at":"2026-08-02T05:58:40.321323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:40.392994Z","title":"JGCL: Joint self-supervised and supervised graph contrastive learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.392994Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:1e97b4c764d5535d0a88743eaf3e20c0600cecc7ed4ab96bed236fbb45ee83fb","observation_id":"5ec5b587-af49-4a0a-97c2-445190142c89","resolution":{"observed_at":"2026-08-02T05:58:40.392994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:40.497124Z","title":"CrisisMMD: Multimodal twitter datasets from natural disasters","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.497124Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:f3478ba12a87d0540deef9cc43555841387200326e3321707d98ec4c210a1224","observation_id":"ad0fb807-3677-4f47-9815-824740b2d791","resolution":{"observed_at":"2026-08-02T05:58:40.497124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:40.625493Z","title":"Flamingo: A visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.625493Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:1ed849614ededaf4dd89433a152e8d25c79748caf2589746d86559b5d3382e47","observation_id":"1ab86eed-f9d0-4e4b-9a4d-66739e4dc899","resolution":{"observed_at":"2026-08-02T05:58:40.625493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:40.750320Z","title":"Hyperspectral target detection using self-supervised background learning.Advances in Space Research, 74(2):628–646, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.750320Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:38cbeb8354b046843b5c7bb234c38a03025668d4d39700694a56ff050d425c93","observation_id":"73716a63-e318-4c77-9738-337d9c2020a5","resolution":{"observed_at":"2026-08-02T05:58:40.750320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:40.884491Z","title":"Robust and data-efficient generalization of self-supervised machine learning for diagnostic imaging.Nature Biomedical Engineering, 7(6):756–779, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.884491Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:ed8e6555547ec5b4e11edd572801bce0333460a9a26ed1d52364ae45e732ac44","observation_id":"c085dd17-1f15-4749-bcc0-61541368d3e3","resolution":{"observed_at":"2026-08-02T05:58:40.884491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-02T05:58:40.998040Z","title":"BEiT: BERT pre-training of image transformers.arXiv preprint arXiv:2106.08254, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:40.998040Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:ebd5096570f46e6cb225277c2139026c6f926c1faf755fd80e6de5788212e495","observation_id":"eae15a13-93c9-45df-84d3-d2489047da45","resolution":{"observed_at":"2026-08-02T05:58:40.998040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04906","last_updated":"2022-01-28T12:23:37Z","snapshot_observed_at":"2026-07-06T11:08:17.373935Z","submitted_at":"2021-05-11T09:53:21Z","title":"VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04906","snapshot_observed_at":"2026-08-02T05:58:41.146060Z","title":"VICReg: Variance-invariance-covariance regular- ization for self-supervised learning.arXiv preprint arXiv:2105.04906, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.146060Z"},"links":{"cited_paper":"/paper/2105.04906","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:c7321a0c19bfa7c9fefd1bd08fe79f11ece6e9e8b3f5c50b261ff7f67db49193","observation_id":"fc400826-bdad-426e-863a-519be6bc0539","resolution":{"observed_at":"2026-08-02T05:58:41.146060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.09785","last_updated":"2020-02-13T23:14:46Z","snapshot_observed_at":"2026-08-05T08:24:49.625500Z","submitted_at":"2019-11-21T23:44:25Z","title":"ReMixMatch: Semi-Supervised Learning with Distribution Alignment and Augmentation Anchoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.09785","snapshot_observed_at":"2026-08-02T05:58:41.245302Z","title":"Remixmatch: Semi-supervised learning with distribution alignment and augmentation anchoring.arXiv preprint arXiv:1911.09785, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.245302Z"},"links":{"cited_paper":"/paper/1911.09785","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:7bf55a08198f081152a3acabce02c3ef69b93676a4e6fcf8f648bd0af5afc83a","observation_id":"75eb5ec4-e7f1-47d8-b1a7-62b7e2868c6b","resolution":{"observed_at":"2026-08-02T05:58:41.245302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.344929Z","title":"Mixmatch: A holistic approach to semi-supervised learning.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.344929Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:a50b23a68437e3a6cb3f443951b6bb77ccccd9fce0aba17aa9932b7affad767f","observation_id":"ccbf8c50-6f53-4686-a02e-deedf42e885e","resolution":{"observed_at":"2026-08-02T05:58:41.344929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.430386Z","title":"Unsupervised learning of visual features by contrasting cluster assignments.Advances in neural information processing systems, 33:9912–9924, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.430386Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:d8a6d07cd0ef4383e4a0d0696e395697b6a09400989e8064ca7dfc1cef792b51","observation_id":"fdf3a6f2-ac4d-433e-88cc-07098f7c051d","resolution":{"observed_at":"2026-08-02T05:58:41.430386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.567183Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.567183Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:9fdeb63daaf8789308724f9c6a8b44d8dbbcefb6b4222a2acbd454913bc26a53","observation_id":"f3782da5-f387-43d2-a4e4-9d5df1bf7fb1","resolution":{"observed_at":"2026-08-02T05:58:41.567183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.664468Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.664468Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:91b4e1589d2065c5f95da3aa52aed675a083e3ce4edeaf15d5b06129ac17723e","observation_id":"b3c2e38f-0926-44b9-8504-063d9d348a57","resolution":{"observed_at":"2026-08-02T05:58:41.664468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.782221Z","title":"Big self-supervised models are strong semi-supervised learners.Advances in neural information processing systems, 33:22243–22255, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.782221Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:0083ea2ef08347c8d9f64edca56252b0613e781e49a22690218165e7397cc8bd","observation_id":"e7d0fc89-8b13-4612-a58d-9e97e2f1636b","resolution":{"observed_at":"2026-08-02T05:58:41.782221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.891510Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.891510Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:ec840285f32ecf76caa7fa17be0b2db0f63b1b73976baf3a7e587fc1196fb6d7","observation_id":"39bc9793-986c-4f80-bd57-b36e8816963d","resolution":{"observed_at":"2026-08-02T05:58:41.891510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:41.988121Z","title":"Not-so-supervised: a survey of semi-supervised, multi-instance, and transfer learning in medical image analysis.Medical image analysis, 54:280–296, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:41.988121Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:964409f80b34a9ba17b989ed194a4fe1b7267a0d16a9aa72a7ef324f5fbb5d5f","observation_id":"1ffdaa9d-fa1d-41d8-a4c6-3f75ba96d54a","resolution":{"observed_at":"2026-08-02T05:58:41.988121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.063821Z","title":"Orienting novel 3D objects using self-supervised learning of rotation transforms","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.063821Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:8ebde30653879d0464c3c567d2c5d704731e3364722f982ee3b9755ad60678f2","observation_id":"16eea5d2-7d11-4e78-8fed-2dfdc8c3e357","resolution":{"observed_at":"2026-08-02T05:58:42.063821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.186338Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.186338Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:21238126692a3ee44efab4d83d368bc46c636e79fed72cc260840b19b8941e74","observation_id":"f9027b8b-d548-4e93-9521-6e7dc1360d41","resolution":{"observed_at":"2026-08-02T05:58:42.186338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.254378Z","title":"Unsupervised visual representation learning by context prediction","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.254378Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:fefe001a3ef9c6f10184a22405b98f2683cc047c311eb0eb80f8036260ee3d8d","observation_id":"04388052-84bc-43a1-95d6-fc3554ac23df","resolution":{"observed_at":"2026-08-02T05:58:42.254378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.364242Z","title":"Self- supervised colorization towards monochrome-color camera systems using cycle cnn.IEEE Transactions on Image Processing, 30:6609–6622, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.364242Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:970b812af970789bbf611ce3c74af5c9287bc767deefadc71a53944f64855749","observation_id":"e59afc59-3600-4919-9a56-1ed362e9cc2f","resolution":{"observed_at":"2026-08-02T05:58:42.364242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-02T05:58:42.519185Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.519185Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:bb1e9f04571e43c7d7bf2afe727433509e2ff5eac42b2341b3a925c485213866","observation_id":"5d3e5796-69d3-40fb-854a-5ed61420e185","resolution":{"observed_at":"2026-08-02T05:58:42.519185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.605340Z","title":"Everingham, L","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.605340Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:68a1ab63df87c1aedd7453690c46bb3d60a77dcc054089e04edf7ff0b85deff3","observation_id":"e4449698-704a-4d96-9589-27bc9b20d1af","resolution":{"observed_at":"2026-08-02T05:58:42.605340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.717348Z","title":"The Pascal Visual Object Classes (VOC) Challenge.International Journal of Computer Vision, 88(2):303–338, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.717348Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:f200dea64f4a67367b34d17476b3858b412f54425227d2d6507126efcb23df8f","observation_id":"9884dc30-2d89-4b94-9b07-970dec39d438","resolution":{"observed_at":"2026-08-02T05:58:42.717348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.848986Z","title":"Self-supervised representation learning by rotation feature decoupling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.848986Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:f5e48ac9632137cbb63c9035883c69880deda0990926766264917bc78de62ed8","observation_id":"1ae20ef1-cea9-414a-8ce0-1da4aeed6d2a","resolution":{"observed_at":"2026-08-02T05:58:42.848986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:42.963798Z","title":"Bootstrap your own latent-a new approach to self-supervised learning.Advances in neural information processing systems, 33:21271–21284, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:42.963798Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:d40d64566837c69f0a5da17824f039fc16b177c9ebc5a0b14e335508c4433c36","observation_id":"6d43ea98-2d20-45d7-969d-c88015334ff6","resolution":{"observed_at":"2026-08-02T05:58:42.963798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.098235Z","title":"A survey on self-supervised learning: Algorithms, applications, and future trends.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(12):9052–9071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.098235Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:9c81418b85d9f924cb3b2c12944eb79e53955159de4037ad9f6edd367071e56c","observation_id":"722ceb76-1875-48ed-9436-08b524ff9f8b","resolution":{"observed_at":"2026-08-02T05:58:43.098235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.219852Z","title":"CrisisKAN: Knowledge- infused and explainable multimodal attention network for crisis event classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.219852Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:99b22ff060a04cae1189580c4eff1105736c041195469b8f348d7d90f6e6d2c8","observation_id":"22c12c24-a931-4640-8325-ad6a5babe12b","resolution":{"observed_at":"2026-08-02T05:58:43.219852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.01397","last_updated":"2016-05-04T19:49:17Z","snapshot_observed_at":"2026-07-06T04:55:08.624415Z","submitted_at":"2016-05-04T19:49:17Z","title":"Skin Lesion Analysis toward Melanoma Detection: A Challenge at the International Symposium on Biomedical Imaging (ISBI) 2016, hosted by the International Skin Imaging Collaboration (ISIC)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.01397","snapshot_observed_at":"2026-08-02T05:58:43.330336Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.330336Z"},"links":{"cited_paper":"/paper/1605.01397","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:18801421402a1824023c2cff96c817ff528d4207174879b660865168595dc15d","observation_id":"0fbb8446-71d9-402d-bed7-594812cccfb9","resolution":{"observed_at":"2026-08-02T05:58:43.330336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.435696Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.435696Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:6b7f3f5d1028a848e68db82da2b75bae4d70b5385f3f0a2b814fa5b083cf02fe","observation_id":"699cf1fe-94a8-43b1-8843-91a44b3f6962","resolution":{"observed_at":"2026-08-02T05:58:43.435696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.601371Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.601371Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:dfe157723812fda6fb4b9ee56fb76311153fc8fd7d7f5dd7d257d18e6e741231","observation_id":"e14f0da7-79d8-4031-82b6-d9857ea74d56","resolution":{"observed_at":"2026-08-02T05:58:43.601371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.650739Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.650739Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:c8aafa87abdeee155d6ef6c1f16bcf72b3be0146a8713f6e39b5dd0d7e776385","observation_id":"acbf5561-e899-4f46-ba53-fba6508b51dd","resolution":{"observed_at":"2026-08-02T05:58:43.650739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.735728Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment.IEEE Transactions on Image Processing, 29:4041–4056, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.735728Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:a7385869e3cb441ead91ab3b91c8ddb6a2fceedef5ae370cf2259f9a1f5570df","observation_id":"11d5e7cc-f570-4f4d-a47d-9148d18b2574","resolution":{"observed_at":"2026-08-02T05:58:43.735728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.842185Z","title":"Self-supervised learning by image colorization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.842185Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:d9fd76257408093b2f58217bae745351fecbc628a25e66af5ace54f5359c28c5","observation_id":"d3c546e5-c28c-4ba4-be31-650ccb256255","resolution":{"observed_at":"2026-08-02T05:58:43.842185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:43.914053Z","title":"Adco: Adversarial contrast for efficient learning of unsupervised representations from self-trained negative adversaries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:43.914053Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:aee6d0a1f6e8002d850d1135121e01aba1b322074873da926f5a53b73c8ba15d","observation_id":"7dfe544f-02b6-43d4-a17b-62f2ab1f0c50","resolution":{"observed_at":"2026-08-02T05:58:43.914053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.011571Z","title":"Self-supervised color- concept association via image colorization.IEEE Transactions on Visualization and Computer Graphics, 29(1):247–256, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.011571Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:1bcc86451d1701d7509de1c1a0c6207a99e4e54efdbc73292b16a25ecdcc0c36","observation_id":"a2436833-be00-434e-90d3-98e7dd655ed0","resolution":{"observed_at":"2026-08-02T05:58:44.011571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.048889Z","title":"Self-supervised, semi-supervised, multi-context learning for the combined classification and segmentation of medical images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.048889Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:24f32bcb51249c1a107be0784eb5933b4248db869ef8f87b25bf1b8c5d7c835b","observation_id":"5f74a40e-2b05-40ff-97d7-aa8280872ab7","resolution":{"observed_at":"2026-08-02T05:58:44.048889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.160358Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.160358Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:77f24e98aaf8eafca10988b6e924bd5be5c587b00e8c50df6ed33d4aaec86776","observation_id":"4bcd5fff-5654-4f9f-ab6c-539ab8a55049","resolution":{"observed_at":"2026-08-02T05:58:44.160358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.244182Z","title":"Self-supervised visual feature learning with deep neural networks: A survey.IEEE transactions on pattern analysis and machine intelligence, 43(11): 4037–4058, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.244182Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:41a4583c62e43a73bd81c1be5ef1fb26f93cd891b7174fa499b48fd7b70aad0c","observation_id":"09af2bf8-0d83-493b-ad8c-10f83962a123","resolution":{"observed_at":"2026-08-02T05:58:44.244182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11387","last_updated":"2019-04-04T02:51:59Z","snapshot_observed_at":"2026-07-06T07:17:31.201039Z","submitted_at":"2018-11-28T05:04:34Z","title":"Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.11387","snapshot_observed_at":"2026-08-02T05:58:44.350770Z","title":"Self-supervised spatiotemporal feature learning via video rotation prediction.arXiv preprint arXiv:1811.11387, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.350770Z"},"links":{"cited_paper":"/paper/1811.11387","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:9a8370a84f91e0ff2f66451ae76ad0761f8b766bc0f87e72f5f71b1bf47f4c29","observation_id":"3dd24910-049a-46d0-9d0e-3709767f9aae","resolution":{"observed_at":"2026-08-02T05:58:44.350770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.475403Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.475403Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:fe50310549db1fbbbbecbf90c3f45df95ce8c72486c170b2f9cd24fba0f5a1c4","observation_id":"02f74930-ed46-480c-a235-edb710a82936","resolution":{"observed_at":"2026-08-02T05:58:44.475403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02242","last_updated":"2017-03-15T14:22:41Z","snapshot_observed_at":"2026-08-01T18:35:12.430501Z","submitted_at":"2016-10-07T12:15:42Z","title":"Temporal Ensembling for Semi-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02242","snapshot_observed_at":"2026-08-02T05:58:44.598216Z","title":"Temporal ensembling for semi-supervised learning.arXiv preprint arXiv:1610.02242, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.598216Z"},"links":{"cited_paper":"/paper/1610.02242","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:cefb7e823c2ac62cbd1f379bd7c21490512777927302d6dfb00f72680a449e1b","observation_id":"5ca6a078-d1cc-4bfc-95b0-4326df54ca07","resolution":{"observed_at":"2026-08-02T05:58:44.598216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.703881Z","title":"Hsieh, and Jang-Hwan Choi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.703881Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:272ca14981bd238a69bd2914ad969c0e269362600a431b9bce24dbe85b518be2","observation_id":"2ff3a332-9d50-4b64-9f65-5923be830961","resolution":{"observed_at":"2026-08-02T05:58:44.703881Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.737156Z","title":"BLIP: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.737156Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:635e0682d8793121c9530f1c8754b3d8e57ad5a73c12c4ec535c80b55965dc7c","observation_id":"5f43b941-e784-4f26-9b4f-a05a26a16b6a","resolution":{"observed_at":"2026-08-02T05:58:44.737156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.827251Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.827251Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:cf5958b9731f15ef2427a2f43807214d54747087e7185271ec31e412f731f974","observation_id":"971d9c6d-1d2d-4f5a-8510-8c9e62bcccd1","resolution":{"observed_at":"2026-08-02T05:58:44.827251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.883804Z","title":"KADID-10k: A large-scale artificially distorted IQA database","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.883804Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:c9f4d1ab2b0a219e03ca4867d4937c08e6073bec13e5c63f281ad58d80441a38","observation_id":"aed19a3c-5a14-4b7e-9c1c-dfb095384388","resolution":{"observed_at":"2026-08-02T05:58:44.883804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:44.943555Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:44.943555Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:5d4d1d18532efefd1acd2a433e636bcfdb8f0f608e94c40e084f53835787ab25","observation_id":"ab661813-795a-4f10-a264-3f1eb95fec14","resolution":{"observed_at":"2026-08-02T05:58:44.943555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.031401Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.031401Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:7d4d0fddf8934b676907e98a6cb0e28a470bc399e89b40be8bc7ddac89a8b827","observation_id":"11ef7f89-7d0a-49c6-a4a1-24a1448614aa","resolution":{"observed_at":"2026-08-02T05:58:45.031401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.131889Z","title":"Self-supervised learning: Generative or contrastive.IEEE transactions on knowledge and data engineering, 35(1):857–876, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.131889Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:1f97c438b96292a323a18664f0ce5a2f417d36eebd68b03cc14f86b831f4ba0f","observation_id":"c4d12fac-30a9-4f21-930a-32ad7830080e","resolution":{"observed_at":"2026-08-02T05:58:45.131889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.281259Z","title":"Earthscape: A multi- modal dataset for surficial geologic mapping and earth surface analysis.arXiv preprint arXiv:2503.15625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.281259Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:3560ee7ba2cec7a68be9fb053bffe0ffa102bf04b42b6637a312ab076659cb49","observation_id":"a6d0a56f-bef7-4639-b0a5-3ec67398aae0","resolution":{"observed_at":"2026-08-02T05:58:45.281259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.409919Z","title":"Damage identification in social media posts using multimodal deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.409919Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:e6b86d5f0f48c2ccdc39e11cd2b7d7f6bb1e3752389f1773940f82b3e7c5030a","observation_id":"e89f65d5-88bf-4c27-b1d8-2365464f0253","resolution":{"observed_at":"2026-08-02T05:58:45.409919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.584181Z","title":"Self-supervision for medical image classification: State-of-the-art performance with ˜100 labeled training samples per class.Bioengineering, 10(8):895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.584181Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:bf6adcbf46d9c879ddc6ebda13f60432f08516aab3c317da5fbc076355831d87","observation_id":"c55a7495-ad46-44ff-8d43-083a37a7f08e","resolution":{"observed_at":"2026-08-02T05:58:45.584181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.684769Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.684769Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:c85c3ad6321eb88cd99eecf8230f77b95cf4bc02b4503a95ec39410b9b2969ad","observation_id":"5c81ba7b-006f-4ea0-8076-d59438d46d14","resolution":{"observed_at":"2026-08-02T05:58:45.684769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:45.797074Z","title":"Real- istic evaluation of deep semi-supervised learning algorithms.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.797074Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:11f2e026a5d8f5b7935a1b1c9f7ca016bc1b25071244874dcbc0ef85a5d38baf","observation_id":"5511cfa4-0d96-4b4f-b651-8e5b0c66809b","resolution":{"observed_at":"2026-08-02T05:58:45.797074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-02T05:58:45.892308Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.892308Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:fcd17b3f4a41f978ac223ed149d37c2f8b9c19262008cb7bd685f94f974d14c7","observation_id":"32efa712-a4c4-4b65-a856-d30ea9d3e616","resolution":{"observed_at":"2026-08-02T05:58:45.892308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T05:58:45.930892Z","title":"DINOv2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:45.930892Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:b5980e94d58e708385908bd7a88e57a113d8f6d6fa705e7908f245a4b0548f0c","observation_id":"10ab5ff1-b0e6-4986-b309-3a37a9f25bd3","resolution":{"observed_at":"2026-08-02T05:58:45.930892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.005241Z","title":"Self-supervised learning through colorization for microscopy images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.005241Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:52e862bec65479cf0f9c8a40872c704e5e8cddf66ee3b469db29831e0413fa77","observation_id":"080963cc-3e33-4f17-bcc6-a4661fce2548","resolution":{"observed_at":"2026-08-02T05:58:46.005241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.132024Z","title":"Context encoders: Feature learning by inpainting","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.132024Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:97e562f5f6f747aa2b5ae9c6c22d1cda8d82892c4081b78fca7c412d3e835f07","observation_id":"c5b09be1-fd33-44ae-94b3-98ec5ed1600b","resolution":{"observed_at":"2026-08-02T05:58:46.132024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-02T05:58:46.203541Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.203541Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:3fa64022311756021f833d23b63102c693063aa3be362d982a3a5f576502643b","observation_id":"5d622989-8d6c-40f1-8343-3c5625a26091","resolution":{"observed_at":"2026-08-02T05:58:46.203541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.253937Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.253937Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:87004754423e72683b4442bed44455ed70540a90b3176fc2c3b24fa29ac84521","observation_id":"ead4d0fe-e1a9-455f-8851-72283e4a00c2","resolution":{"observed_at":"2026-08-02T05:58:46.253937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.345046Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.345046Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:d7f90988bb99a1c0180566740ec5dbe9d4fdbfa6cb1f7cdb39f5d919db92af61","observation_id":"ec1dbb94-723a-49fb-8ae6-4280f5fda365","resolution":{"observed_at":"2026-08-02T05:58:46.345046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.490853Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.490853Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:9c6b427a07904b2b6f29b7d27abda6e2d39dd3b959f6e546f6a03cb55ecf91d3","observation_id":"c471c8e9-4fc3-4ca5-8cc5-0dde0535fdb8","resolution":{"observed_at":"2026-08-02T05:58:46.490853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.666281Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.666281Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:bb91a3af15b9d16e883b91a483a79b57b63e3dd5fb165adb3362005e4f8038d2","observation_id":"f8043861-2704-4160-9922-711bb63bfc26","resolution":{"observed_at":"2026-08-02T05:58:46.666281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.798799Z","title":"Fixmatch: Simplifying semi- supervised learning with consistency and confidence.Advances in neural information processing systems, 33:596–608, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.798799Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:f2f4d97e3eac6127d62b7aa1bda2564039b37a4713e6e5c5af4023b36004c77c","observation_id":"8cf0fbdf-633a-4c64-bceb-c242c763ae56","resolution":{"observed_at":"2026-08-02T05:58:46.798799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:46.895433Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:46.895433Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:6ad9ce48eb49cd085b7ab6eb44bd637bbb8e2918134297fac7b1a607cdb7e23f","observation_id":"511a14c4-5359-4efb-9109-027cbd732e55","resolution":{"observed_at":"2026-08-02T05:58:46.895433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.023380Z","title":"What makes for good views for contrastive learning?Advances in neural information processing systems, 33:6827–6839, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.023380Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:07e205d6d5d9e30a8172a954d8353a235419a38f8161c34cd9443f259355f64f","observation_id":"ac777ad1-065d-486a-b643-387c919ce046","resolution":{"observed_at":"2026-08-02T05:58:47.023380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.154547Z","title":"YOLOv12: Attention-centric real-time object detectors.Advances in neural information processing systems, 38:78433–78457, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.154547Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:7f6d64ebbab4eb427dc39dc73334c5d75524664f01bc49c6d7eee3f51a38b63f","observation_id":"9e52c98c-dd74-4aab-a43f-a0d9dd142309","resolution":{"observed_at":"2026-08-02T05:58:47.154547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.267260Z","title":"Real-time self-supervised achromatic face colorization.The Visual Computer, 39(12):6521–6536, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.267260Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:d8deb6350105e6bb17c6f1def2d4d33075c415ac36d8732d7e5c9a2688459f26","observation_id":"b60855a1-4370-4027-9a5e-d4805549f22c","resolution":{"observed_at":"2026-08-02T05:58:47.267260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.423009Z","title":"Toward a collective agenda on ai for earth science data analysis.IEEE Geoscience and Remote Sensing Magazine, 9(2):88–104, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.423009Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:760a506bd43d1519cf4202a89e2de235ee6d96dd40bb7845791982eedf423da1","observation_id":"9bf656eb-eb89-478f-a157-7ffd416eaf3d","resolution":{"observed_at":"2026-08-02T05:58:47.423009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.598960Z","title":"A survey on semi-supervised learning.Machine learning, 109(2):373–440, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.598960Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:92a59c8b2160cf0e541dbf9934d14b7c11dc0ea6d94d17cbd0b4da6d591cbad6","observation_id":"d63e8ab9-5aec-4d69-a75d-de6f93311cd1","resolution":{"observed_at":"2026-08-02T05:58:47.598960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.731995Z","title":"Optimizing area under the roc curve using semi-supervised learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.731995Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:b1e883e34520ed5b7146ebfe93120bc427ddf017f4e24bdb04dfd0bb7c0e6f09","observation_id":"68b63625-a5d8-4bb0-b327-5ae87fbc20e7","resolution":{"observed_at":"2026-08-02T05:58:47.731995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.889328Z","title":"Unsupervised learning of visual representations using videos","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.889328Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:770b4e4ff6ed1d515273c19f20e40bf4f7fb71e50fe45504df4c2975dd3f8dcf","observation_id":"df41f95c-aeb5-4acb-9780-74debd35deb0","resolution":{"observed_at":"2026-08-02T05:58:47.889328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:47.997734Z","title":"Unsupervised data aug- mentation for consistency training.Advances in neural information processing systems, 33: 6256–6268, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:47.997734Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:a61febc7d14d0cd913917cdec1fc9858107ef9147194496c262252d9f230eaad","observation_id":"1c15dbe6-33df-4295-9bda-d51023ed6579","resolution":{"observed_at":"2026-08-02T05:58:47.997734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.180701Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.180701Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:78ed5a23276ee96986ac5869e2368952f00c3619e07cfff48e62ce893833bcb7","observation_id":"8f7a6ad4-2e9b-473d-8791-d59d3c825227","resolution":{"observed_at":"2026-08-02T05:58:48.180701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.273513Z","title":"Image enhanced rotation prediction for self-supervised learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.273513Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:7afb79a1434290866593bbf48d405ca4f42b41d61c88ebe8a6cca30b2fe698d2","observation_id":"6414584d-b630-4a1d-98fc-cd07838aae9b","resolution":{"observed_at":"2026-08-02T05:58:48.273513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.348391Z","title":"Self-supervised 3d action representation learning with skeleton cloud colorization.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(1):509–524, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.348391Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:10f3883a5c7af8d5bbfbdff773f7c9db29f1dc0f1a245aa525b41ba24ba70023","observation_id":"0dbf9192-8061-4236-900e-04ea95d8fecf","resolution":{"observed_at":"2026-08-02T05:58:48.348391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.480576Z","title":"Barlow twins: Self- supervised learning via redundancy reduction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.480576Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:1952d06f6f637a89abcf9b3ad8febd84fd94f8f5e7f1379b772cd76622875c33","observation_id":"babb9b42-5912-4f8a-b345-19005b16bd1e","resolution":{"observed_at":"2026-08-02T05:58:48.480576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.570716Z","title":"S4L: Self-supervised semi-supervised learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.570716Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:eaadc659f1b1122e34ce835d1cf7c45ea9966315f7354282457209e76a4f1894","observation_id":"a005fdfd-3faa-4adb-bd71-c8d867257f48","resolution":{"observed_at":"2026-08-02T05:58:48.570716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.701453Z","title":"Colorful image colorization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.701453Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:989065eb587c6f0db531c0fd06e46aefd85163694bb26c542edd7b36c79b7ea1","observation_id":"46752f6c-d181-48b6-8e5b-80ec5ffff29e","resolution":{"observed_at":"2026-08-02T05:58:48.701453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:48.794228Z","title":"Combining self-supervised and supervised learning with noisy labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.794228Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:36bb5b46e240549cc093f036b562bebec5554233d40ac9a61736844967590e91","observation_id":"6f453bf6-9e27-4425-ae54-b5a4ce7f37c9","resolution":{"observed_at":"2026-08-02T05:58:48.794228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-02T05:58:48.847518Z","title":"iBOT: Image BERT pre-training with online tokenizer.arXiv preprint arXiv:2111.07832, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:48.847518Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:4040b98ba22daf837bbd534b7be203f11f83e9b66598a716453b07efa370311b","observation_id":"289fe9be-bd3d-4dc9-be26-5ecf85ed6acf","resolution":{"observed_at":"2026-08-02T05:58:48.847518Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.004451Z","title":"2|X∩Y| |X|+|Y| .(3)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.004451Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:5a4cf537e5bf41a9d6949072f5d31e8b949671c9b2fb4011ac49a255c6df8df5","observation_id":"9c21a95f-2874-4075-b6fa-8eb8c5ac42d7","resolution":{"observed_at":"2026-08-02T05:58:49.004451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.154602Z","title":"IoU, also called the Jaccard index, measures the average overlap between predicted masks and the ground truth","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.154602Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:8bddcfc0d3507206c8e4c6d07e9074a4abc737369443de96ea2e7713d652c1fc","observation_id":"e520be53-930b-4b45-b6c6-ddc8cf6de573","resolution":{"observed_at":"2026-08-02T05:58:49.154602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.256983Z","title":"P= T P T P+F P.(5) 2.Recall:Also called sensitivity, this metric measures how many of the actual positive cases were correctly identified by the model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.256983Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:5d5a08111999654bc664b35e119bc4a10a7a024f530054d5dd88c59f11efe0bd","observation_id":"e91f8fbf-3ce5-44ab-b56a-7f1c80006c25","resolution":{"observed_at":"2026-08-02T05:58:49.256983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.371420Z","title":"It is computed as the mean of the Average Precision (AP) overNclasses: mAP= 1 N NX i=1 APi,(7) where APi denotes the AP for class i","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.371420Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:d0d29243a4cc45809ff5561bec2c1173924719f997cd6497a9610476ceefd784","observation_id":"0adb1e97-1854-4d5e-9e8a-cf823be1a113","resolution":{"observed_at":"2026-08-02T05:58:49.371420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.470588Z","title":"SROCC= 1− 6 Pn i=1 d2 i n(n2 −1) ,(9) whered i is is the difference between the ranks ofy i andˆy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.470588Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:13c1fd1daa865e2dd985208462d88e7c48d60e35028dfc1049d7bd0bc12ce60f","observation_id":"11652693-e6d4-4df2-9da9-cf9f9f464b16","resolution":{"observed_at":"2026-08-02T05:58:49.470588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.654052Z","title":null,"venue":null,"work_id":null,"year":2051},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.654052Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:2b076d62f47ff025f2bd5a436c2d5e2f39b24fbbee0de964cb954c87e508a8b5","observation_id":"8702adf4-eee4-4606-8874-a7b34ee089fc","resolution":{"observed_at":"2026-08-02T05:58:49.654052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:58:49.782338Z","title":"22 Table 3: Classification performance of different SSL frameworks on CrisisMMD using 128 ×128 image inputs under the PFT and JT training paradigms with 100% labeled data","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T05:58:49.782338Z"},"links":{"citing_paper":"/paper/2607.13192"},"observation_digest":"sha256:5f0ec483358baf18d03420abf54f0bf7caedc2cd7560a596743cfcc2cdc857d3","observation_id":"43e70c49-9caf-4759-994a-9058b11df072","resolution":{"observed_at":"2026-08-02T05:58:49.782338Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13192","last_updated":"2026-07-14T18:45:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T10:43:13.531895Z","submitted_at":"2026-07-14T18:45:04Z","title":"Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2607.13192."}