{"as_of":"2026-08-13T08:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45cd3f87d65b135d4537cc346a33e11359b8d7ccf39152c6c811973db11b44e1","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:51:40.872856Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17474/citation-record","integrity":"/paper/2411.17474/integrity","json":"/paper/2411.17474/citation-record.json","paper":"/paper/2411.17474"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.975495Z","title":"Self-labelling via simultaneous clustering and rep- resentation learning, 2020","venue":null,"work_id":"a94bdfb8-2f4c-42a6-8c3a-254da7ea7998","year":2020},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.548415Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:418043d66861a5fa99af820d93b885af8cb5aeec675be4b01784b70dfb2f93cf","observation_id":"7176fa03-8b6f-4b85-8091-a35a884e878d","resolution":{"observed_at":"2026-08-12T12:51:41.980529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.963822Z","title":"Es- timating and exploiting the aleatoric uncertainty in surface normal estimation, 2021","venue":null,"work_id":"443ebf69-c4c6-4821-b4cc-32ebc8760847","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.554544Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:837cbc929295b19b0ea7071ed61126f7b6539d50b3f1582ff181f401ba40c099","observation_id":"b4babdba-68c7-4081-89c3-c9bf0bbc4fe7","resolution":{"observed_at":"2026-08-12T12:51:41.967866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.951100Z","title":"Deep clustering for unsupervised learning of visual features, 2019","venue":null,"work_id":"65cbb0c9-78c7-4fdd-a556-04e865c30ab4","year":2019},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.560160Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:88a9f4f2c9901e4bab03d474bb174acf611e1edd6ce74b426f996e11515fc7ff","observation_id":"4f1dfb04-a947-42f5-9241-395daabaa1bc","resolution":{"observed_at":"2026-08-12T12:51:41.955607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.937377Z","title":"Unsupervised learning of visual features by contrasting cluster assignments, 2021","venue":null,"work_id":"44306a1b-24a4-482f-acee-8fef565bc6aa","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.566427Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:1b55e632e5c0dd13ef4b582b9759760d233cde0cd69a9359262a1a41581fc084","observation_id":"15e1dc17-d1f6-43d5-a66e-3da2047f0500","resolution":{"observed_at":"2026-08-12T12:51:41.941977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.922880Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"26894f9a-fdc6-462d-82c5-da874c9879d0","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.573259Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:3a082a10713deedb1a6f3d1520f69cfc0ab18f2f9b6ea2aa4a01fe934938ec4d","observation_id":"8a0a2f40-6784-4a85-a304-0c1fc2f06091","resolution":{"observed_at":"2026-08-12T12:51:41.927213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.907575Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"f022bd61-4343-4a7a-b36c-c9d62d1f7b9c","year":2020},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.578144Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:3edb21e7c43b23b683dea4e13dcd06e948899b8d131bc97c021c7291819d4650","observation_id":"86e1410c-21ef-4a77-9d03-5a021f7924d2","resolution":{"observed_at":"2026-08-12T12:51:41.912512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.887202Z","title":"Exploring simple siamese rep- resentation learning","venue":null,"work_id":"c439fb29-97ef-4535-a080-43830d9e9252","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.583476Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:5c8ae454ffaae68ed493b65631e91e5d35643c7afc817ffaecb300c6fa9171d1","observation_id":"14371e62-88aa-4a4d-af45-72530502b213","resolution":{"observed_at":"2026-08-12T12:51:41.892639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-12T12:51:40.587834Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.587834Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:9f43a0d1f7bd2412d44d8c4cba61d930388f9340bdfaa663de4ebb570ee55de2","observation_id":"5aca05dc-dba9-45a2-8e50-82c205fb0317","resolution":{"observed_at":"2026-08-12T12:51:40.587834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.867147Z","title":"An empirical study of training self-supervised vision transformers, 2021","venue":null,"work_id":"68cd9877-0b80-4c43-9489-0ae04c3f2a65","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.592914Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:d3c7271267355cc379f9fb750b1a195ead8241226539f34cf87c8bd3a34446b1","observation_id":"a085a733-e4e6-4ecb-83fe-f1b18bf3aad0","resolution":{"observed_at":"2026-08-12T12:51:41.875623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.599259Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.599259Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:5a15a371501bf8c0ee4e9174c2fcce9511c554ed8df3d48594dd04f7e8780e78","observation_id":"afcc20a8-8c77-45a3-abae-de544ae969bd","resolution":{"observed_at":"2026-08-12T12:51:40.599259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.604297Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.604297Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:e49d50a86a542bd03a05dde8ba41621d9ca08610a37c64db8e1808628552e68a","observation_id":"480cb379-9f29-425c-b424-1845299dd011","resolution":{"observed_at":"2026-08-12T12:51:40.604297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.835427Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"e8377ef1-6eb0-436d-8389-eaecc7b68341","year":2009},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.609282Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:dd0440cb545112217ffc21a5e31174b5a133bb7e304b0d77676f0b0a244a69ec","observation_id":"744bda88-36ad-4052-bfbf-fea6ad06f6fd","resolution":{"observed_at":"2026-08-12T12:51:41.840151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.819885Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining, 2023","venue":null,"work_id":"8eb49804-88f1-4673-afc4-c08e64fae584","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.614371Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:4ea80d98d3ffbacdc047088fe8f7622be9ea4e91c3967c85b55237ffcfeda14b","observation_id":"cb97cb3c-1326-4b8c-89a8-7f8975b00c45","resolution":{"observed_at":"2026-08-12T12:51:41.825893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T12:51:40.618426Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.618426Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:75a28887aa8086a36943d116820faae3efb82978c330ed52afde6235cfbe738f","observation_id":"09f82439-b746-4447-be51-c39464b1257d","resolution":{"observed_at":"2026-08-12T12:51:40.618426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.796923Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":"a683b0e7-3ead-459b-bf1d-3ac69fd34ac7","year":2014},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.624772Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:d304cd7df0d945e6af097d243c727ab7ddb3da7fc3b5efb96a0def16d1885c51","observation_id":"63bb760d-69bf-40ed-929c-f3a8c23416aa","resolution":{"observed_at":"2026-08-12T12:51:41.803957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.782286Z","title":"Depth map prediction from a single image using a multi-scale deep net- work, 2014","venue":null,"work_id":"55e061ea-4c40-465a-9fcb-4af06e6a1b75","year":2014},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.631199Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:145285cf830877e283f0838568113e6a6d4d3e3a8ba5ebb4002590a83ebcd89a","observation_id":"ebd485df-3edf-40dc-8b7c-c242bfe3c29d","resolution":{"observed_at":"2026-08-12T12:51:41.787823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.635164Z","title":"Prob- ing the 3d awareness of visual foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.635164Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:475c1d5f8096308b198da394070d043645c4640d6665b0f9e097a3cbbc182ac3","observation_id":"1efcf515-1523-4a9a-8f7d-d7a494e5657a","resolution":{"observed_at":"2026-08-12T12:51:40.635164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.759220Z","title":"Hospedales","venue":null,"work_id":"ed86ae60-dfc8-476f-88b1-995830b8ee63","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.639233Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:ed1b93d850db9096e1b3d5e3460f68b175523fc77d7a1232910724ccaa2b5a07","observation_id":"5352f811-f67b-4fa3-afba-3ae7fcd3ac82","resolution":{"observed_at":"2026-08-12T12:51:41.763925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.742751Z","title":"Everingham, L","venue":null,"work_id":"042f6135-33b1-4f60-b7dc-2aa58061a211","year":2007},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.644431Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:3d6a3cdad2ec356d74087065d0df89e7d436b7d7c68a3e47063b9aeba93831c3","observation_id":"6588d35b-6915-41e1-b989-7e49164e55f3","resolution":{"observed_at":"2026-08-12T12:51:41.750444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.730114Z","title":"Everingham, L","venue":null,"work_id":"d2b6c576-2110-4528-8701-878a8954e74e","year":2012},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.648515Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:f634a283318bb3215319a9335cc59510fd72576e413ccb058151d038ecfe7b42","observation_id":"2ced5c60-fc78-4eab-a06a-4bc930bd76d6","resolution":{"observed_at":"2026-08-12T12:51:41.734145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.717872Z","title":"Adabins: Depth estimation using adaptive bins","venue":null,"work_id":"be3e202c-8a11-4ba4-9f0a-b0f1c714553f","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.652129Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:1c0a8cc6bd2fc6112fe91324b75a212276f260e055d0315d750140867aeae106","observation_id":"78de9645-eba5-44e8-b959-57ba2c40c60a","resolution":{"observed_at":"2026-08-12T12:51:41.722026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.704040Z","title":"Fouhey, Wajahat Hussain, Abhinav Gupta, and Mar- tial Hebert","venue":null,"work_id":"554157ab-4096-4bb2-b1a0-224996463a12","year":2015},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.655907Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:6098ff5ecdc2094bd079f47903e2ae5fe598bd0f2a344b686d8c9133cff3d418","observation_id":"4efb1079-283d-4ab8-a5e2-40dcc1d4b9a1","resolution":{"observed_at":"2026-08-12T12:51:41.708546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.691656Z","title":"Dream- sim: Learning new dimensions of human visual similarity using synthetic data, 2023","venue":null,"work_id":"5e90f940-73ac-4cdd-b9a9-8f7e055255a6","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.659780Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:407e862919c249481ce88eb67aa17c0e9c859638bc4caaba6e368dd1c704aa1d","observation_id":"6b0505e1-d3a6-4dbe-882f-8777a45a6174","resolution":{"observed_at":"2026-08-12T12:51:41.695852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.678494Z","title":"Dream- sim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":"d256381e-ca98-4db2-87e7-ac05bfad1c63","year":2024},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.663753Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:908783e691564ade7b538b483b1de56df60b5ee4c1a924bb831a5744b4f72111","observation_id":"7188dc50-e24f-4629-bc70-292d197d2658","resolution":{"observed_at":"2026-08-12T12:51:41.682928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.665625Z","title":"Un- supervised representation learning by predicting image rota- tions","venue":null,"work_id":"dc7fbf96-4ef7-4c01-9a50-fa5379344ad3","year":2018},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.667876Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:03254ea81d8458ec5fc3f2d02f9a469712f48cda661ba2e7d4ab385d7c1d4c11","observation_id":"2c6152af-d826-47ca-826e-493e78520bf6","resolution":{"observed_at":"2026-08-12T12:51:41.669876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.652648Z","title":"Scaling and benchmarking self-supervised visual rep- resentation learning","venue":null,"work_id":"1e1fdd1a-ea5c-4b09-92b1-fec6da5500dd","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.671884Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:b210ec7a6bb1267edbf27d171c52983b5eca44a535d1c59636f08acf9fe5d914","observation_id":"df8e96b2-da7b-4163-82f8-db1d17409799","resolution":{"observed_at":"2026-08-12T12:51:41.656740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.639427Z","title":"Caltech-256 object category dataset","venue":null,"work_id":"502edde4-3dd2-45ee-a082-55890514b86f","year":2007},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.675797Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:e059f630cac4607824563a91babc8511541f1293f616a5e89b3ebe6422cd2c28","observation_id":"4fd98af8-8d5b-40bc-b556-eece4d6920bf","resolution":{"observed_at":"2026-08-12T12:51:41.644120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.626120Z","title":"Richemond, Elena Buchatskaya, Carl Do- ersch, Bernardo Avila Pires, Zhaohan Daniel Guo, Moham- mad Gheshlaghi Azar, Bilal Piot, Koray Kavukcuoglu, R´emi Munos, and Michal Valko","venue":null,"work_id":"a05bfb89-2000-4787-9ca2-8061fc77a528","year":2020},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.680184Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:5284e187ad1b561e6977f79d508437284b594f8e3f62284b9e69176fa9bc2904","observation_id":"5a3025fb-bf84-427f-965d-3c7205df50b1","resolution":{"observed_at":"2026-08-12T12:51:41.630952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.683838Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.683838Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:e0d9fe12bb25256b8cd5ee0655d28208b250d41cd03464241644f7b35e6238b5","observation_id":"8168124a-d202-4da5-8838-b6724645ae3d","resolution":{"observed_at":"2026-08-12T12:51:40.683838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.687644Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.687644Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:cd21a6bcd18dae71ac684ae0f0e8c6b3bcf0289bb6a711a711862bfdbcbca082","observation_id":"d1522790-fb5d-4a69-9c44-475b441f34ca","resolution":{"observed_at":"2026-08-12T12:51:40.687644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.594888Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":"6d557c2e-b680-40f6-8e25-8471e91c89f1","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.691436Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:067649abf9ddac39d22493f94fd32a05ff53a1f2d157470a1aa209a2df70f05c","observation_id":"7d41221e-d53f-4bec-87b0-c0cae9fa969f","resolution":{"observed_at":"2026-08-12T12:51:41.599553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.579841Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"a4a2220f-1cbf-4517-a42b-8d71900d0280","year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.695221Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:073dfac1ea2b5f1dc642c50900417cbe65a1fc66cc4664bd445ce3e8e5fce8dd","observation_id":"da66ae13-3af5-401f-92e2-46f11f4d69da","resolution":{"observed_at":"2026-08-12T12:51:41.584865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.565920Z","title":"Visual intelligence: How we create what we see","venue":null,"work_id":"dffff4e0-5bda-44ce-8c65-699aac423bb3","year":2000},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.699388Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:493af885744cced374cbddda9c07795044479ba26c2b3f205738b529e7173937","observation_id":"38c95550-9c5c-496b-a048-d59dc1821a72","resolution":{"observed_at":"2026-08-12T12:51:41.570352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.552272Z","title":"Navi: Category- agnostic image collections with high-quality 3d shape and pose annotations","venue":null,"work_id":"05c21a9b-1ff0-41fe-b566-82dc248cae7c","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.703229Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:8e9c0d8048d262b862b1b6c19d9e76faba9c75b476e4080768d50d23cf05a895","observation_id":"159b6147-393d-43ad-a82c-71ddc3223914","resolution":{"observed_at":"2026-08-12T12:51:41.557191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.535127Z","title":"Segment any- thing","venue":null,"work_id":"9cfb4845-4350-4a69-add1-30651a822f53","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.707340Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:505a78a442e57de71c627c4e91e214b2bd58bfca185fca82ed3daece316cfbb6","observation_id":"382fa7a2-9230-4d24-9ee2-4ed842a91160","resolution":{"observed_at":"2026-08-12T12:51:41.541108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-12T12:51:40.711422Z","title":"Belongie, Lubomir D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.711422Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:5d66afe4ead7359bf507855ba6eb2bc1137b0a50162d426e72341c7be6d8c9c7","observation_id":"ff5c7113-8c51-4a3c-86fe-85e11c9de11b","resolution":{"observed_at":"2026-08-12T12:51:40.711422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.716212Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.716212Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:4cae37539d42b1ee60d3449bf4351d1fe2b3f271f55bb78935dc95590daab4c0","observation_id":"abee4dac-2ad5-440b-94b5-42fa694949ae","resolution":{"observed_at":"2026-08-12T12:51:40.716212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.512437Z","title":"Pixmim: Rethinking pixel reconstruction in masked image modeling, 2023","venue":null,"work_id":"ffc723b2-43a8-4525-a33e-618e60cc8f98","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.721771Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:a09c97cf38b00062db3fb3ddb5ee0aade7edb6967a756d3782e393b9051ed61a","observation_id":"a010107b-b470-4050-ac08-369cd797543c","resolution":{"observed_at":"2026-08-12T12:51:41.516705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.499273Z","title":null,"venue":null,"work_id":"c171767f-9757-4900-914b-68241d9bba51","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.725300Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:6681a9c281cd78df6a8d28de4f96582e534f16edc5608457e50b40382589851f","observation_id":"20493c8c-2aa1-48b1-bc4c-003be8ac476d","resolution":{"observed_at":"2026-08-12T12:51:41.503453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.486143Z","title":"The three r’s of computer vision: Recognition, recon- struction and reorganization","venue":null,"work_id":"b30723da-d6b9-4c1b-bc55-5d65a7a05187","year":2016},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.729409Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:1198c947f94a02736952464384af44e74a4b21067ef1663b5e4edce85d4e8589","observation_id":"eed0506d-1610-4189-b9c0-26de57461b88","resolution":{"observed_at":"2026-08-12T12:51:41.490592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12210","last_updated":"2024-07-18T00:18:44Z","snapshot_observed_at":"2026-08-12T23:20:44.111648Z","submitted_at":"2024-07-16T23:17:36Z","title":"A Closer Look at Benchmarking Self-Supervised Pre-training with Image Classification","version":2},"cited_work":{"arxiv_id":"2407.12210","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12210","snapshot_observed_at":"2026-08-12T12:51:40.958183Z","title":"A Closer Look at Benchmarking Self-Supervised Pre-training with Image Classification","venue":"cs.CV","work_id":"06fa5703-0896-4d14-a511-d8aca34ba15e","year":2024},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.732606Z"},"links":{"cited_paper":"/paper/2407.12210","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:035aaa6b1741db4bf0737a914b0e483ca5dfb630c563bce3b4f5549c843bae02","observation_id":"e90a0feb-7cee-4a86-b7ff-cdf9c17f804e","resolution":{"observed_at":"2026-08-12T12:51:40.965233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.473477Z","title":"Vision: A computational investigation into the human representation and processing of visual information","venue":null,"work_id":"5e07ace4-4b95-4789-abf1-b8e2224b7d37","year":2010},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.736452Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:26e883794bac79b37b9c702a5eb8da94e8e221bce12fb7387a1fad3acf7b0dbc","observation_id":"ff5ebecd-3a8f-4994-8d7e-8895d677edfa","resolution":{"observed_at":"2026-08-12T12:51:41.478230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.459279Z","title":"Self-supervised learning of pretext-invariant representations","venue":null,"work_id":"20b77544-fa58-48a7-82a8-5f8f36e8b88f","year":2020},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.740232Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:f00f19908d1ac322c092831f61f19150067e0dcac2d97290232cbfcc6e1d0246","observation_id":"d984e83d-2e3d-46fa-941c-cf900d8b3841","resolution":{"observed_at":"2026-08-12T12:51:41.464049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.444301Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"36e8b3e0-c95f-4738-a1cf-31fff9b3f580","year":2012},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.744360Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:e4f19a361d8f0082adc448998d4ccc7de091c4da7c974e10e759ad2c9c33ec05","observation_id":"b3096d03-4cc6-4b07-bc75-f2216cea71ac","resolution":{"observed_at":"2026-08-12T12:51:41.448789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.428500Z","title":"How useful is self- supervised pretraining for visual tasks? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020","venue":null,"work_id":"80dd298d-369c-4ed7-926f-770256f0599c","year":2020},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.749791Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:d15da923e86113fece13b6dba218c0351dbb84c46b0612c34a3253abba2c1a08","observation_id":"932007ed-e588-4052-83f6-3d1fbd461610","resolution":{"observed_at":"2026-08-12T12:51:41.434291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.414327Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":"8b2da560-32f1-4a08-83af-5f51838f2be3","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.754033Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:8ecc07e9271f816cffb24abdb9e34d64478a2154547cf1f5a9ced336c9fbba66","observation_id":"e388b1a4-c5f9-46f0-a411-6eef87d90aa5","resolution":{"observed_at":"2026-08-12T12:51:41.419195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.385590Z","title":null,"venue":null,"work_id":"e2e142c3-acfe-4cfa-9ec0-f683d3fd2cc8","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.762345Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:832c19ec1ef0612ce31f57bbad59a9d189fa6dcf99b9b9970e27d90f91f6ec4b","observation_id":"0bb66d77-2ae7-486e-9c50-26e424e2f835","resolution":{"observed_at":"2026-08-12T12:51:41.391193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.369753Z","title":"Context encoders: Feature learning by inpainting","venue":null,"work_id":"a1c18e8f-9644-4c16-96ab-f0df938063b1","year":2016},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.766749Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:d06b020c71f773a060a579dff02684cf70368d79113058fd57bc8b94b313f5cd","observation_id":"055c816b-be2a-4655-9d21-abf002298c57","resolution":{"observed_at":"2026-08-12T12:51:41.374452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.354208Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers, 2022","venue":null,"work_id":"5af87895-534d-408b-82a7-07aefac48208","year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.771091Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:d0072701ebdf9a710fb942617f6bd1f544a3e610da7b3afd227aef81cef69a4c","observation_id":"9d97015e-03cc-4da6-a78d-4bd719e09359","resolution":{"observed_at":"2026-08-12T12:51:41.359434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.338718Z","title":"idisc: Internal discretization for monocular depth estimation","venue":null,"work_id":"e6cdea05-17b8-491a-877b-749a86dd464c","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.774941Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:f5951be585b5bf81186f2967c997a8fa6942667004d266125d83573a1e9fde01","observation_id":"a6b06439-17ed-4845-836a-deaa1a94e9d2","resolution":{"observed_at":"2026-08-12T12:51:41.344347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.322891Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"e719de37-5aa1-42d4-9a03-aaf99e7786f4","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.779147Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:7b47466864f1d004f006016b38f0fd5e6deaf108047e1f013144a63dd931f259","observation_id":"bd266f02-0036-4c9b-bfb8-49d8171a03f4","resolution":{"observed_at":"2026-08-12T12:51:41.327295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.303421Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"78dcbb0b-106f-4c22-9cd5-bc6475ed8da5","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.784620Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:8ad466980db0226008c2e0dd0acca24ba6ea1d28298de2d2759ea62ad364e187","observation_id":"c0943f24-efef-412a-ac05-9b2ad2829608","resolution":{"observed_at":"2026-08-12T12:51:41.309042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.788784Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.788784Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:4fa6b80610a422af907d114aa73fe23d293bf479be47fabb603e47dba4ff4c69","observation_id":"7b7170a6-1e5a-4829-8486-e07e1ae15ee4","resolution":{"observed_at":"2026-08-12T12:51:40.788784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.270984Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"ad3c7286-af31-4d11-a55e-3529f5ac375e","year":2015},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.792659Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:1b3f021204623dcd82dad9b65555e92b5f3176cb1fca382721b8a59f6a8e1e41","observation_id":"5395ae1a-f9a3-4edd-be47-c33f3d3c0d1c","resolution":{"observed_at":"2026-08-12T12:51:41.275872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.256258Z","title":"A Realistic Evaluation of Semi-supervised Learning for Fine- grained Classification","venue":null,"work_id":"6e907786-5bda-4ae5-9e1b-7f9f19fc6b6d","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.796511Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:0153d8b6130387240458a760c3628b94c68114f7aea0b8eb96b723715bf46042","observation_id":"4646621b-2b2b-4d80-92cf-da42181f81e7","resolution":{"observed_at":"2026-08-12T12:51:41.260466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T12:51:40.801419Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.801419Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:42c1b2a2399c7c22c72a191726524b5a171f42841d9841e51c7246b0adf57239","observation_id":"caf40125-4546-46ae-b200-a60859afc461","resolution":{"observed_at":"2026-08-12T12:51:40.801419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06363","last_updated":"2022-06-13T17:59:43Z","snapshot_observed_at":"2026-08-11T02:04:39.555564Z","submitted_at":"2022-06-13T17:59:43Z","title":"Discovering Object Masks with Transformers for Unsupervised Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.06363","snapshot_observed_at":"2026-08-12T12:51:40.805720Z","title":"Discovering object masks with transformers for unsupervised semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.805720Z"},"links":{"cited_paper":"/paper/2206.06363","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:86574662ce8642dc6f14924e387cac0fd684d5c3d4129e0630f61eb8974e8bfe","observation_id":"04cc993d-d815-420e-b3ea-bcc5b2b34e4d","resolution":{"observed_at":"2026-08-12T12:51:40.805720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.241189Z","title":"Benchmarking rep- resentation learning for natural world image collections","venue":null,"work_id":"406f5cf3-a057-47b9-80b2-cde3e903c4f6","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.810312Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:f81c4e88422f022aa38920428213caf681f9769a1d69c4c1d1a771a19fd8f0bf","observation_id":"eb9f7c1f-8bf9-47df-8c1e-89f89a0ca52c","resolution":{"observed_at":"2026-08-12T12:51:41.246902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.224755Z","title":"Dense contrastive learning for self-supervised visual pre-training","venue":null,"work_id":"554bba58-9746-4b0f-864b-9401aceb9241","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.814801Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:a3312b71c5be18298e9d76d7012367d7d37a1847acd53159e9e219abd7d4109e","observation_id":"f0207735-902a-490f-ab7a-cc868fb83273","resolution":{"observed_at":"2026-08-12T12:51:41.229865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.209447Z","title":"Freesolo: Learning to segment objects without annotations","venue":null,"work_id":"18680296-2f30-4210-92b1-59a021c9caa0","year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.819796Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:bee156ac5814bc0589351a34469a59dfac9630f8ca064b057b4ce59f366cb73a","observation_id":"6e243435-ddb0-472b-a2cb-a911647556c8","resolution":{"observed_at":"2026-08-12T12:51:41.214787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.193466Z","title":"Yu, and Ishan Misra","venue":null,"work_id":"aeac90c2-5892-43a0-9e41-7221b6acd280","year":2023},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.824129Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:0ed0f3dea081033d8489105e431d9c87e20ddf2c5732b3606c665d613fa3285c","observation_id":"c66e3d65-c375-4764-927f-1bdf137c1228","resolution":{"observed_at":"2026-08-12T12:51:41.197642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.172095Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":"bd12bb57-af29-44ce-b8a0-2817b6fd2198","year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.828274Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:89b64bed2fa9aa609126497f3928e0b39036645238b80aa1a3e42ee6885a3545","observation_id":"abca6ed6-fbce-4b0b-9159-1b63055aeb7b","resolution":{"observed_at":"2026-08-12T12:51:41.181143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.157724Z","title":"Croco: Self-supervised pre-training for 3d vision tasks by cross-view completion","venue":null,"work_id":"b0d787ab-f90e-4e9b-a8dd-1f1651caf883","year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.832916Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:cf62e9493245167af881aee2da29e095979cf6d6a6b3ba6c00406e570842c0b1","observation_id":"d5b5a2a1-3c66-44c5-89fc-59427b65a672","resolution":{"observed_at":"2026-08-12T12:51:41.163241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:40.837072Z","title":"CroCo v2: Improved Cross-view Completion Pre- training for Stereo Matching and Optical Flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.837072Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:456db581feddc5f849306461b09f96b8ea6a97d89149783426b072c892b6d6c3","observation_id":"7d6034bf-36e8-4dff-a56e-d795fe740096","resolution":{"observed_at":"2026-08-12T12:51:40.837072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.136385Z","title":"CroCo: Self- Supervised Pre-training for 3D Vision Tasks by Cross-View Completion","venue":null,"work_id":"72c8cee8-bd4b-4e03-8b0d-8a02bd6c7590","year":2022},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.841137Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:faaaac7c04e7297fc4c3636800a58e730b642b2822f50151eca233373a3c6ae5","observation_id":"58113a81-9d98-4603-b3b7-e43aa5fe2227","resolution":{"observed_at":"2026-08-12T12:51:41.141801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.122201Z","title":"Un- supervised feature learning via non-parametric instance dis- crimination","venue":null,"work_id":"29f31a1f-3cc6-458d-9877-dcb7f004602e","year":2018},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.844952Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:b661187f6f1e72924aebcdfd3659521a3322eb539724b00e9b1f43819c8a8fb6","observation_id":"25c53422-611c-42a6-be5c-ec628763c9a4","resolution":{"observed_at":"2026-08-12T12:51:41.127285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.102350Z","title":"Clusterfit: Improving general- ization of visual representations, 2019","venue":null,"work_id":"47629f04-c472-47b8-98a7-4f2ed6bd8d48","year":2019},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.848931Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:53cb71fd3aa5043c4ae1d434dc69a2dd21852a1ace11da5ddeaa0650ad2bbc11","observation_id":"c3cce160-e538-4536-ad66-7381edb3666e","resolution":{"observed_at":"2026-08-12T12:51:41.107096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.087016Z","title":"Zamir, Alexander Sax, William B","venue":null,"work_id":"6d087c12-5ed3-41f8-8a73-66c32bf5608a","year":2018},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.852262Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:424a61de00bcb8878372b7c7fa73681e056813d2256f67ad925c430ba91ffab4","observation_id":"bed80d65-8287-4c1a-bf0f-50591e9eb1ff","resolution":{"observed_at":"2026-08-12T12:51:41.091210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.070069Z","title":"Barlow twins: Self-supervised learning via redundancy reduction, 2021","venue":null,"work_id":"383928ed-c914-478e-8fd3-97128edad4dd","year":2021},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.856298Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:d03618d8258518c67555a714c2b3bbdc9007d411b23d8ff26ce48fa6e456662e","observation_id":"233e70bb-0b23-45f6-92ae-d439043583ac","resolution":{"observed_at":"2026-08-12T12:51:41.074772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.054634Z","title":"Colorful image colorization","venue":null,"work_id":"028818f4-8c08-45d0-bb52-ee3feb4593f3","year":2016},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.859725Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:579746e9f4e6492c885d463e88082ca2fbbc0ab9edb192466eab510cf51a4cfd","observation_id":"0aaddf92-438d-496a-b20e-9a291338c405","resolution":{"observed_at":"2026-08-12T12:51:41.059806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-12T12:51:40.863287Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.863287Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:160168d5b7e7291f09e098c331c1282f7a0618cd5e39324700ed85241180ebf4","observation_id":"7c5892a1-d4c2-435d-84c6-dbdf0bb478ef","resolution":{"observed_at":"2026-08-12T12:51:40.863287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.027432Z","title":"The 2D projection error is then defined as: Error2D = ∥p′ − q∥2 where ∥ · ∥2 represents the Euclidean distance in the image plane","venue":null,"work_id":"3c525721-762b-4d3c-971a-a9e94138e16b","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.872856Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:53560f3bcaac7cf199c05188d5755d8bf515a7f5e0c6ec1a479673f1a19baf26","observation_id":"6b8170c1-dcbb-41d0-af0a-70c4371003d9","resolution":{"observed_at":"2026-08-12T12:51:41.032313Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.400297Z","title":null,"venue":null,"work_id":"eddbd05c-26d1-4f89-aa79-1973529db9ae","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.758329Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:066a61aca09baf86945b7014b69ca474a6f72ae1ffc60576ebbb2f6f9fa0420e","observation_id":"89d9b158-c280-41fa-b8ab-9d70d6eaa657","resolution":{"observed_at":"2026-08-12T12:51:41.405191Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:51:41.041472Z","title":"student” network and a “target","venue":null,"work_id":"d591e2db-564e-4799-921e-3b74c9c03c7e","year":null},"citing_paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T12:51:40.868021Z"},"links":{"citing_paper":"/paper/2411.17474"},"observation_digest":"sha256:39467263027f77031dbce63f87a1127deb26d8428347c508b05d0ae1219978a0","observation_id":"ea1ecf5e-ce67-4832-b795-d08d0e7ee2a3","resolution":{"observed_at":"2026-08-12T12:51:41.045901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17474","last_updated":"2024-12-16T18:55:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:47:22.447604Z","submitted_at":"2024-11-25T18:59:50Z","title":"Probing the Mid-level Vision Capabilities of Self-Supervised Learning"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":16,"verified_exact":1,"verified_fuzzy":55},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2411.17474."}