{"as_of":"2026-08-08T06:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43a6e471c4abff1efa6fedcbbf8e08a55fc350f79d1d10edb0d9f93419592ebc","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:52:54.973978Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05409/citation-record","integrity":"/paper/2506.05409/integrity","json":"/paper/2506.05409/citation-record.json","paper":"/paper/2506.05409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-08-07T13:01:28.667448Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-07T10:52:54.657235Z","title":"Deep vit features as dense visual descriptors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.657235Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:ebfa6c98dc8a40e9018376ea4b5134d642974c0cdf5088b187ddfc5d19f74ed5","observation_id":"0c4c77bd-525f-4379-b8ac-ad7ba49c8b22","resolution":{"observed_at":"2026-08-07T10:52:54.657235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.662402Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.662402Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:182139b813f1ef3f0b17b18cc59cc51a6d757b722df1317cfff054a1788dc5a5","observation_id":"8f4f1e59-bdc1-417a-94f1-0755f3bcd612","resolution":{"observed_at":"2026-08-07T10:52:54.662402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.608230Z","title":"Towards in-context scene understanding","venue":null,"work_id":"bed977f9-3d4a-4b3a-ba46-08400be2132b","year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.666837Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2e619042adf508222dee8dbc431b6ff36bef68bde3401a1c9e2ba029619b17e1","observation_id":"39f8aa84-736b-4159-b3c9-ac111e486596","resolution":{"observed_at":"2026-08-07T10:52:55.613282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-07T10:52:54.797778Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.797778Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:30a008ef6b0640d4ffb12a829e8347eccf51eb43f4f524f890caddc6d43f72fa","observation_id":"d601e02e-6555-4c2b-bed4-86e731552f7b","resolution":{"observed_at":"2026-08-07T10:52:54.797778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T10:52:54.802249Z","title":"Are we done with imagenet? arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.802249Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:de1d62804c1f439b12a88b61b9d121fb75094726a77356a9c95bf5f5feba55cb","observation_id":"d4e66b74-3c82-41a3-91cd-9a3d2daea8e2","resolution":{"observed_at":"2026-08-07T10:52:54.802249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-07T10:52:54.806304Z","title":"Monet: Unsupervised scene decomposition and representation","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.806304Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:636c8c8353334c897dd73ff409bd9365f97b240073cb080fd045707c91501213","observation_id":"fd8d6619-be2a-41c8-80f6-6679c54ededb","resolution":{"observed_at":"2026-08-07T10:52:54.806304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.811166Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.811166Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2c375e0f3b98755e86c23245fa10d7905a3560c6da9ff7af8d624401c28ce692","observation_id":"3ab378cd-c2ec-4af3-aa9d-9ce881e0176d","resolution":{"observed_at":"2026-08-07T10:52:54.811166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.815084Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.815084Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:153ac7538767e53e5a805ac6ea3518beffe7d922576b5e995217de408b7c746a","observation_id":"2bc2c9a5-7fa3-49c1-a992-c00bf875414b","resolution":{"observed_at":"2026-08-07T10:52:54.815084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.818818Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.818818Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:5aa54004350c6a8e92c5784582c1cc4a27e95052b78419485a3d363fcac1f1ac","observation_id":"9c82dc22-3163-4437-b965-6312223d0ff1","resolution":{"observed_at":"2026-08-07T10:52:54.818818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.822453Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.822453Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:0547aeff38ae158e28170e2b4b6ca3a2c03e265c2914e091a2dca2154140fe29","observation_id":"6299418c-e640-408f-9168-6fa5a6d2a5e3","resolution":{"observed_at":"2026-08-07T10:52:54.822453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:52:54.826195Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.826195Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:b3cf0dbcb27dedae1cf83242e9cbf0875bd5a97d7c54258d2767173e11f0df57","observation_id":"67f2652a-8366-43d9-8cec-7b9faaf0147f","resolution":{"observed_at":"2026-08-07T10:52:54.826195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.554899Z","title":"On the transfer of object-centric representation learning","venue":null,"work_id":"057f9138-bd3b-4891-84b6-7bb81ae89b7a","year":2025},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.830333Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:41d311db3e21932da90ff626859d30bc8798c241d81b97804e856c2ce85e2817","observation_id":"85f2dc7d-ebbe-4e57-8242-e868f51b76f3","resolution":{"observed_at":"2026-08-07T10:52:55.559232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.541131Z","title":"Attention over learned object embeddings enables complex visual reasoning","venue":null,"work_id":"eb4a1f21-10c1-4297-8057-cf657befcff7","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.833978Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:74e3d81b9638bb8266e85dfb48a1563ec3655644b0e1afd06dec8680e201c3cb","observation_id":"263ed725-ad70-4fa0-bbb4-5400f5cb24b8","resolution":{"observed_at":"2026-08-07T10:52:55.545518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:52:54.837670Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.837670Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:17f3402553b1a933101796bea575128e5e78276225414706c443649f30f0ec35","observation_id":"54bf1c76-00f2-4e1e-9baa-e2726dd3ca84","resolution":{"observed_at":"2026-08-07T10:52:54.837670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.841715Z","title":"The pascal visual object classes challenge: A retrospective","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.841715Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:cb53c3185d691d47ca63bdcbc2a738a8621ab1bbe604c22e616a64960d58481e","observation_id":"d8b15774-5d64-403f-80cc-e47d18cce68e","resolution":{"observed_at":"2026-08-07T10:52:54.841715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.845527Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.845527Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:06138df653d521836de1ba77faeca03a0d308bc300a3e396f39ae46e58ac4dfc","observation_id":"2662183d-8910-4f6d-b7c4-603567a3e4f7","resolution":{"observed_at":"2026-08-07T10:52:54.845527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08414","last_updated":"2022-03-16T06:08:47Z","snapshot_observed_at":"2026-08-05T19:30:04.459795Z","submitted_at":"2022-03-16T06:08:47Z","title":"Unsupervised Semantic Segmentation by Distilling Feature Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08414","snapshot_observed_at":"2026-08-07T10:52:54.849121Z","title":"Unsupervised semantic segmentation by distilling feature correspondences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.849121Z"},"links":{"cited_paper":"/paper/2203.08414","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:9ba3cf3a27748d5e6aa0875bccdba570406eaab3e0fe4d011783b82b888c16ed","observation_id":"72ff2598-229a-4858-af51-980ec1c33472","resolution":{"observed_at":"2026-08-07T10:52:54.849121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.508564Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"5e7b3a7f-92b2-4bf6-8054-8f99bac8138d","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.853099Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:edf0495827dae0246e92e9e4da801b7ec36fec4130368b618a50b3ff5c8cd577","observation_id":"af5ffdda-990a-4b83-baf3-f15dbf0de28e","resolution":{"observed_at":"2026-08-07T10:52:55.513013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.495438Z","title":"Efficient visual pretraining with contrastive detection","venue":null,"work_id":"4bb6f09c-e982-47f6-980f-9890913d95d8","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.856862Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:f70ede7821259166047e82587757569796d3c4f951f817ab98928f285471364e","observation_id":"1fb37551-0c9e-4e79-9c16-9b27a6ff328c","resolution":{"observed_at":"2026-08-07T10:52:55.499495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.481858Z","title":"Object discovery and representation networks","venue":null,"work_id":"e5d78089-285a-4d5d-9f3f-8a73d4ee5e48","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.860732Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:768bd9732361ec1ff29d8863d93b4fa300bb90210c9105a29d6bc00871e6a7e6","observation_id":"808d2e15-e936-4218-8433-32d75d576558","resolution":{"observed_at":"2026-08-07T10:52:55.486121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.864448Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.864448Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:0e5d4432ec25fd7bbf44d8890ea2e10570154558019a96196a025213b531beb2","observation_id":"218af056-abeb-4cd7-aa74-1ac8f2c8b639","resolution":{"observed_at":"2026-08-07T10:52:54.864448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07855","last_updated":"2024-03-03T09:57:57Z","snapshot_observed_at":"2026-07-06T16:31:29.379540Z","submitted_at":"2023-10-11T19:57:51Z","title":"CrIBo: Self-Supervised Learning via Cross-Image Object-Level Bootstrapping","version":2},"cited_work":{"arxiv_id":"2310.07855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07855","snapshot_observed_at":"2026-08-07T10:52:55.100358Z","title":"CrIBo: Self-Supervised Learning via Cross-Image Object-Level Bootstrapping","venue":"cs.CV","work_id":"a1adae35-a480-46d2-8fdc-32dcf38ff242","year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.868199Z"},"links":{"cited_paper":"/paper/2310.07855","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:16921070f108fe6957bd9a1c316df2c27c4f8c8369f096256dba23e644c0ce6e","observation_id":"bfbcf340-dcd5-43b8-92d1-87691d22e3bd","resolution":{"observed_at":"2026-08-07T10:52:55.106571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.872053Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.872053Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:839033b04ef4e3bdf04ee568d9aeec201bbf653ec986390fec63d66cc8a3ae30","observation_id":"32f05046-d05f-442a-b0ca-db80917fbbd6","resolution":{"observed_at":"2026-08-07T10:52:54.872053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.449222Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"f372f24b-3fea-423b-ac96-651c53c39ca3","year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.875853Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:c549c998513fe1cb6c8b5c5f35e02244f29c289fc63e9153ca7ab21abe7f71a6","observation_id":"dc097102-f3a6-4cac-bc94-2a7590b8a648","resolution":{"observed_at":"2026-08-07T10:52:55.453723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.879463Z","title":"Object-centric learning with slot attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.879463Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:870271061881aedcf87acf558758a7f632160456eea9f06d54f325036bcef1d5","observation_id":"77737830-6a7d-4300-a8ba-e13d6cac174d","resolution":{"observed_at":"2026-08-07T10:52:54.879463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.425959Z","title":"Class-agnostic object detection with multi-modal transformer","venue":null,"work_id":"3eb5a763-9fc2-4a76-8e14-811183eb7331","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.883202Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:5ace17760256e81b000ddbcdd928f10d5bc3f3e3866af20b5043d40b6d849dd7","observation_id":"3090c0ee-6db9-4f8e-9af0-b3132d803359","resolution":{"observed_at":"2026-08-07T10:52:55.430040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15589","last_updated":"2025-03-03T11:48:03Z","snapshot_observed_at":"2026-07-06T18:50:00.486434Z","submitted_at":"2024-07-22T12:26:08Z","title":"Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15589","snapshot_observed_at":"2026-08-07T10:52:54.887043Z","title":"Exploring the effectiveness of object-centric representations in visual question answering: Comparative insights with foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.887043Z"},"links":{"cited_paper":"/paper/2407.15589","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:bf9da71df286147b2909cf80fced032a7352432b66317c8be75c45cd32177fab","observation_id":"4b8de29f-a972-4d86-b301-0374c377f368","resolution":{"observed_at":"2026-08-07T10:52:54.887043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.412431Z","title":"Unsupervised learning of dense visual representations","venue":null,"work_id":"676e81de-1047-47fe-8109-536295204584","year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.891247Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:eff7f21a8aee8e68769a35bcc3a16e3416cdfd865ac3923e7fa7857f25e05e00","observation_id":"d30f897e-0ba8-4e5d-9208-a8839eadecd8","resolution":{"observed_at":"2026-08-07T10:52:55.416858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.399104Z","title":"Neural congealing: Aligning images to a joint semantic atlas","venue":null,"work_id":"acf3cc8b-f5ed-4abd-b052-3c0fd9fad6fb","year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.894863Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:a31a2e7320da2f55d5a079fae72e0f50a6b8a0a3cb772c135eadb29d52bd3ad8","observation_id":"969274a8-d206-4e24-b87b-dc8e53d88812","resolution":{"observed_at":"2026-08-07T10:52:55.403336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T10:52:54.898506Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.898506Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:5c2fe8160a3cf692dcdac27567dd295798d3b8212b9d1a2a337429e062f78b13","observation_id":"861c41db-1346-4146-bde7-de33800adf3e","resolution":{"observed_at":"2026-08-07T10:52:54.898506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.385710Z","title":"Improving language understanding by generative pre-training.(2018), 2018","venue":null,"work_id":"ad906de3-5cef-46bb-9773-2e9b21cfd3c6","year":2018},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.902139Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:659ac3e2711eec3cb5a48b741b7ed4860826379f2af7cc54a518af1f58e95d00","observation_id":"027c8501-67b8-4c3c-ad2b-f0a534165b98","resolution":{"observed_at":"2026-08-07T10:52:55.389838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.906427Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.906427Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:b7138fe8bb1f496945d85ecd73e92651f0b88b30ed80b9f148bc79e54fd45956","observation_id":"3b797630-d64c-402c-a2ca-98a1076a9a89","resolution":{"observed_at":"2026-08-07T10:52:54.906427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:52:54.910228Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.910228Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:b9abcbc50acb1ce9d702904a0bdd80341331c9f63ffe4ce8504ef236cf027133","observation_id":"d89c2bf2-2718-4400-95ba-7d5a8618fc91","resolution":{"observed_at":"2026-08-07T10:52:54.910228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.914054Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning, pages 5389--5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.914054Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:c5b6754269b6541746d56359425ed5d36542c3e584a727721c8fe1a2825f0659","observation_id":"4cf3507e-0984-47a2-b9a9-dc5fd72da7f1","resolution":{"observed_at":"2026-08-07T10:52:54.914054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.918254Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.918254Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:d48fe1e54e45dfe09a9a8714e0413e5f68acb5172a0f8219a90cc9234d5dec90","observation_id":"7619d09c-7cee-4089-9e7a-f6e24c628ba5","resolution":{"observed_at":"2026-08-07T10:52:54.918254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07092","last_updated":"2025-04-10T21:45:00Z","snapshot_observed_at":"2026-08-07T16:07:06.100185Z","submitted_at":"2025-04-09T17:59:05Z","title":"Are We Done with Object-Centric Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07092","snapshot_observed_at":"2026-08-07T10:52:54.922097Z","title":"Are we done with object-centric learning? arXiv preprint arXiv:2504.07092, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.922097Z"},"links":{"cited_paper":"/paper/2504.07092","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2292146f62f9eec568107f124ec0a7dc37575e5d5f94faed6d7b4a70df7b8f12","observation_id":"baf18923-4db5-43d0-af5b-28b6817b5366","resolution":{"observed_at":"2026-08-07T10:52:54.922097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14860","last_updated":"2023-03-06T23:19:17Z","snapshot_observed_at":"2026-08-06T15:09:47.073411Z","submitted_at":"2022-09-29T15:24:47Z","title":"Bridging the Gap to Real-World Object-Centric Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14860","snapshot_observed_at":"2026-08-07T10:52:54.925946Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.925946Z"},"links":{"cited_paper":"/paper/2209.14860","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:9453775264fe5957338b88431440b1f56041a7ffa65a96a7b2d8f4d7c878c882","observation_id":"1b30982e-6436-4d6c-927c-eb499cc00399","resolution":{"observed_at":"2026-08-07T10:52:54.925946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.345259Z","title":"Evaluating machine accuracy on imagenet","venue":null,"work_id":"0b3f78d0-96e6-49f3-bb28-3282bcc24fe5","year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.930160Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:ec64a81a350017a42820d60e6970930c3fc2f33a179429599223170fdb3a27fe","observation_id":"99228d01-3c03-42b2-b57d-d507dc5750ff","resolution":{"observed_at":"2026-08-07T10:52:55.349341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.332145Z","title":"Croc: Cross-view online clustering for dense visual representation learning","venue":null,"work_id":"b25d6039-4779-4764-9a51-687ae034b2f3","year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.934008Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:11914624cb6b0d4300bcce729e74260f773998e8529a405106acf7a254818bbc","observation_id":"c37011a0-5ce3-4742-8d9c-072e910e3825","resolution":{"observed_at":"2026-08-07T10:52:55.336102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.318346Z","title":"Convnets and imagenet beyond accuracy: Understanding mistakes and uncovering biases","venue":null,"work_id":"bc42f924-17d2-430d-9a67-b77a10900cd2","year":2018},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.937717Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:6bc4e557e51af6fcaac34b49bf08f9581db2542e21a89090dd708495abb36510","observation_id":"e3432fdd-81b0-4249-ae5b-d1a5451d2af9","resolution":{"observed_at":"2026-08-07T10:52:55.322766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.941851Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.941851Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:dadc32446bb596e0c6972a52325e9eba9cafe901c7b2f5490efc782b97b7a9ed","observation_id":"72da9c3d-4061-4759-9807-9c8d44cef805","resolution":{"observed_at":"2026-08-07T10:52:54.941851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.294718Z","title":"From imagenet to image classification: Contextualizing progress on benchmarks","venue":null,"work_id":"142b524a-ba92-40f3-8a6c-9c6d1bed5c13","year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.945813Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:318d26bec9c3fb995bc1f6a04fe6a4acaadfa93e253d74a476a8a7dadd9a14fc","observation_id":"767d379c-3c0b-4cf9-a642-97cef43c6653","resolution":{"observed_at":"2026-08-07T10:52:55.299105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.280398Z","title":"Splicing vit features for semantic appearance transfer","venue":null,"work_id":"02fac546-7b10-4cb1-a095-d63c30490167","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.950041Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:945894d54bf6f01268bbe641dba3447f730ca11b84f407fe498d7af757346758","observation_id":"00c2909d-3221-4241-827c-b060f92fc604","resolution":{"observed_at":"2026-08-07T10:52:55.284466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.267514Z","title":"Dense contrastive learning for self-supervised visual pre-training","venue":null,"work_id":"7669e3ba-5683-4925-8da6-e53adaea7a68","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.953887Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:ebc19d043537d97f105302d2e9d5bfca68c99bc91817052725fc0327eb544a87","observation_id":"06994615-4d3a-46b6-b97e-381d17e14ad5","resolution":{"observed_at":"2026-08-07T10:52:55.271415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.254250Z","title":"Self-supervised visual representation learning with semantic grouping","venue":null,"work_id":"63f49cf3-8514-432c-87c6-fc036f3a73cb","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.957725Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2ce47cb54dd5324ff179d117dabf65b1aafe6d899207754e9143fc0981334368","observation_id":"5b50c22f-d140-43ab-89bc-aa9cd0b8cb87","resolution":{"observed_at":"2026-08-07T10:52:55.258331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.240244Z","title":"Unsupervised object-level representation learning from scene images","venue":null,"work_id":"a505ee18-db5c-403b-997b-4e9ab4479d01","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.961699Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:83d386fed1340310dbcf164a9bafa5f299a0f8cf4292fc46f9b1f4a6b733f7f0","observation_id":"2b237aeb-0368-412d-b3c6-afe5ac14ecd9","resolution":{"observed_at":"2026-08-07T10:52:55.244587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.226508Z","title":"Re-labeling imagenet: from single to multi-labels, from global to localized labels","venue":null,"work_id":"bcc9f0d7-9996-44da-993d-6f0341a0d87f","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.965391Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:9e4672de3a5eeb1061013d5ea32680f84d4c5ea7cdd0fa15933c12bffe79fa78","observation_id":"b57b8659-4670-4432-ae26-c2d605449ecf","resolution":{"observed_at":"2026-08-07T10:52:55.230722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.969995Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.969995Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:56b1339f08ff9a3fc27c6fd395eb6e72350209aeb130daa87534466467ca2e55","observation_id":"562eab54-3c33-493d-8da8-fa3795e212ab","resolution":{"observed_at":"2026-08-07T10:52:54.969995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-07T10:52:54.973978Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.973978Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:565f2c8402ed653c23e9a6cf36ea2f819ea09686cd4ae8dff3fe6515995e033e","observation_id":"18ca66a9-4989-4c00-b86e-31483b866a09","resolution":{"observed_at":"2026-08-07T10:52:54.973978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.05409."}