{"as_of":"2026-08-05T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:092f16c53dd889a14a2db402839fdc8c6ea916e117b793bf8eeb79d9e1a551c4","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T04:17:19.878360Z","state":"measured"},{"denominator":137,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":137,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1299,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:55:43.122288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T00:07:42.299741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2305.15404","last_updated":"2023-12-11T13:20:50Z","snapshot_observed_at":"2026-08-04T13:24:48.417848Z","submitted_at":"2023-05-24T17:59:04Z","title":"RoMa: Robust Dense Feature Matching","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T08:56:39.120899Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2305.15404"},"observation_digest":"sha256:a3bbe37e366de88f28fedf58905291bd708e0e3d117bb6147c71211a81954b36","observation_id":"577d983d-58a0-4a35-a2ee-2e27ae4f9a2f","resolution":{"observed_at":"2026-05-24T08:59:14.891821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:0f5d15de5ff406f6638331a8a8beb54c061b20be6de54427751741600d808afd","observation_id":"2e7b95bf-ef3d-4ca8-b2ba-ab0734c7791a","resolution":{"observed_at":"2026-05-16T02:56:42.293758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T08:25:20.868735Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2308.13561"},"observation_digest":"sha256:5f29bc0d69c220b368431e88b1502eed305e97fd3a9c23d5d98c6e3e3278b856","observation_id":"c758da9f-4ae8-4c2a-829c-5088e4d69c04","resolution":{"observed_at":"2026-05-15T08:25:20.895920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-05T00:06:47.268747Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:ec44c2c7bb5b702348161867884ab139c7240b2eb76b328893d291c30189fd70","observation_id":"a1b0f07f-ab34-41b3-9bb8-417fb5194bdc","resolution":{"observed_at":"2026-05-13T09:41:38.090469Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:3a65d5e4f08d7a642286ab3c15f7b1bfa7275948b56bba168f092d63eb891336","observation_id":"c18b963d-d5e6-4add-aa51-6e8965ce4b82","resolution":{"observed_at":"2026-05-16T08:12:31.100422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2310.07379","last_updated":"2023-10-11T10:54:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-11T10:54:44Z","title":"Causal Unsupervised Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T05:53:15.996646Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2310.07379"},"observation_digest":"sha256:0140803f40cd781f0594168a3757dd1c56d556fe01204c64f3e6b1c980e8c929","observation_id":"a28bd355-7217-4e35-879d-d1ba5c41ef21","resolution":{"observed_at":"2026-05-24T05:53:57.285384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:b49e5bfd5d57ef24b3796dffd7eac9e18e929e826da50668100651e89578000c","observation_id":"c4a0bc69-d527-426e-bb7a-b1c3b5d43e85","resolution":{"observed_at":"2026-05-13T22:46:10.078185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2401.02458","last_updated":"2026-04-29T07:43:10Z","snapshot_observed_at":"2026-07-29T23:57:44.096283Z","submitted_at":"2024-01-04T08:00:32Z","title":"Data-Centric Foundation Models in Computational Healthcare: A Survey","version":3},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-05-24T04:13:05.328492Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2401.02458"},"observation_digest":"sha256:cf9b0b811f5451b6711da4bfdea26bd39e2747bd21b6a81598427987f15313c8","observation_id":"1d8194b2-b8a3-4c50-922f-23b075ee3a32","resolution":{"observed_at":"2026-05-24T04:13:52.777696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:6221d49f7ab2e9296dd20193471e17264d0cca86141e5cbaf068d38bde007cdc","observation_id":"ba32c141-fd1b-4623-b3e4-291510747b5d","resolution":{"observed_at":"2026-05-16T07:02:54.029334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:e7de69aa636ef510ce97289eaae2d6cf3a57c8bbfc5fa4a7a1a69ec705f2b332","observation_id":"3cb14679-d2ff-4fa7-8471-f157b95c1c26","resolution":{"observed_at":"2026-05-17T02:46:16.788683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:bf520d5db103c28f1a7bff6d430e1dc00e15bee608f224c82ab072445706819c","observation_id":"6827c88e-c9f4-4974-9d28-a097dea10b28","resolution":{"observed_at":"2026-05-16T04:09:36.151501Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-02T05:40:31.086014Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"reference_index":263,"source":"arxiv_source","source_observed_at":"2026-05-12T12:40:23.709098Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2404.08471"},"observation_digest":"sha256:30ffa97588137796b6357dcc4d12b2aca7be1aebd01d77abe1d02def665cfc8f","observation_id":"e49771d3-488e-4d21-b591-bf848bf5d706","resolution":{"observed_at":"2026-05-12T12:40:23.983455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2405.04211","last_updated":"2024-12-12T18:42:37Z","snapshot_observed_at":"2026-08-01T23:56:58.131821Z","submitted_at":"2024-05-07T11:24:37Z","title":"Leveraging Medical Foundation Model Features in Graph Neural Network-Based Retrieval of Breast Histopathology Images","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-24T01:09:07.277220Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2405.04211"},"observation_digest":"sha256:91a6218668f537bb0e5c2bc63eea5be992fa48a39498b3e76474b69f70209b84","observation_id":"80e3b255-1a0f-4d1d-be93-5dab2b44f614","resolution":{"observed_at":"2026-05-24T01:13:42.982734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-01T15:05:23.324854Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-05-15T06:03:56.328012Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2405.07987"},"observation_digest":"sha256:07400cc0f64d2e82a62a99f0de67202ccc99dbfefb1bc8642c18b74670045507","observation_id":"2e95bcef-086c-4e18-9468-a39b72a2bae7","resolution":{"observed_at":"2026-05-15T06:03:56.614486Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:fc72d3dd6e1446b6f770fd9495ff07d13fe96c7ef3e569c49468d3a0c935e83a","observation_id":"9d98c612-6b4b-46ef-80d9-e0a50e3b47bb","resolution":{"observed_at":"2026-05-10T14:46:36.324591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:248ad17b7434b5a9de45c793b61fd73c32f71d7ebb35a1571e29b14bc75bae49","observation_id":"bcc57d77-533f-44e5-ba13-1e1ea51e6e6d","resolution":{"observed_at":"2026-05-11T06:01:53.869766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:25:17.847571Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2409.01652"},"observation_digest":"sha256:56306be42c8a2ce19b10ad1fa2ed6fcadfe724069c6426537622da6629500caf","observation_id":"507ab40c-7d9b-4c79-bb9b-06b34cea6ec6","resolution":{"observed_at":"2026-05-16T08:25:18.015536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:fe22091f5a024cbbf33680eeb7052d8487a7b8851ca9004519eec664360f7e9c","observation_id":"cc5d14ed-fe89-45d6-b204-2febe308a956","resolution":{"observed_at":"2026-05-14T00:51:48.393113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:a1f74b98e30f8d17973ff1913318da12d13cec4dc8ad10a685ef7f15565f7a7a","observation_id":"e13f6784-27fc-4f31-a098-5fce1a425133","resolution":{"observed_at":"2026-05-15T01:55:12.679057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2410.04941","last_updated":"2026-05-18T08:56:27Z","snapshot_observed_at":"2026-07-06T19:28:56.719504Z","submitted_at":"2024-10-07T11:35:24Z","title":"TOAST: Transformer Optimization using Adaptive and Simple Transformations","version":7},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T19:46:07.124996Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2410.04941"},"observation_digest":"sha256:eb17899eb9be0ccb70b77aad2c0a3e3a9a5fd3da14674c970ecf53f0c202bbaa","observation_id":"61c9ea69-b5ee-4590-bad6-dba33e6bffd7","resolution":{"observed_at":"2026-05-23T19:48:23.026543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2410.06355","last_updated":"2026-05-08T17:50:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-08T20:46:39Z","title":"UNCOM: Zero-shot Context-Aware Command Understanding for Tabletop Scenarios","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T19:17:12.954354Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2410.06355"},"observation_digest":"sha256:5b812ed039fd9e96350d7a921c15d23ca491eb4b2c9b1cc137431cc1be6d9702","observation_id":"a07877d8-63bb-4be8-9e92-280e74695b8a","resolution":{"observed_at":"2026-05-23T19:18:20.622008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:4880178283c3d3234cc44810443b07eac9b9c8591782410b021f006520a99b8b","observation_id":"2493597c-661c-4c95-aa04-690c68546a8b","resolution":{"observed_at":"2026-05-16T13:53:33.682274Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T16:06:09.448517Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.04983"},"observation_digest":"sha256:0419525ce0797871a76768ec2d9a44e272d20ea2019c1bb14ff82637adc0013c","observation_id":"954f3313-166b-48fd-9fad-01a0ebc22257","resolution":{"observed_at":"2026-05-17T16:06:09.565500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2411.14295","last_updated":"2026-05-03T12:27:01Z","snapshot_observed_at":"2026-07-06T19:53:52.079055Z","submitted_at":"2024-11-21T16:41:55Z","title":"DissolveStereo: Coarse Depth Injection for Zero-Shot Stereo Video Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T17:17:48.961672Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.14295"},"observation_digest":"sha256:004fb4096d7bada8f14a4ba113cfb3269648d13064ded37d56d49b8daa27379f","observation_id":"939fee17-02ae-477d-a9f4-6f81433fc6f7","resolution":{"observed_at":"2026-05-23T17:18:13.915063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":229,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:96e6a69550e7d136d0dc8b9d484c54360beb36e701b62d7aaa6f191d12b807d8","observation_id":"3c98600f-acdc-4a4f-854f-28d7deed86b4","resolution":{"observed_at":"2026-05-19T11:08:27.800783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2412.07584","last_updated":"2026-04-28T15:45:36Z","snapshot_observed_at":"2026-08-02T06:54:38.590926Z","submitted_at":"2024-12-10T15:20:23Z","title":"Multimodal Contextualized Support for Enhancing Video Retrieval System","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T07:14:34.843867Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.07584"},"observation_digest":"sha256:af40aaa7214e200455abc46180f931d8a27777f2f8536b22a939048b4cc6592e","observation_id":"a3cb008c-22b0-44a4-af34-5c67146fb598","resolution":{"observed_at":"2026-05-23T07:15:28.477625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:dde7963a937fabe4a503019c584830c6b1f0d447126ee6273a89e867971b02ec","observation_id":"3171fb7b-80e1-4b08-81e8-5d4a6fa242a5","resolution":{"observed_at":"2026-05-15T18:27:22.986858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2501.02576","last_updated":"2026-04-23T14:21:49Z","snapshot_observed_at":"2026-08-02T15:57:41.915551Z","submitted_at":"2025-01-05T15:18:32Z","title":"DepthMaster: Taming Diffusion Models for Monocular Depth Estimation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-23T06:08:14.988386Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.02576"},"observation_digest":"sha256:88383b32e64ac5ac39f4fa3cf361d7422880ac0a7be0a3bf49c5396e93b4fc0f","observation_id":"da509556-579c-4bb6-a1d7-df292ecc4451","resolution":{"observed_at":"2026-05-23T06:12:38.899373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2501.08083","last_updated":"2025-04-04T11:10:26Z","snapshot_observed_at":"2026-07-06T20:20:55.958338Z","submitted_at":"2025-01-14T12:51:34Z","title":"Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T05:16:36.255597Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.08083"},"observation_digest":"sha256:7f7ab4b13bb73b7f0312aa36fffc88a8cccc199375e73e831473530af8c4366e","observation_id":"90e48ea4-efbe-412f-9243-777fcc6fd9c2","resolution":{"observed_at":"2026-05-23T05:17:35.604131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:17.473970Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.09732"},"observation_digest":"sha256:64d2650d97cf1e94f3b2ca8476fb67e569140b77fabb7dc8480d3f8d8a3cfe67","observation_id":"f217d42f-e05c-4275-a0ac-8787f3afc269","resolution":{"observed_at":"2026-05-20T11:45:17.642392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2502.02452","last_updated":"2026-04-28T16:36:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T16:19:20Z","title":"Personalization Toolkit: Training Free Personalization of Large Vision Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T03:33:13.549114Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.02452"},"observation_digest":"sha256:408e17e7d6626dde693b67b476c94f94e9aa54757e373c7d71b8b99a95fbaa9d","observation_id":"4ae3679b-685b-40b1-8724-444754e2495c","resolution":{"observed_at":"2026-05-23T03:35:21.096950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2502.06608","last_updated":"2025-03-27T17:25:50Z","snapshot_observed_at":"2026-07-06T20:34:02.031605Z","submitted_at":"2025-02-10T16:07:54Z","title":"TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models","version":3},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-05-16T21:51:18.323840Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.06608"},"observation_digest":"sha256:690d5d7ff7e5113832e0cee7b584019e585526a1ac27f48ec4874ed0529f7c36","observation_id":"ac2ce2e8-9d79-460e-baff-044e19feca99","resolution":{"observed_at":"2026-05-16T21:51:18.439894Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2502.09795","last_updated":"2026-04-23T15:06:17Z","snapshot_observed_at":"2026-07-06T20:36:21.623337Z","submitted_at":"2025-02-13T22:10:21Z","title":"Geometry-aided Vision-based Localization of Future Mars Helicopters in Challenging Illumination Conditions","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T03:04:06.940154Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.09795"},"observation_digest":"sha256:866360588e77bad8019761c52246b264a96064d06701720ec7d137544cbf6680","observation_id":"228ae164-ff72-4721-b5c7-b8646e294103","resolution":{"observed_at":"2026-05-23T03:05:20.223418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:2d7baf11d6765adb90acb8544be096f61c8e89af384088c5bf6a0cf733994073","observation_id":"7d4a3c5e-9deb-412a-b49d-140949da65fd","resolution":{"observed_at":"2026-05-11T04:35:32.741990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-02T05:41:31.119340Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T09:11:04.176769Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.20110"},"observation_digest":"sha256:be50ce3104c3d278ea8f9e7d4c809e37f7de7e768af28a71565fabe42c4bcf0a","observation_id":"9de94152-88ce-4e88-9fce-ae6004b8eb52","resolution":{"observed_at":"2026-05-17T09:11:04.301077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2503.01835","last_updated":"2026-04-30T12:56:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T18:56:29Z","title":"Primus: Enforcing Attention Usage for 3D Medical Image Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T01:22:29.901174Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2503.01835"},"observation_digest":"sha256:32af9374d6cb23ec1780e49f4631d38458ad11fceac51c38a909f582c6e9b46f","observation_id":"434c806a-a7d3-4c2e-905c-20df8b78e3c6","resolution":{"observed_at":"2026-05-23T01:25:16.526151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2503.02170","last_updated":"2026-05-19T08:18:11Z","snapshot_observed_at":"2026-08-01T20:01:42.607861Z","submitted_at":"2025-03-04T01:20:23Z","title":"Adaptive Camera Sensor for Vision Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T02:17:02.071721Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2503.02170"},"observation_digest":"sha256:6dea1132a854c75d1edd43df9835ddfd36f21983e2fd8b4b35b5102394032cd2","observation_id":"41ba1e14-2956-46f7-b53f-3424dd92297e","resolution":{"observed_at":"2026-05-23T02:17:24.484593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T08:27:36.242416Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2503.07703"},"observation_digest":"sha256:81d8685374dcc4628684e665cbcf67e6e537208d4ed0dc994899d01cd78d69e8","observation_id":"c48a6835-bca2-433b-a9e2-86a5c833d0a4","resolution":{"observed_at":"2026-05-17T08:27:36.327182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:087f80d5b987c5dbd401dbdf41a460deb6986152722ad2052acad6ba0d4fc52e","observation_id":"547e41d2-bed1-405e-ad5d-21b1c3ab55fc","resolution":{"observed_at":"2026-05-15T22:00:48.779743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2503.16683","last_updated":"2026-04-20T21:20:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T19:59:39Z","title":"GAIR: Location-Aware Self-Supervised Contrastive Pre-Training with Geo-Aligned Implicit Representations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T22:41:00.027266Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2503.16683"},"observation_digest":"sha256:b45045fae8a039f8978cb6f9988edf6da97d70f6716791788c709141c511c712","observation_id":"b53f411a-70d2-43a5-b099-6a64821ed13e","resolution":{"observed_at":"2026-05-22T22:42:13.394805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2503.21210","last_updated":"2026-04-07T08:34:05Z","snapshot_observed_at":"2026-07-06T20:59:27.162712Z","submitted_at":"2025-03-27T06:54:06Z","title":"Toward Generalizable Forgery Detection and Reasoning","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-22T22:26:49.062978Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2503.21210"},"observation_digest":"sha256:ba4fa0bd2625afc736983bce5683c97e32708c9c6d64e4b56889da3047779005","observation_id":"2de09c84-0f0f-4d7d-9a02-a7ad63efd874","resolution":{"observed_at":"2026-05-22T22:27:12.408489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T07:55:38.690569Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.11346"},"observation_digest":"sha256:b9a605fb5f5883841637813121db698584fa9b9c7532abab17823f7d287da781","observation_id":"44fcb28a-8b3a-482d-a361-35daef47c51a","resolution":{"observed_at":"2026-05-13T07:55:38.751884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2504.14988","last_updated":"2026-04-30T15:12:07Z","snapshot_observed_at":"2026-08-03T01:40:56.706749Z","submitted_at":"2025-04-21T09:30:41Z","title":"Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T18:26:12.597756Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.14988"},"observation_digest":"sha256:4bc057f08dc4b0639365ddc99f8cb51b9a337931181b28a7258b961984fa2114","observation_id":"395041c0-217e-4114-8a32-235e63c4abf7","resolution":{"observed_at":"2026-05-22T18:26:55.273681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2504.15958","last_updated":"2026-04-06T07:28:38Z","snapshot_observed_at":"2026-08-02T18:52:25.249725Z","submitted_at":"2025-04-22T14:55:23Z","title":"FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T18:09:50.633826Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.15958"},"observation_digest":"sha256:b38a8d898cd470902dcab23fe859be12a0f5c0499264bcbcf5b9600f538664cd","observation_id":"64e7dc58-8ace-4e75-a10d-0716daf9c294","resolution":{"observed_at":"2026-05-22T18:11:54.536944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T15:53:29.412890Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.19854"},"observation_digest":"sha256:545cb96a2825e3d7b4929a7e92819c5566c52abcfde2951c1d04805d3f997e65","observation_id":"6170fdc2-8c73-4355-9335-c2b64d8b021f","resolution":{"observed_at":"2026-05-16T15:53:29.471677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-07-06T21:16:23.106510Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T16:07:53.054355Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.20690"},"observation_digest":"sha256:fbb4d0c7972e344e8def5822489814e7bba6e431573450916f4a98b3b8dd2372","observation_id":"9252b305-6182-4cad-bb40-52ad42356e16","resolution":{"observed_at":"2026-05-16T16:07:53.127322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:500597cf3b648e3346e81d1d4d7ee6fd085e8fa82aef1b7d6b3adaf079c4d802","observation_id":"e348e3f9-83b2-42d7-85a6-d4f4880692db","resolution":{"observed_at":"2026-05-17T20:55:52.269304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:eb9df825eeffec2409b8796e5dd23d04723d76f5e8593cdc30791ea00b3994d6","observation_id":"c1be779b-1e02-44fb-9007-29bec9901230","resolution":{"observed_at":"2026-05-17T07:24:04.589166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c48e1d91a2ea561524c1351711546f26c85c88dcb6b38543c35ed34537502e2f","observation_id":"6f2c3e87-a354-4abf-bb94-4c044ab34a4e","resolution":{"observed_at":"2026-05-11T05:26:06.146024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.12549","last_updated":"2025-05-23T11:59:20Z","snapshot_observed_at":"2026-07-06T21:25:56.796553Z","submitted_at":"2025-05-18T21:33:09Z","title":"VGGT-SLAM: Dense RGB SLAM Optimized on the SL(4) Manifold","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T21:03:14.217231Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.12549"},"observation_digest":"sha256:ecbfa4ac0a0ecdce5782fd71fb8f683484280e767b9f46992ceca509da182dc1","observation_id":"c060c368-9ac5-48ff-9cb7-a943d60c43bc","resolution":{"observed_at":"2026-05-20T21:03:14.380167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:ea93762ad5880d89a1969ccc96ce8a160e689a626340cd3239c7ee149e535b14","observation_id":"dd52bf2f-0608-4efe-abea-051583d32cbe","resolution":{"observed_at":"2026-05-13T20:31:15.838885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.13255","last_updated":"2026-04-24T03:20:34Z","snapshot_observed_at":"2026-07-06T21:26:20.811742Z","submitted_at":"2025-05-19T15:39:08Z","title":"Policy Contrastive Decoding for Robotic Foundation Models","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T14:09:48.762737Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.13255"},"observation_digest":"sha256:5106c1e51ddc0ed115a9158b7cc65e65965baa7f64ab877fd68333042ae568f1","observation_id":"7556c271-7c8a-4958-8cc7-d183c8d72026","resolution":{"observed_at":"2026-05-22T14:11:38.551674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.14062","last_updated":"2026-05-05T00:42:45Z","snapshot_observed_at":"2026-08-03T01:33:22.978326Z","submitted_at":"2025-05-20T08:08:28Z","title":"FractalMamba++: Scaling Vision Mamba Across Resolutions via Hilbert Fractal Geometry","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:28.333444Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.14062"},"observation_digest":"sha256:b2664dba5d6ad8cfb12360f3e923e7f2fc53330582b879af667a477ccff2661f","observation_id":"34967fdb-6d6f-45bc-9e83-b086bbcb7a24","resolution":{"observed_at":"2026-05-22T14:01:38.196240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:601c36399c413a5346a61aed6b9aecd682fa251e66fe4cd6c7440ae492abfa68","observation_id":"d16b66a9-182f-40ab-bfcd-13469f92fcde","resolution":{"observed_at":"2026-05-21T14:25:47.240959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.17726","last_updated":"2026-05-19T09:55:01Z","snapshot_observed_at":"2026-08-03T09:08:10.935540Z","submitted_at":"2025-05-23T10:43:45Z","title":"Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T02:06:35.204166Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.17726"},"observation_digest":"sha256:909ac276b8baf6e52aeee3649a371f40f61289d96b9934920e8f6087dfeb7208","observation_id":"a65220d4-64fe-4246-b377-f6a8418344d8","resolution":{"observed_at":"2026-05-22T02:10:56.101559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:18986e2e90782da50d1e85b924809828b0df1bcf6f2eba1f154e199712a059a4","observation_id":"d50dc313-3588-4bc8-ba8c-80acc68977f3","resolution":{"observed_at":"2026-05-16T12:55:40.490754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T18:17:45.123690Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.20275"},"observation_digest":"sha256:33d4523aa7b7b7fa1148d625ead88be06d457b21eec43f1132019276f2dfcff1","observation_id":"3a85a4d7-8d77-4fbb-99b8-a7a6480fdf5f","resolution":{"observed_at":"2026-05-12T18:17:45.332209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.20914","last_updated":"2026-05-16T14:35:16Z","snapshot_observed_at":"2026-08-03T16:57:55.096172Z","submitted_at":"2025-05-27T09:05:28Z","title":"Geometry-Editable and Appearance-Preserving Object Compositon","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T02:13:56.792400Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.20914"},"observation_digest":"sha256:0eabc95869733e177becb8b6516253d22c3192cf02698ce0765a4f80e36e7a81","observation_id":"df892426-61d1-41f0-a5ea-88a4d230b471","resolution":{"observed_at":"2026-05-22T02:14:31.264963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.00474","last_updated":"2026-05-21T20:29:47Z","snapshot_observed_at":"2026-08-02T21:43:57.564882Z","submitted_at":"2025-05-31T08:45:02Z","title":"A European Multi-Center Breast Cancer MRI Dataset","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T08:20:47.972916Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.00474"},"observation_digest":"sha256:fb06e07b6e0122ec55f7019e6d9181909ebca28ca5a1652faeaaf0c86d85d578","observation_id":"e56d951b-5ba2-40db-8de8-f45ba64782f0","resolution":{"observed_at":"2026-05-25T08:25:33.859184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.01015","last_updated":"2026-05-14T17:12:31Z","snapshot_observed_at":"2026-07-06T21:34:34.091508Z","submitted_at":"2025-06-01T13:57:42Z","title":"AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T11:14:29.394752Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.01015"},"observation_digest":"sha256:28eb3912a9605e162e9360d82ce81748753681075a5518168ca585022d6d6357","observation_id":"6ba41af7-6b24-486f-93a4-085ee0cbc71a","resolution":{"observed_at":"2026-05-19T11:17:15.503446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.01247","last_updated":"2026-05-26T21:34:46Z","snapshot_observed_at":"2026-07-06T21:34:43.519872Z","submitted_at":"2025-06-02T01:51:20Z","title":"Beyond Interpretability: When, Why, and How Sparse Autoencoders Enable Label-Free Visual Steering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T11:35:01.836096Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.01247"},"observation_digest":"sha256:e3e715939ffc912750cc0c0141b21c71783142002329e4d3a49d0329ee46a925","observation_id":"276b12ab-a255-4faf-b8fa-e263f013080b","resolution":{"observed_at":"2026-05-19T11:37:15.838022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:52267512228277c1d05309f95e573f196fa39a61cd49694aced99b027044e1e6","observation_id":"396c38b5-9580-44d3-b0d8-77bc02935d8e","resolution":{"observed_at":"2026-05-12T17:34:27.176396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.08849","last_updated":"2026-05-03T07:20:42Z","snapshot_observed_at":"2026-07-31T07:58:35.130346Z","submitted_at":"2025-06-10T14:37:51Z","title":"Adapting Vision-Language Foundation Model for Next Generation Medical Ultrasound Image Analysis","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T10:34:28.875334Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.08849"},"observation_digest":"sha256:fd5e607cf00ead51594e3745cfe6f58c58876fc8d4ae81e8bb5a030057bef886","observation_id":"7664a232-90a5-4b13-a6f7-17530da8d901","resolution":{"observed_at":"2026-05-19T10:37:15.132106Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:874ec7b86b5ce1a675bc6097c5f0e78582b383ec3e2b92d660438c708af2176f","observation_id":"2bda31ff-adde-4223-ae84-e3c5287a7ff7","resolution":{"observed_at":"2026-05-19T11:13:02.898494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.09885","last_updated":"2026-04-18T10:39:07Z","snapshot_observed_at":"2026-07-06T21:40:31.038332Z","submitted_at":"2025-06-11T15:57:08Z","title":"The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images with Minimal 3D Knowledge","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T09:32:48.787211Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.09885"},"observation_digest":"sha256:dbca6423a338ff706632609bd97147d2b0b21a0a7173ac8a06fc9b17c3d0ebab","observation_id":"433bc99e-583f-4e76-9b53-8f9b6dc37c0c","resolution":{"observed_at":"2026-05-19T09:33:02.591664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:b820fd5c81e9ee1c5ba921d8ae410bcf8a8ee97332a9e78fbf9d4d5c47b1fc61","observation_id":"57365b87-d7e6-4990-aca8-c82a929eeb0a","resolution":{"observed_at":"2026-05-11T00:33:51.136489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.12214","last_updated":"2025-06-13T20:32:58Z","snapshot_observed_at":"2026-07-06T21:42:02.481535Z","submitted_at":"2025-06-13T20:32:58Z","title":"CLIP the Landscape: Automated Tagging of Crowdsourced Landscape Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T09:02:18.576084Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.12214"},"observation_digest":"sha256:f609fad97a9b2e466d396ad19f77eff8ff38a96f039a05cc55d4afcc94d42f02","observation_id":"72851fcb-8c27-4421-a253-0c85d09b6649","resolution":{"observed_at":"2026-05-19T09:03:02.229474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.15442","last_updated":"2025-06-18T13:14:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T13:14:46Z","title":"Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T23:10:17.659621Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.15442"},"observation_digest":"sha256:6d689c7797deaca960b02e01e6ea760f198aecabdb2c84ccf9bba38240125c4e","observation_id":"efb1dbd7-41fa-4565-9923-076a759c2bbb","resolution":{"observed_at":"2026-05-17T23:10:17.727980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:795e2e27f3430b425a7aae8c48047d2e1970232518011766022cb3baf85352fd","observation_id":"78d241c5-bccb-4740-99ee-1162d93747af","resolution":{"observed_at":"2026-05-19T07:52:10.794403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:3397834efae6f9e1d01d9ab3fb7973e9b29b09a400736a33de2662bcfc5f9181","observation_id":"c4e4a262-85db-4ee2-8300-f1c4f750e3ca","resolution":{"observed_at":"2026-05-19T07:27:08.873264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.02546","last_updated":"2025-07-03T11:40:01Z","snapshot_observed_at":"2026-07-06T21:51:38.554688Z","submitted_at":"2025-07-03T11:40:01Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T21:19:44.144633Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.02546"},"observation_digest":"sha256:bdd854a6b034c5450efca4e852d616ef765285c2b1fd9425d45b6de6da070f1e","observation_id":"a30cfea2-24dd-4de9-b4c3-379cc83011a6","resolution":{"observed_at":"2026-05-14T21:19:44.196479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:198e2b7352c9255fba5d63875b822285d5c19702cfcde2571ea112809ff7156f","observation_id":"d8de1717-616a-4f19-986b-1fd583b7780c","resolution":{"observed_at":"2026-05-19T05:12:04.866205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.07776","last_updated":"2026-05-14T07:57:02Z","snapshot_observed_at":"2026-07-06T21:55:07.643679Z","submitted_at":"2025-07-10T13:56:32Z","title":"SCOOTER: A Human Evaluation Framework for Unrestricted Adversarial Examples","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-19T05:35:16.138603Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.07776"},"observation_digest":"sha256:1d064430b2d046703209f9f5abe6110d477b694bd731b24501177212f0300080","observation_id":"6c6d406f-35f3-480c-946f-bd2dde97eb95","resolution":{"observed_at":"2026-05-19T05:37:05.574267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:2cf1cb41b4c71d417c70a68cc0f34f968777295b6bad3b783a85eba91fa4c091","observation_id":"bfd871df-9dab-4102-98ff-45d0d4354cc0","resolution":{"observed_at":"2026-05-19T05:17:06.706444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.10236","last_updated":"2026-05-15T17:35:28Z","snapshot_observed_at":"2026-07-06T21:56:49.263374Z","submitted_at":"2025-07-14T12:56:55Z","title":"Navigating the Challenges of AI-Generated Image Detection in the Wild: What Truly Matters?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:31:40.691896Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.10236"},"observation_digest":"sha256:1211b85e08c9cc48b9c73857333e2d27a0b163e9f96036032ecf02cc0e8acfa1","observation_id":"a4350520-e548-4337-82dc-7a2d069ce964","resolution":{"observed_at":"2026-05-21T23:34:26.493966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.11539","last_updated":"2026-03-31T10:04:45Z","snapshot_observed_at":"2026-07-06T21:57:41.002474Z","submitted_at":"2025-07-15T17:59:57Z","title":"Streaming 4D Visual Geometry Transformer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T22:58:18.929748Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.11539"},"observation_digest":"sha256:672116dbc1040e3f0b20fce295ec8b580ee2bce4946ed17666ac636731832cf2","observation_id":"ddd65d56-4e3d-437a-af53-33287ad36be9","resolution":{"observed_at":"2026-05-15T22:58:18.995541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-02T12:12:15.465550Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T17:14:22.678806Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.13347"},"observation_digest":"sha256:222eb7f66d63eee3d7fcf0c23c77d9abae69de5dfa5a910b76a1249da09565da","observation_id":"66191822-d84f-4aad-baa4-d435340c8d80","resolution":{"observed_at":"2026-05-12T17:14:22.803718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.13942","last_updated":"2026-04-15T13:59:47Z","snapshot_observed_at":"2026-07-31T09:25:03.034282Z","submitted_at":"2025-07-18T14:14:19Z","title":"Frozen Forecasting: A Unified Evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T03:42:54.620069Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.13942"},"observation_digest":"sha256:146861866a29f89426dd301d4c482c0b074faaa978a843efb1b9cd5057edec12","observation_id":"3ba6a66d-6633-4545-bcdc-788539450d06","resolution":{"observed_at":"2026-05-19T03:42:57.290288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T03:18:14.655384Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.16815"},"observation_digest":"sha256:6a0e35f1693719b80deec0a5f7dde9328d88102121cc1336007b4cd1211f37e4","observation_id":"42ee7a51-17f5-44c2-a573-e9ac9fc8f509","resolution":{"observed_at":"2026-05-19T03:22:01.025538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2507.22101","last_updated":"2026-05-05T13:51:40Z","snapshot_observed_at":"2026-07-06T22:04:49.159747Z","submitted_at":"2025-07-29T17:59:48Z","title":"AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock","version":2},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-19T02:03:46.331803Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.22101"},"observation_digest":"sha256:0eae9e27df58812e594376c0a13da11afde0288178c6a41c95290fc2ffbaadd5","observation_id":"fa37519e-3991-459a-b01e-5b462ab3d50d","resolution":{"observed_at":"2026-05-19T02:06:58.726240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:3c9763dddfa7224b47035eef46a465a83cc0a1cca351776c64140e8d71466176","observation_id":"92f37ce5-ae18-4595-b74b-214ac051d98c","resolution":{"observed_at":"2026-05-15T21:28:42.049871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2508.06982","last_updated":"2026-04-10T02:53:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:29:39Z","title":"IntrinsicWeather: Controllable Weather Editing in Intrinsic Space","version":7},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:56.189814Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.06982"},"observation_digest":"sha256:614ce73245919b0183bbf72922f5f2de9fc25512439b4c9215cf38d92b0025eb","observation_id":"80a9f126-b12e-4b48-a13a-770070cccaf7","resolution":{"observed_at":"2026-05-19T00:01:56.029563Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:cd25cf9e8ee49ae18fc60eadbfb8b9c0d2d6618659a9fe4de9369b8f9823a414","observation_id":"3853af0a-42cc-4146-b354-2c67a8ed117d","resolution":{"observed_at":"2026-05-15T20:43:24.517101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2508.20909","last_updated":"2026-05-08T06:39:51Z","snapshot_observed_at":"2026-08-04T15:16:30.376993Z","submitted_at":"2025-08-28T15:38:50Z","title":"Dino U-Net: Exploiting High-Fidelity Dense Features from Foundation Models for Medical Image Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T20:22:41.555806Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.20909"},"observation_digest":"sha256:8cd273a603a9aa1c7a55d99c5699b5ca5d24bde0a20b983437332c005009d56e","observation_id":"370fa0db-f45b-47ec-a1bf-8106d6fd89f3","resolution":{"observed_at":"2026-05-18T20:22:50.679850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2509.02560","last_updated":"2025-11-09T15:12:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-02T17:54:21Z","title":"FastVGGT: Training-Free Acceleration of Visual Geometry Transformer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T23:36:06.870759Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.02560"},"observation_digest":"sha256:1fc414a8d8c56aacce031b1b94ffc7241693ca46a3389986db838d50f7c2bf41","observation_id":"3382f296-6469-4f09-a436-c37ae4d106a7","resolution":{"observed_at":"2026-05-15T23:36:06.954412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2509.05030","last_updated":"2026-05-15T06:07:31Z","snapshot_observed_at":"2026-08-01T23:42:06.055220Z","submitted_at":"2025-09-05T11:40:44Z","title":"LUIVITON: Learned Universal Interoperable VIrtual Try-ON","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T22:00:15.259709Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.05030"},"observation_digest":"sha256:4e1fa00041ffc1769a273b7ce0381462f552d0f4fbd8a75ee216bcc8f7923eff","observation_id":"16c39280-a7d5-4a04-8cf1-a25cab76ea5b","resolution":{"observed_at":"2026-05-21T22:00:41.335957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T23:55:43.122288Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06233","last_updated":"2025-09-07T22:45:06Z","snapshot_observed_at":"2026-08-04T23:55:42.528520Z","submitted_at":"2025-09-07T22:45:06Z","title":"O$^3$Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:43.122288Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.06233"},"observation_digest":"sha256:111977a6a72ec70a2510e2fafeeef28b6eb6db142737193df90da9521e87379e","observation_id":"14b11f92-7d09-4cf2-a55d-e63abbd56769","resolution":{"observed_at":"2026-08-04T23:55:43.122288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T23:23:42.575343Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06660","last_updated":"2025-09-08T13:19:04Z","snapshot_observed_at":"2026-08-04T23:23:40.410048Z","submitted_at":"2025-09-08T13:19:04Z","title":"Investigating Location-Regularised Self-Supervised Feature Learning for Seafloor Visual Imagery","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:42.575343Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.06660"},"observation_digest":"sha256:bb4a61e5585b636a6dde7aa4c521da42c057107de9fbbad927616d6869bb1e92","observation_id":"652eac85-0e28-47a2-8853-6f814584ed88","resolution":{"observed_at":"2026-08-04T23:23:42.575343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T23:20:30.285171Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06678","last_updated":"2025-09-08T13:36:27Z","snapshot_observed_at":"2026-08-04T23:20:29.872464Z","submitted_at":"2025-09-08T13:36:27Z","title":"Online Clustering of Seafloor Imagery for Interpretation during Long-Term AUV Operations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:20:30.285171Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.06678"},"observation_digest":"sha256:efecfe972ff4097d20084bef78f1e418df37afc599c93249e6ae2b209a5581b2","observation_id":"aa3f8141-4d15-49a7-a229-f8fe47e3df1b","resolution":{"observed_at":"2026-08-04T23:20:30.285171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T22:55:16.913405Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06907","last_updated":"2025-09-08T17:23:28Z","snapshot_observed_at":"2026-08-04T22:55:13.201377Z","submitted_at":"2025-09-08T17:23:28Z","title":"FoMo4Wheat: Toward reliable crop vision foundation models with globally curated data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:16.913405Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.06907"},"observation_digest":"sha256:b0f70c5479ef97cf34a0289fb9d354acf79e48155f9ac12bef38ed8def1c1786","observation_id":"99b94df6-dbfd-4fa7-8f22-973ab25e9779","resolution":{"observed_at":"2026-08-04T22:55:16.913405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2509.07120","last_updated":"2026-05-20T17:17:47Z","snapshot_observed_at":"2026-07-06T22:26:08.072526Z","submitted_at":"2025-09-08T18:16:09Z","title":"Block-Sparse Global Attention for Efficient Multi-View Geometry Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T22:22:23.320347Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.07120"},"observation_digest":"sha256:9c7f059261edb6b7729f044bb50b7611ac553f3b2e0ab751aa184d6b3641a749","observation_id":"151f8100-3a5c-43fd-a11f-d3ff3ad44984","resolution":{"observed_at":"2026-05-21T22:24:23.574993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T21:31:08.235510Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07978","last_updated":"2025-09-09T17:59:02Z","snapshot_observed_at":"2026-08-04T21:31:03.409786Z","submitted_at":"2025-09-09T17:59:02Z","title":"One View, Many Worlds: Single-Image to 3D Object Meets Generative Domain Randomization for One-Shot 6D Pose Estimation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T21:31:08.235510Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.07978"},"observation_digest":"sha256:935486b6f177baca45847c44b57fda580ccde2a2a47d7cf230fc9621e29bc45a","observation_id":"48747c6e-fdcd-4b0e-80cd-33aed443f89f","resolution":{"observed_at":"2026-08-04T21:31:08.235510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T21:20:46.279827Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08116","last_updated":"2025-09-09T19:44:50Z","snapshot_observed_at":"2026-08-04T21:20:45.837914Z","submitted_at":"2025-09-09T19:44:50Z","title":"Domain Knowledge is Power: Leveraging Physiological Priors for Self Supervised Representation Learning in Electrocardiography","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T21:20:46.279827Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.08116"},"observation_digest":"sha256:3f15644b3690e663b83a496663064d8975eb7964d6295815b125d6506081adc0","observation_id":"18868781-093f-4806-b8ec-b558adfd1a18","resolution":{"observed_at":"2026-08-04T21:20:46.279827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T20:52:06.161060Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-04T20:52:04.203685Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.161060Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:adcbfe8d33fcb00f4eda01a292643672e04a366dc4f0471a45844378f75a3b84","observation_id":"3b690062-15d8-4053-9c37-476f70e7730b","resolution":{"observed_at":"2026-08-04T20:52:06.161060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T20:29:46.119905Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08550","last_updated":"2025-09-10T12:53:38Z","snapshot_observed_at":"2026-08-04T20:29:45.639915Z","submitted_at":"2025-09-10T12:53:38Z","title":"ViewSparsifier: Killing Redundancy in Multi-View Plant Phenotyping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:29:46.119905Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.08550"},"observation_digest":"sha256:c8f327f7a5cf503b3a31fe860235c23f14dbd4b207e2c918781a20c991c072e3","observation_id":"e81d0d67-8d36-43ac-acb7-b7fd53065b58","resolution":{"observed_at":"2026-08-04T20:29:46.119905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T20:10:13.655168Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-04T20:10:11.887304Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.655168Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:3e929a21bf0cf3fe00a144b2676acd34f4c8d3169932d6884c2bc8faf899118b","observation_id":"c06163f8-3aff-44a6-b1ed-7e820b97f396","resolution":{"observed_at":"2026-08-04T20:10:13.655168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T19:39:13.303201Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09154","last_updated":"2025-09-11T05:23:22Z","snapshot_observed_at":"2026-08-04T19:38:53.910372Z","submitted_at":"2025-09-11T05:23:22Z","title":"Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-04T19:39:13.303201Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.09154"},"observation_digest":"sha256:e4c209d686d00edf4861fd52ab48e9372ce414bd469ee535f8e65ea6ac404434","observation_id":"30cfddf2-47f1-4eb0-9d19-1375bfe987fb","resolution":{"observed_at":"2026-08-04T19:39:13.303201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T19:24:39.894167Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09298","last_updated":"2025-09-11T09:42:32Z","snapshot_observed_at":"2026-08-04T19:24:37.804487Z","submitted_at":"2025-09-11T09:42:32Z","title":"Learning Object-Centric Representations in SAR Images with Multi-Level Feature Fusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:39.894167Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.09298"},"observation_digest":"sha256:1ce5626a29543ca8f3233dc19fcd3075e0993488778b8cb990e63931093e3c11","observation_id":"bf5f5831-113e-4ebc-be0c-58225de6a9f9","resolution":{"observed_at":"2026-08-04T19:24:39.894167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T19:24:21.482265Z","title":"Dinov2: Learning robust visual features without supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-04T19:24:21.048613Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.482265Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:406a2c7a874088e17058b51492ac79bb70d812a2574850578ffbc62d381b5c00","observation_id":"f0fcf758-83ae-4563-850a-aaa7e5619bee","resolution":{"observed_at":"2026-08-04T19:24:21.482265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T19:14:15.636242Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09375","last_updated":"2025-09-11T11:48:02Z","snapshot_observed_at":"2026-08-04T19:14:13.972089Z","submitted_at":"2025-09-11T11:48:02Z","title":"Unsupervised Integrated-Circuit Defect Segmentation via Image-Intrinsic Normality","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:14:15.636242Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.09375"},"observation_digest":"sha256:236387b12affb166401d81032223adb1ff5db6e166c1bf434d4e58f7183c96ed","observation_id":"074847cd-7d7e-4632-90ab-04f6897547da","resolution":{"observed_at":"2026-08-04T19:14:15.636242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.07193/citation-record","integrity":"/paper/2304.07193/integrity","json":"/paper/2304.07193/citation-record.json","paper":"/paper/2304.07193"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3d89c91-9b9c-4fdf-b194-a2922422ee6f","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:cedfbaa7829c4b3896565dd11a30acb65b2238e38c298b93d7e73bffaddacffc","observation_id":"55b016cc-551c-47ad-818b-92042c006700","resolution":{"observed_at":"2026-05-09T04:17:20.511139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05509","last_updated":"2019-04-03T08:07:29Z","snapshot_observed_at":"2026-07-06T07:33:12.016548Z","submitted_at":"2019-02-14T17:32:21Z","title":"MultiGrain: a unified image embedding for classes and instances","version":2},"cited_work":{"arxiv_id":"1902.05509","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.05509","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MultiGrain: a unified image embedding for classes and instances","venue":"cs.CV","work_id":"54472c12-9ee6-4a11-86b6-d57d3cfa0459","year":2019},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/1902.05509","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:568f7ddc57dceb63548ca66862062fef11bca3ec7468e945fe5fd9c25befb75c","observation_id":"c0eead4b-6bd2-4b7d-a913-e85abd8f0764","resolution":{"observed_at":"2026-05-09T04:17:20.459328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-07-06T09:28:28.130099Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":null,"work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:c83d853ed4791f1b789fbfa66af2c846b0f5f027313c3a36b860dfb2cbb2764c","observation_id":"af299ae4-93fd-4081-9dad-3e486c880ac6","resolution":{"observed_at":"2026-05-09T04:17:20.394194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:3d7903dee3ff0685fb9cacc46a11ce412e1e35291541ea2b2f3428b8e91955ee","observation_id":"e9595bf0-923e-469b-ac36-f611f6ad4762","resolution":{"observed_at":"2026-05-10T16:15:53.986238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06675","last_updated":"2023-05-08T21:49:57Z","snapshot_observed_at":"2026-08-02T01:29:22.350700Z","submitted_at":"2023-02-13T20:27:30Z","title":"Symbolic Discovery of Optimization Algorithms","version":4},"cited_work":{"arxiv_id":"2302.06675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.06675","snapshot_observed_at":"2026-07-09T17:36:25.406188Z","title":"Symbolic discovery of optimization algorithms","venue":"cs.LG","work_id":"2151a7b4-dbf0-490e-8582-83731a6bc17c","year":2023},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2302.06675","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:cb38ccdbfc76e40f531749480b5d984de9d4c09ed4f4b2d3a6f06bf04e554d65","observation_id":"57ca71f7-d270-4429-9d0d-72c6731cf7dd","resolution":{"observed_at":"2026-05-09T04:17:20.443603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of training self-supervised vision transformers","venue":null,"work_id":"b7382000-c309-4d1f-bb3b-a8886142a03c","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:a1ac2867ae71f8b8b321ea0b09f7e0a5f24822ffc12e770490560a72190c9630","observation_id":"22f17709-8612-49f1-88e7-495ae501f91e","resolution":{"observed_at":"2026-05-09T04:17:20.464274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:8b3f65557c077b4e8b9f80bede0af4a524b1f02bd51084c6385d1a419a93e49d","observation_id":"2e1f5db9-d418-43e4-9e18-357bf242629b","resolution":{"observed_at":"2026-05-10T23:45:07.766206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09451","last_updated":"2023-01-23T14:20:01Z","snapshot_observed_at":"2026-07-06T14:43:46.518928Z","submitted_at":"2023-01-23T14:20:01Z","title":"A Simple Recipe for Competitive Low-compute Self supervised Vision Models","version":1},"cited_work":{"arxiv_id":"2301.09451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.09451","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple recipe for competitive low-compute self supervised vision models","venue":null,"work_id":"088ced81-dbff-4566-8cc4-77856b27d4b2","year":null},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2301.09451","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:f2ede91199f3f18b09cbc0d344afbcf20d9c4743cb5630b2b9ed1a17ac916300","observation_id":"37267cd6-9275-444c-baf4-9082af89a338","resolution":{"observed_at":"2026-05-09T04:17:20.363804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10740","last_updated":"2021-12-20T18:41:32Z","snapshot_observed_at":"2026-07-06T12:20:43.745885Z","submitted_at":"2021-12-20T18:41:32Z","title":"Are Large-scale Datasets Necessary for Self-Supervised Pre-training?","version":1},"cited_work":{"arxiv_id":"2112.10740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.10740","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are large-scale datasets necessary for self- supervised pre-training?","venue":null,"work_id":"ebb5aadf-13fe-42ba-b59b-fb22aab65932","year":2021},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2112.10740","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:a1963bdcbbb16836b66f8141a54a1248dafc86780c357687b63901c7f441b00c","observation_id":"9b809046-68ed-42d5-914a-67591100a026","resolution":{"observed_at":"2026-05-09T04:17:20.390653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"29c4498a-4577-4013-803e-4b471599a14a","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:f25fce35f4e7b9be08f74472e402c86295673219f72dcdf79e9768a9b842357e","observation_id":"9b24cbce-dfda-43fa-9423-a5e6a1a5e296","resolution":{"observed_at":"2026-05-09T04:17:20.468646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01988","last_updated":"2021-03-05T13:53:36Z","snapshot_observed_at":"2026-07-06T10:46:15.143756Z","submitted_at":"2021-03-02T19:12:29Z","title":"Self-supervised Pretraining of Visual Features in the Wild","version":2},"cited_work":{"arxiv_id":"2103.01988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01988","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- supervised pretraining of visual features in the wild.CoRR, abs/2103.01988","venue":null,"work_id":"f483bb61-86b3-4279-93e0-fa511f96f046","year":2021},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2103.01988","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:1cbb51a7820cbd8a79fc20640fa89db9613e98573b7b0b66d2c974765758d79f","observation_id":"9976cf06-4437-4342-ba15-fce8aad4bc35","resolution":{"observed_at":"2026-05-09T04:17:20.403346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08360","last_updated":"2022-02-22T18:15:21Z","snapshot_observed_at":"2026-08-05T01:07:03.567692Z","submitted_at":"2022-02-16T22:26:47Z","title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","version":2},"cited_work":{"arxiv_id":"2202.08360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.08360","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goyal, Q","venue":null,"work_id":"879f1b5b-0c25-42c7-b42b-3145672e5572","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2202.08360","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:0fe7ccfd2860d83e9b0589accf9162046f0714bf87495202326e59da0d1f545f","observation_id":"8ba28ccd-9876-4e0d-9bab-498307162344","resolution":{"observed_at":"2026-05-09T04:17:20.412841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"3773a699-1712-4482-a6e6-4c05cc2c99c0","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:4e8e9e853d7aeebb7cfdb3e32625ddb8be794eaf1b0dbc84f40a0b7c81a55f7a","observation_id":"59a753fb-2ab0-4bd2-b0b0-4b73ef2635e2","resolution":{"observed_at":"2026-05-09T04:17:20.471080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:2b4e0d93ea064627f91d69d11efcaa7b0e8dcc8a7c96721cd9d9c96844b4add3","observation_id":"6da0582a-384f-406c-b65b-f9bed07efe79","resolution":{"observed_at":"2026-05-10T16:01:32.444768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:6a3d5ed102f62af283e350beac0f368c351e1e461d129e0bd2b92f7459a3e5b7","observation_id":"1d52adaa-7998-4af3-a14b-c171b5807a2e","resolution":{"observed_at":"2026-05-11T03:13:45.682066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00987","last_updated":"2022-04-03T04:38:02Z","snapshot_observed_at":"2026-07-06T12:56:04.298366Z","submitted_at":"2022-04-03T04:38:02Z","title":"BinsFormer: Revisiting Adaptive Bins for Monocular Depth Estimation","version":1},"cited_work":{"arxiv_id":"2204.00987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.00987","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Binsformer: Revisiting adaptive bins for monocular depth estimation","venue":null,"work_id":"49452974-67ba-4736-be98-da629f6f2af2","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2204.00987","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:866a6c4eb61a7d7c581cea3ca9f79db4e8fbc14d2d00ee6e9f61a95134f386b2","observation_id":"171fa669-b057-4b32-98a4-f60e80f231fc","resolution":{"observed_at":"2026-05-09T04:17:20.434323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00782","last_updated":"2021-07-08T15:33:31Z","snapshot_observed_at":"2026-07-06T11:25:15.380607Z","submitted_at":"2021-07-02T01:03:11Z","title":"Polarized Self-Attention: Towards High-quality Pixel-wise Regression","version":2},"cited_work":{"arxiv_id":"2107.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.00782","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2107.00782 , year=","venue":null,"work_id":"ba1af2f9-fa96-43eb-a8ee-cc7891aeb0ff","year":null},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2107.00782","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:4bdf9072bbcfdc032c98451eebfead4f060ab55817b67d2fba8c8d021db5cfb3","observation_id":"62e0ff4e-9338-4509-bf01-155d3599c779","resolution":{"observed_at":"2026-05-09T04:17:20.440163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"53b001c7-d5c3-4610-9d2d-05335c0f08ea","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:813727e3ff0167beb2e7babcf6c7bbd375f1277b3f881fca8c701d340b8db52d","observation_id":"124182fc-b3af-4ada-bf24-26a8e07d4439","resolution":{"observed_at":"2026-05-09T04:17:20.473207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-07-06T11:02:18.405330Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":"2104.10350","doi":"10.48550/arxiv.2104.10350","metadata_source":"pith","pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Carbon Emissions and Large Neural Network Training","venue":"cs.LG","work_id":"5cd5f484-8e24-440f-8bed-e8a801f4ac40","year":2021},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:7e6d1bd3d72e0991c68e60ff979d1f6868f2427eaa6325ba1537ad7e92382493","observation_id":"73cc2f39-7ce9-48e1-b823-1660fe4dd218","resolution":{"observed_at":"2026-05-11T23:48:25.196363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:19.119642+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:19.119642+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.01444","last_updated":"2017-04-06T09:48:20Z","snapshot_observed_at":"2026-07-06T05:36:39.612294Z","submitted_at":"2017-04-05T14:20:28Z","title":"Learning to Generate Reviews and Discovering Sentiment","version":2},"cited_work":{"arxiv_id":"1704.01444","doi":"10.48550/arxiv.1704.01444","metadata_source":"pith","pith_arxiv_id":"1704.01444","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Learning to Generate Reviews and Discovering Sentiment","venue":"cs.LG","work_id":"3a589728-009a-467e-a1d9-ed3624e82dcb","year":2017},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/1704.01444","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:34fb6e31013a3fe9682d392dad5830cdc7b8a3f7dd247c1a52ee90b4c87d88ce","observation_id":"013e819f-8aa5-41c6-a2be-3dbd69246de3","resolution":{"observed_at":"2026-05-09T04:17:20.454668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet large scale visual recognition challenge.IJCV","venue":null,"work_id":"c29aba18-35d9-4a04-add6-03b6ec4816a5","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:60fb6204aec44b753f7d367446d58b0d02ab536d11390ee41b17776f1af8e11b","observation_id":"db2f8fc9-39e0-4edf-8cea-71d977674c59","resolution":{"observed_at":"2026-05-09T04:17:20.475822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-11T03:27:46.760869Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:1e5ec2251d13f9b7ff17112a2f67ed4fa570ccbd8e3eb6955b8c4793acfffe53","observation_id":"fc68bd92-588a-4e1b-b843-40313b096556","resolution":{"observed_at":"2026-05-10T17:05:01.922266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-07-11T03:07:53.363433Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:0c04974eb5ea610cf772bee2da8ac28385b7f70069dcb029526285f8fa9bbed7","observation_id":"db7e4380-5da3-4887-8f2c-f7a3599c91c2","resolution":{"observed_at":"2026-05-11T01:25:00.378223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:c1ff6f988c4dadacc95bff91337e0162c70e37aa871b802d7847ae55b79e5b2a","observation_id":"6ed76909-00b3-40a8-8b28-c91d7db6b4b7","resolution":{"observed_at":"2026-05-09T04:17:20.350896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bench- marking representation learning for natural world image collections","venue":null,"work_id":"9eb04376-ba12-4172-b832-d5de42874498","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:421ae65245c534e2551611e2761fa6815db1c9b6397d52ff7b36e5e6645ae018","observation_id":"fc3561b8-0b4e-412c-afce-e9676ed9742c","resolution":{"observed_at":"2026-05-09T04:17:20.484765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"03708415-8db7-4942-8d8c-9eeb87ff6fce","year":2010},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:502acc96717afac2cd334afbd69dfe3ec700247d066cb920c82af86fd908dd7e","observation_id":"4efad419-ca9d-4f8a-817e-a438decb6382","resolution":{"observed_at":"2026-05-09T04:17:20.489551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":"2207.06405","doi":"10.48550/arxiv.2207.06405","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"https://doi.org/10","venue":null,"work_id":"4be71eb6-f826-4371-9bdc-e7f8f5c52c5a","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:07cf4d7ef5ebd10c38111d6b14c681bd49de493b126696a6172572e36a28b43a","observation_id":"d5ad5530-cbb2-4705-9211-1bfe7ba1c95d","resolution":{"observed_at":"2026-05-09T04:17:20.373783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00546","last_updated":"2019-05-02T02:08:18Z","snapshot_observed_at":"2026-08-03T14:42:34.790631Z","submitted_at":"2019-05-02T02:08:18Z","title":"Billion-scale semi-supervised learning for image classification","version":1},"cited_work":{"arxiv_id":"1905.00546","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00546","snapshot_observed_at":"2026-07-03T09:17:48.941294Z","title":"Billion-scale semi-supervised learning for image classification","venue":"cs.CV","work_id":"828a761f-140d-49c8-b97e-5278df2396d0","year":2019},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/1905.00546","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:e9f346c91534235faf78caf522f181ec1110d4573450b467975afb53d7c933c3","observation_id":"2b6c4006-bbb4-477a-9f9b-89b82d51594e","resolution":{"observed_at":"2026-05-09T04:17:20.377918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14415","last_updated":"2022-03-27T23:42:05Z","snapshot_observed_at":"2026-07-06T12:52:58.991468Z","submitted_at":"2022-03-27T23:42:05Z","title":"Mugs: A Multi-Granular Self-Supervised Learning Framework","version":1},"cited_work":{"arxiv_id":"2203.14415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14415","snapshot_observed_at":"2026-07-04T00:39:16.417614Z","title":"Mugs: A multi-granular self-supervised learning framework","venue":null,"work_id":"6c0c59e6-7e90-4353-8437-640b693e4fbc","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2203.14415","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:aa7a88897dfd0f9a57996d5ceb2b8b9638e147e2140e3fcd657cb99cf98d4d6c","observation_id":"5368219e-fe1e-45ec-9f52-1946bd270291","resolution":{"observed_at":"2026-05-09T04:17:20.383765Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cfc8eaab-4aac-452c-b558-6590f23b601b","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:75459974dcb29c93c06cbe2b41cdc1d21bcdc3d9850cd04b91c69e4623d742f4","observation_id":"51f78af0-e787-4f12-8270-1277c70523bd","resolution":{"observed_at":"2026-05-09T04:17:20.491851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We apply the KoLeo regularizer with a weight of 0.1 between the class tokens of the first global crop, for all samples within a GPU without cross-communication for this step","venue":null,"work_id":"a7f745e6-e741-4971-b319-5b673f4ab91f","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:77f932692f7e510ac93eaf254c5258cf4e0c25db6081cc0e106021bafff5fbb0","observation_id":"7af36918-2a23-4a77-8ca4-e411a2ca391e","resolution":{"observed_at":"2026-05-09T04:17:20.494541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b694f71a-4df1-4cdb-9dc3-99d577564ed3","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:9c971fafe3ec1d6f31c01d5b3e878bff389bcca5d72a9ee08b5f6187e7587c64","observation_id":"9d2a2454-8422-42a0-8e64-f0e9ac780900","resolution":{"observed_at":"2026-05-09T04:17:20.499666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EMA update for the teacher","venue":null,"work_id":"ead8d5fb-2bd8-441c-90c9-a3b2ef8945df","year":2024},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:fb78f221bdc803906678702a65833988df1170aad5325fb453bd164866114adb","observation_id":"f91d300c-1f50-42d5-9752-77788ab4c79c","resolution":{"observed_at":"2026-05-09T04:17:20.501888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(Everingham et al","venue":null,"work_id":"de418d70-4b75-4d3d-9d4f-409aa8fabf00","year":2007},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:ea8e81bbe9c4f273f038b1f368dc404fc2083430f664648a762615e1aa2ba556","observation_id":"da1bec99-2754-4351-b94f-13602ac2a4fd","resolution":{"observed_at":"2026-05-09T04:17:20.504022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(Van Horn et al","venue":null,"work_id":"6468ecfb-55f3-46f2-90f1-b957a820a535","year":2018},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:b76d6c2b4772dd74314d5eb55b907d5e6ed85e459d827876d87ab0f6ee05cbaa","observation_id":"8f6af0b6-6c74-4f2d-9268-cf84126ab147","resolution":{"observed_at":"2026-05-09T04:17:20.507188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(Van Horn et al","venue":null,"work_id":"61eb701b-bb00-4cb3-a567-dee0a1b28955","year":2021},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:d0b236ca99131d67ccd6f372357aafeb6008af0645f14abca05327f1cfc01fe8","observation_id":"8b529756-49db-4c09-8226-a3bd04f896f6","resolution":{"observed_at":"2026-05-09T04:17:20.509241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(Everingham et al","venue":null,"work_id":"9dfca10b-32b6-4a8d-b7a7-e5f38edf9cc0","year":2012},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:fca945dea436180f78b397425eef2c3ff72837ee1d92a1f2e0cfb76e6d789ff6","observation_id":"e912152b-8116-4a04-a0a0-f19fd0189464","resolution":{"observed_at":"2026-05-09T04:17:20.461799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":5,"verified_exact":17,"verified_fuzzy":11},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 100 inbound Pith citation observations for arXiv:2304.07193."}