{"as_of":"2026-08-05T03:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8efc019a942e44603802c5f73f1fd0c9f130151e2dca13a39e995f17e68c99e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:18:31.361765Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T16:56:21.644793Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-16T08:25:17.847571Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2409.01652"},"observation_digest":"sha256:ec945205cede662c74739cde428d6078a5bfbc08c504f76455210215c2a5585a","observation_id":"eed0412e-546b-46d5-9640-b6a614a8de4a","resolution":{"observed_at":"2026-05-16T08:25:18.019787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-03T10:18:31.361765Z","title":"Deep vit features as dense visual descriptors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.10710","last_updated":"2026-07-02T13:06:44Z","snapshot_observed_at":"2026-08-03T10:18:29.238799Z","submitted_at":"2026-01-15T18:59:10Z","title":"From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:18:31.361765Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2601.10710"},"observation_digest":"sha256:6b063b954ed364ff3b0bfc4b4075f3713895b9ac26f2647875bfbdf640984de7","observation_id":"41863813-330f-4116-8225-29db3a6c550b","resolution":{"observed_at":"2026-08-03T10:18:31.361765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-03T08:13:39.247257Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.17950","last_updated":"2026-07-19T01:16:30Z","snapshot_observed_at":"2026-08-03T08:13:37.759320Z","submitted_at":"2026-01-25T18:59:45Z","title":"UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:39.247257Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2601.17950"},"observation_digest":"sha256:cd90acb6d1ec8071a5d343da3aae586a422c8f9902e96188633033c79c994058","observation_id":"d9fc5d41-16d8-4161-9084-f14b8de71451","resolution":{"observed_at":"2026-08-03T08:13:39.247257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-02T19:36:19.815385Z","title":"Deep vit features as dense visual descriptors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01613","last_updated":"2026-06-08T02:40:36Z","snapshot_observed_at":"2026-08-03T16:41:41.599255Z","submitted_at":"2026-03-02T08:43:43Z","title":"Uncertainty-Aware Hierarchical Re-Localization in OpenStreetMap via Semantic Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T19:36:19.815385Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2603.01613"},"observation_digest":"sha256:dd57575fff780158fa3cf6f1b29cecc08f5d15deb41218390b5548430838e42e","observation_id":"504b71b5-f443-4e31-8795-55a7245c90a3","resolution":{"observed_at":"2026-08-02T19:36:19.815385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-14T23:50:28.153875Z","title":"Deep vit features as dense visual descriptors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.10174","last_updated":"2026-07-05T05:29:02Z","snapshot_observed_at":"2026-07-14T23:50:27.666903Z","submitted_at":"2026-03-10T19:11:34Z","title":"Autonomous Search for Sparsely Distributed Visual Phenomena through Environmental Context Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T23:50:28.153875Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2603.10174"},"observation_digest":"sha256:39e8089d67677a0658e69837eb4a04a9f8a451a92a44c9fb7382f49a2c863c92","observation_id":"e772a24d-ec4d-4ec9-ad39-298326d703c3","resolution":{"observed_at":"2026-07-14T23:50:28.153875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-14T21:34:48.709465Z","title":"arXiv preprint arXiv:2112.05814 (2021) 3","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.13994","last_updated":"2026-07-09T15:26:35Z","snapshot_observed_at":"2026-07-14T21:34:47.601409Z","submitted_at":"2026-03-14T15:43:10Z","title":"Human-like Object Grouping in Self-supervised Vision Transformers","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T21:34:48.709465Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2603.13994"},"observation_digest":"sha256:ba9f2d5aaaec1a4d2ada5961633c97b04d901e2be91b782f634ef1cf6db3c72e","observation_id":"55c0e98a-11cd-4bf4-a8cb-76e93dbdadad","resolution":{"observed_at":"2026-07-14T21:34:48.709465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2604.23670","last_updated":"2026-07-21T03:51:06Z","snapshot_observed_at":"2026-08-02T22:42:59.506076Z","submitted_at":"2026-04-26T12:12:25Z","title":"Zero-Shot DINOv3-Based Image Matching via Many-to-Many Association","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T06:32:18.423143Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2604.23670"},"observation_digest":"sha256:99d2fdc3856e86da10034709a55788fb4afc85a36dcb4aa4d67519b83d21928b","observation_id":"47c61a5c-b9c4-4ad8-aa62-0627a4ec43a3","resolution":{"observed_at":"2026-05-11T21:11:18.694655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-02T15:38:37.458871Z","title":"Deep vit features as dense visual descriptors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.23670","last_updated":"2026-07-21T03:51:06Z","snapshot_observed_at":"2026-08-02T22:42:59.506076Z","submitted_at":"2026-04-26T12:12:25Z","title":"Zero-Shot DINOv3-Based Image Matching via Many-to-Many Association","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T15:38:37.458871Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2604.23670"},"observation_digest":"sha256:0d69abf4fc22f0ad5a1e1516afdec51094e4b3d79f82e58b52146142687c6213","observation_id":"6f2a9136-6242-4406-bfe5-c6a25c9ca3aa","resolution":{"observed_at":"2026-08-02T15:38:37.458871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2604.24894","last_updated":"2026-04-27T18:20:42Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:20:42Z","title":"VISION-SLS: Safe Perception-Based Control from Learned Visual Representations via System Level Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T02:44:01.250176Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2604.24894"},"observation_digest":"sha256:cb4f39227405c4109e9afa4d687a3c648f57dd649de93a376f7afdb7d39f753d","observation_id":"cacdf124-b7f6-4fba-9c21-2eb8edd60cc4","resolution":{"observed_at":"2026-05-11T22:26:15.116378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.10780","last_updated":"2026-05-12T07:07:10Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:52Z","title":"Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T05:31:06.963637Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.10780"},"observation_digest":"sha256:f870269a7aa41d836762a649c4d86686bec1ebe01a6342d3552782d5984add10","observation_id":"ad55ea51-ba0c-4c6c-bd87-ec7b8156ce57","resolution":{"observed_at":"2026-05-12T05:31:23.422461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.10780","last_updated":"2026-05-12T07:07:10Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:52Z","title":"Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T07:40:16.927031Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.10780"},"observation_digest":"sha256:50027e0f1e9fdbdea935f32e26e2ea4366f9fe5b2f69d3c9237f646bc1d7b708","observation_id":"b7de8118-5a6b-40b7-85bb-92db0592e9cb","resolution":{"observed_at":"2026-05-13T07:42:30.587769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.13852","last_updated":"2026-03-25T11:30:22Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-03-25T11:30:22Z","title":"Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T07:36:16.124800Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.13852"},"observation_digest":"sha256:0cbf81288adbecd056f2ff11696c218ae7d21dd5ec8a23421cd1f174579c1d2b","observation_id":"d48c6675-3083-4b2d-b1f8-a3ccefc7e33e","resolution":{"observed_at":"2026-05-15T07:39:50.413208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.16147","last_updated":"2026-07-06T18:29:27Z","snapshot_observed_at":"2026-08-03T00:35:38.299188Z","submitted_at":"2026-05-15T16:27:10Z","title":"Registers Matter for Pixel-Space Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:08:23.052621Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.16147"},"observation_digest":"sha256:274ab4506ebed3d545284f9f41c8fb12b9df4d9ee54f184a13c90e3a40325486","observation_id":"d17dd71a-628e-45d2-b230-6de38d4fbf5c","resolution":{"observed_at":"2026-05-20T19:08:54.067427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.20941","last_updated":"2026-05-20T09:27:06Z","snapshot_observed_at":"2026-07-06T23:31:27.989406Z","submitted_at":"2026-05-20T09:27:06Z","title":"PaintCopilot: Modeling Painting as Autonomous Artistic Continuation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:27.751229Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.20941"},"observation_digest":"sha256:367f24261b1e0cbe189958d28d8ad140fef602521120e79a811f68c7d16758f2","observation_id":"bf6f00b2-ba86-4c10-9ad3-c6f2371e2a5a","resolution":{"observed_at":"2026-05-21T05:29:39.311103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.29691","last_updated":"2026-07-02T11:32:18Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T09:52:52Z","title":"Unsupervised Semantic Segmentation Facilitates Model Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:37:02.350175Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.29691"},"observation_digest":"sha256:7e8760f84637be08e356b2a138ec9b89b5e26b139f42a28e09685bd059d0bfb7","observation_id":"096841c4-3df3-49ab-8bc2-a419b830d5d5","resolution":{"observed_at":"2026-06-29T08:43:15.483441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2605.29691","last_updated":"2026-07-02T11:32:18Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T09:52:52Z","title":"Unsupervised Semantic Segmentation Facilitates Model Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-04T00:34:21.224797Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2605.29691"},"observation_digest":"sha256:c5d81c9c35d8495b540044089944fae8b2a7ab33e87a9b938fc0b85cbda4cf71","observation_id":"add15937-84a7-4852-9cc9-527f88040d52","resolution":{"observed_at":"2026-07-04T00:39:16.375764Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2606.00514","last_updated":"2026-05-30T04:03:47Z","snapshot_observed_at":"2026-08-02T23:46:35.270974Z","submitted_at":"2026-05-30T04:03:47Z","title":"Generate in Reconstruction Space, Match in Semantic Space: Transport Geometry for One-Step Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T18:58:13.956526Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2606.00514"},"observation_digest":"sha256:0df0a70861ff7b906413ad76b4fa4a6b5de84b955dc9fd89b72c1b3321f39a50","observation_id":"c113a4ef-3424-4e23-a27d-e7dcba2ae667","resolution":{"observed_at":"2026-06-28T19:02:34.265670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2606.09608","last_updated":"2026-06-08T15:18:04Z","snapshot_observed_at":"2026-07-06T23:48:53.420827Z","submitted_at":"2026-06-08T15:18:04Z","title":"TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:50:03.921332Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2606.09608"},"observation_digest":"sha256:de478b966e1de06f3dc423dd79f2bc939bf192af919dd8d1c920c67c1e5f1ed5","observation_id":"118fa68b-0cd4-4127-9d9f-24d150490879","resolution":{"observed_at":"2026-07-03T01:07:29.960791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2606.21292","last_updated":"2026-06-19T10:16:29Z","snapshot_observed_at":"2026-08-01T00:24:38.943527Z","submitted_at":"2026-06-19T10:16:29Z","title":"Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:50:10.041000Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2606.21292"},"observation_digest":"sha256:0e3b2e9afe9b6737c85b219553e9e155cda9aea1f441c2693d3b608cd9f0a40a","observation_id":"4ceaa6ae-6e87-4ac8-9c6c-1f5d751731d2","resolution":{"observed_at":"2026-07-04T06:09:37.349741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2606.31136","last_updated":"2026-06-30T05:06:06Z","snapshot_observed_at":"2026-08-02T09:05:38.806456Z","submitted_at":"2026-06-30T05:06:06Z","title":"FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T06:48:55.341060Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2606.31136"},"observation_digest":"sha256:18335fc174254bb0b82b4fd7e09d2d0372db3ba44d691872341ac130cfb94d1d","observation_id":"e1b14f28-cd12-4463-90f3-9075f0277409","resolution":{"observed_at":"2026-07-01T08:55:35.969649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2607.01987","last_updated":"2026-07-02T10:18:02Z","snapshot_observed_at":"2026-07-07T00:07:28.231599Z","submitted_at":"2026-07-02T10:18:02Z","title":"Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T15:34:54.954593Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.01987"},"observation_digest":"sha256:9e8178b877111e98ed85de0671a15a3ffea2d333da189427928b219bff92b7bf","observation_id":"9165e141-8c7a-492e-a41d-47bc12d63067","resolution":{"observed_at":"2026-07-03T15:38:33.115406Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-12T05:46:45.293902Z","title":"Deep vit features as dense visual descriptors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02968","last_updated":"2026-07-03T05:21:46Z","snapshot_observed_at":"2026-08-01T16:37:36.594312Z","submitted_at":"2026-07-03T05:21:46Z","title":"Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T05:46:45.293902Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.02968"},"observation_digest":"sha256:3cf74961fabd52626eab64c7f00986448099fdcfe8237f5f82fe701e30da40e4","observation_id":"723a8860-86c8-4b43-9c75-d173871c3f1c","resolution":{"observed_at":"2026-07-12T05:46:45.293902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-01T11:09:51.615259Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:efcdb3602796344d2788b6cf384cddee64228c1d8994adc6ad0dff1d3bdce66d","observation_id":"90ea3029-786c-4f02-8b36-6e451092037e","resolution":{"observed_at":"2026-07-09T16:56:21.645918Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-02T02:49:55.065331Z","title":"Deep ViT features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-03T05:46:27.339391Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.065331Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:c6ccc4dec651672cf0f9e55f3b5afd48366233201da07166744d8a851218103c","observation_id":"97913c0c-7a46-4454-8f37-adad8f4aa698","resolution":{"observed_at":"2026-08-02T02:49:55.065331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-01T18:06:36.322250Z","title":"arXiv preprint arXiv:2112.05814 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17411","last_updated":"2026-07-19T21:10:59Z","snapshot_observed_at":"2026-08-04T17:59:19.944033Z","submitted_at":"2026-07-19T21:10:59Z","title":"Feature-Guided Diffusion for Non-Differentiable Inverse Rendering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T18:06:36.322250Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.17411"},"observation_digest":"sha256:3bb07b3b78772395e5318e3125133178e9fe03821ac142df2d81ade953b19972","observation_id":"08ffb6ba-dbcb-4766-86a0-56877d494a74","resolution":{"observed_at":"2026-08-01T18:06:36.322250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.05814/citation-record","integrity":"/paper/2112.05814/integrity","json":"/paper/2112.05814/citation-record.json","paper":"/paper/2112.05814"},"outbound":[],"paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:17:35.481116Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2112.05814."}