{"as_of":"2026-08-08T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0558fb30632d462afb7a0ec44be7bebf44539bcb45c335d52580c613828f8f06","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:50:07.405408Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":75,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":189,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:1a60c4573a946db5ff470e3da1ea50f9f561a043e422e3ec7eba5c18db881f84","observation_id":"1acb96f4-5124-4001-b998-e6c3c69eba19","resolution":{"observed_at":"2026-05-16T09:29:06.171984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:05:36.460932Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2303.15343"},"observation_digest":"sha256:d73c9dc84e1962ed2ca2977d0a735449fd74b81384ce386e821def07e80ff48f","observation_id":"9eedfa5d-24d6-4060-bff7-f5a2449f2dc5","resolution":{"observed_at":"2026-05-16T13:05:36.552655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:9344a000f21ab8ff1ba5d0ecdb2a282674a8eba1142e894bdc40bb7bda456177","observation_id":"af299ae4-93fd-4081-9dad-3e486c880ac6","resolution":{"observed_at":"2026-05-09T04:17:20.394194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T14:36:09.971825Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2305.18565"},"observation_digest":"sha256:c4d7e16261c222cfa66cfc8c8998e1618c54c53ab287c41091558baca164ffdf","observation_id":"9e0f58ee-3d8d-482d-a335-20dab654d1f1","resolution":{"observed_at":"2026-05-17T14:36:10.028979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:8eb1f7d36232bc9fad4f0791af9ca10770c962bba0ffa8957bcc84159fbf22b6","observation_id":"d2a15c82-3776-4014-99da-6fccae660361","resolution":{"observed_at":"2026-05-13T09:41:38.082214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:26d4034da62bed8f4523535b8c7b60cd0159a12c5ccf47b5e3cd33539ae72133","observation_id":"5f7f42a2-b373-4b71-a3fd-7ab5f62e0819","resolution":{"observed_at":"2026-05-13T22:46:09.795868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2405.00892","last_updated":"2026-04-30T18:09:59Z","snapshot_observed_at":"2026-07-06T18:08:30.875909Z","submitted_at":"2024-05-01T22:33:45Z","title":"Wake Vision: A Tailored Dataset and Benchmark Suite for TinyML Computer Vision Applications","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T01:06:48.298874Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2405.00892"},"observation_digest":"sha256:7615c3d90c765b5626427d9c0d7e6ab9128166bb0d8707c50f567dba9236daa6","observation_id":"de8e5865-e5b5-4204-9b41-2524dd3a1659","resolution":{"observed_at":"2026-05-24T01:08:41.958239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:ef1493198a34ccf181d59f09bde75af48d4bb1ecdd42b07b9d8ef164147fa99c","observation_id":"ea95d6a2-7514-4ea7-a452-c8045913625b","resolution":{"observed_at":"2026-05-10T13:23:58.188150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T23:50:07.405408Z","title":"H \\' e naff, Alexander Kolesnikov, Xiaohua Zhai, and A \\\" a ron van den Oord","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.08769","last_updated":"2025-06-30T10:48:00Z","snapshot_observed_at":"2026-08-07T23:42:04.302844Z","submitted_at":"2025-02-12T20:17:10Z","title":"Cluster and Predict Latent Patches for Improved Masked Image Modeling","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:50:07.405408Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2502.08769"},"observation_digest":"sha256:877eb813cb44980b7f02db8decd396103c651cdf37c265876b1d9e41a35e82d4","observation_id":"ee0fbd76-015e-464d-b862-02753ebe7013","resolution":{"observed_at":"2026-08-07T23:50:07.405408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:49:22.279848Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2502.14786"},"observation_digest":"sha256:4f03469cce95c45bd9fc684a87677c67deecbfe8bb6b43ff60e94ba0596801d2","observation_id":"85a8a5a2-68a2-4840-8a23-338078eff7e2","resolution":{"observed_at":"2026-05-10T15:49:22.327294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T15:19:19.411111Z","title":"Are we done with ImageNet? arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.15628","last_updated":"2025-05-21T15:14:34Z","snapshot_observed_at":"2026-08-08T02:16:21.927195Z","submitted_at":"2025-05-21T15:14:34Z","title":"SNAP: A Benchmark for Testing the Effects of Capture Conditions on Fundamental Vision Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:19:19.411111Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2505.15628"},"observation_digest":"sha256:584a3825de6243e93a24b321e4e2412188f03bb46bdc8d63349ba993f7bb12c2","observation_id":"dcebfebb-d997-4b6a-8655-b4a7189c2013","resolution":{"observed_at":"2026-08-07T15:19:19.411111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T14:16:06.500633Z","title":"Are we done with ImageNet?arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.19614","last_updated":"2026-07-01T04:53:12Z","snapshot_observed_at":"2026-08-08T04:51:36.367859Z","submitted_at":"2025-05-26T07:30:38Z","title":"Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:06.500633Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2505.19614"},"observation_digest":"sha256:32bb212cfe0196af8bfa0730b2cb3be677a356c37b55358264ff1b3656e7d8a0","observation_id":"b8ae5879-52e0-4302-b0dd-7353b7da03df","resolution":{"observed_at":"2026-08-07T14:16:06.500633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T10:40:46.473215Z","title":"Hénaff, Alexander Kolesnikov, Xiaohua Zhai, and Aäron van den Oord","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04737","last_updated":"2025-06-06T06:12:59Z","snapshot_observed_at":"2026-08-07T10:31:53.262652Z","submitted_at":"2025-06-05T08:16:15Z","title":"Bridging Annotation Gaps: Transferring Labels to Align Object Detection Datasets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:46.473215Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.04737"},"observation_digest":"sha256:5b577a94e7e002ef88881463d0db9e9a3343fd8195ecc95ffdd1b45f6873a8fa","observation_id":"2d568042-9641-4a89-b56c-cdc8185e47ea","resolution":{"observed_at":"2026-08-07T10:40:46.473215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T10:52:54.802249Z","title":"Are we done with imagenet? arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-07T13:02:38.670562Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.802249Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:de1d62804c1f439b12a88b61b9d121fb75094726a77356a9c95bf5f5feba55cb","observation_id":"d4e66b74-3c82-41a3-91cd-9a3d2daea8e2","resolution":{"observed_at":"2026-08-07T10:52:54.802249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T05:01:08.336805Z","title":"Hénaff, Alexander Kolesnikov, Xiaohua Zhai, and Aäron van den Oord","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-08T13:22:08.459736Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:08.336805Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.09038"},"observation_digest":"sha256:8dd9ab0882e7c580e8e83702e4c7f64043eaeb638c098a716b0c7a987f8cc42c","observation_id":"1bbf0430-80c3-42a7-9c83-43b6ff75dcb2","resolution":{"observed_at":"2026-08-07T05:01:08.336805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T04:43:05.840404Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.09955","last_updated":"2025-06-11T17:28:52Z","snapshot_observed_at":"2026-08-07T23:38:34.278156Z","submitted_at":"2025-06-11T17:28:52Z","title":"Canonical Latent Representations in Conditional Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:43:05.840404Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.09955"},"observation_digest":"sha256:6b96560321c0e7310ec21012cace4a54619ecb528f23fe78acb4c48744f0439d","observation_id":"ee948ce8-15b9-4e04-bbec-1567b84ed3e7","resolution":{"observed_at":"2026-08-07T04:43:05.840404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2506.16950","last_updated":"2026-05-19T20:12:50Z","snapshot_observed_at":"2026-08-02T13:16:30.243090Z","submitted_at":"2025-06-20T12:32:27Z","title":"LAION-C: An Out-of-Distribution Benchmark for Web-Scale Vision Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T00:53:19.382994Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.16950"},"observation_digest":"sha256:4c4faa85c27c116822809ae6d21f9737a6cf1f30a1b8a7b47d4e57005765993f","observation_id":"62718e30-1a98-404c-a068-a06d11346922","resolution":{"observed_at":"2026-05-22T00:54:31.259073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-06T19:07:40.395204Z","title":"J., Kolesnikov, A., Zhai, X., and Oord, A","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.06434","last_updated":"2025-07-08T22:29:06Z","snapshot_observed_at":"2026-08-06T19:02:05.373476Z","submitted_at":"2025-07-08T22:29:06Z","title":"Deprecating Benchmarks: Criteria and Framework","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:07:40.395204Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2507.06434"},"observation_digest":"sha256:9a15c10a8a4d6ae7c6ee96e52c5cd9bf94f73310ef68ffc5eeb92061b0a3dc5a","observation_id":"4844f0b5-7b05-424c-a6a9-74e2b21f1797","resolution":{"observed_at":"2026-08-06T19:07:40.395204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2507.07776","last_updated":"2026-05-14T07:57:02Z","snapshot_observed_at":"2026-07-06T21:55:07.643679Z","submitted_at":"2025-07-10T13:56:32Z","title":"SCOOTER: A Human Evaluation Framework for Unrestricted Adversarial Examples","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-19T05:35:16.138603Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2507.07776"},"observation_digest":"sha256:d5682a5c6e388668cf237f9e469e847788006b2aa27ab9fd90349e5d42e5820e","observation_id":"4d720a27-962c-4d88-ba2f-a649c8b5df4f","resolution":{"observed_at":"2026-05-19T05:37:05.601228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2507.14137","last_updated":"2026-04-25T14:06:10Z","snapshot_observed_at":"2026-07-06T21:59:25.077202Z","submitted_at":"2025-07-18T17:59:55Z","title":"Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-19T03:39:52.969100Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2507.14137"},"observation_digest":"sha256:1a581e828ba58fb1f823fca2ff5f7d00ebb2a249e104808756efbcbe905ec338","observation_id":"cc9f1caa-8246-406c-b3c4-419cd41fbbaf","resolution":{"observed_at":"2026-05-19T03:42:01.378630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T10:31:37.200404Z","title":"Are we done with imagenet? arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.04009","last_updated":"2025-09-04T08:40:40Z","snapshot_observed_at":"2026-08-06T23:40:41.748485Z","submitted_at":"2025-09-04T08:40:40Z","title":"Detecting Regional Spurious Correlations in Vision Transformers via Token Discarding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:31:37.200404Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2509.04009"},"observation_digest":"sha256:3e79d350818fdd44fbcb5915d4c947d7f8d4c5a5bb6f9ea3cda22667d71b7986","observation_id":"bbb27a14-c4df-43b8-95ed-1ca50f420058","resolution":{"observed_at":"2026-08-05T10:31:37.200404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-04T19:24:21.435965Z","title":"Hénaff, Alexander Kolesnikov, Xiaohua Zhai, and Aäron van den Oord","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09311","last_updated":"2025-09-11T09:54:25Z","snapshot_observed_at":"2026-08-07T05:35:18.119397Z","submitted_at":"2025-09-11T09:54:25Z","title":"Image Recognition with Vision and Language Embeddings of VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:24:21.435965Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2509.09311"},"observation_digest":"sha256:3620636b293cf7909937f074692f38843a7afb1e8f498bcb2da2b2022a658e5a","observation_id":"79b454bc-263c-4864-bfb1-dc73f3bc623d","resolution":{"observed_at":"2026-08-04T19:24:21.435965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2603.22570","last_updated":"2026-05-16T19:21:49Z","snapshot_observed_at":"2026-08-02T22:04:13.851745Z","submitted_at":"2026-03-23T21:05:21Z","title":"CanViT: Toward Active-Vision Foundation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:29.023955Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2603.22570"},"observation_digest":"sha256:d3a94021845d8919fa5a430ba36fef80d64c3bb6756230a7ed3fd897ef6644df","observation_id":"3bf46e6e-6ec4-4f98-9bef-a4a8c3451125","resolution":{"observed_at":"2026-05-21T10:34:06.902134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-04T05:37:50.137745Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2604.00086","last_updated":"2026-08-03T16:53:23Z","snapshot_observed_at":"2026-08-06T23:37:34.936285Z","submitted_at":"2026-03-31T18:00:39Z","title":"Hierarchical Pre-Training of Vision Encoders with Large Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T05:37:50.137745Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2604.00086"},"observation_digest":"sha256:711aff4e2eee0eac8f71ad0645a26839770aa237469e93f637229a7fb975889f","observation_id":"c8a192ee-f397-415b-91b3-a7731281a94f","resolution":{"observed_at":"2026-08-04T05:37:50.137745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:c99399b655533a25c1cac7b80e829dfb84ff61cdbf126d8a80493317faa95bbb","observation_id":"3a071b17-f055-4e36-9be6-24435f112944","resolution":{"observed_at":"2026-05-13T06:07:22.652059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2605.15714","last_updated":"2026-05-15T08:07:01Z","snapshot_observed_at":"2026-08-04T16:12:44.006288Z","submitted_at":"2026-05-15T08:07:01Z","title":"Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T17:30:37.244072Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2605.15714"},"observation_digest":"sha256:a94a71be09f285f5e9f3a3cb28fd052065fb23d13c9d192984cf79ca7e2ffceb","observation_id":"7738d6cf-e800-4532-a0ad-db39b446e227","resolution":{"observed_at":"2026-05-20T17:33:36.633269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2606.13221","last_updated":"2026-06-11T11:38:05Z","snapshot_observed_at":"2026-08-04T15:20:32.287809Z","submitted_at":"2026-06-11T11:38:05Z","title":"From Uncertain Judgments to Calibrated Rankings: Conformal Elo Estimation for LLM Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T07:44:53.583327Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2606.13221"},"observation_digest":"sha256:604fa6eeacfec762065754ad910677fb38948eff63be35c1cb78d9393cf0c552","observation_id":"bbf38b34-ac84-473c-bd05-06a99be126ff","resolution":{"observed_at":"2026-07-03T13:38:19.231041Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2606.23204","last_updated":"2026-06-22T11:49:23Z","snapshot_observed_at":"2026-07-06T23:57:57.606047Z","submitted_at":"2026-06-22T11:49:23Z","title":"Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T09:12:19.873337Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2606.23204"},"observation_digest":"sha256:897c6592b5d7298550308f87a799ca6ee3a09bd8ea79b41dce585a6b5cb6e530","observation_id":"6a491112-b539-43a2-bb04-aa97c3009ced","resolution":{"observed_at":"2026-07-04T09:59:45.828077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2606.31397","last_updated":"2026-06-30T09:25:37Z","snapshot_observed_at":"2026-08-03T17:48:59.429755Z","submitted_at":"2026-06-30T09:25:37Z","title":"Mixture-of-Control: State-Aware Fine-Tuning for Transformer-based Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:06.270685Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2606.31397"},"observation_digest":"sha256:7e42d56d24cd390b85fab3c8f7cac92ac1b6cd43ee6737988b31a89df296da9a","observation_id":"c679a254-b026-40f7-a032-3fca8010f538","resolution":{"observed_at":"2026-07-01T06:55:28.748174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-02T01:03:58.949279Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14817","last_updated":"2026-07-16T10:35:56Z","snapshot_observed_at":"2026-08-04T15:21:58.204117Z","submitted_at":"2026-07-16T10:35:56Z","title":"Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T01:03:58.949279Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2607.14817"},"observation_digest":"sha256:54e844ddac869538f7624b2d11ef227095024d8862161cefbeabcc51f9826aa7","observation_id":"b7846746-eb07-4459-aea4-9c3220f7b82a","resolution":{"observed_at":"2026-08-02T01:03:58.949279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-01T12:55:18.601001Z","title":"arXiv preprint arXiv:2006.07159 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19305","last_updated":"2026-07-22T21:13:10Z","snapshot_observed_at":"2026-08-04T02:02:57.501217Z","submitted_at":"2026-07-21T17:17:35Z","title":"Riemannian Deep Learning: Modules, Networks, and Geometries","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T12:55:18.601001Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2607.19305"},"observation_digest":"sha256:1f4bbf708b001eeffd1678901db9903306deb5f1c40a786a393c128069ff6ef8","observation_id":"d44f667c-18a8-4079-93ea-3529d5273f32","resolution":{"observed_at":"2026-08-01T12:55:18.601001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-07-30T11:00:16.150623Z","title":"Are we done with imagenet?","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.23835","last_updated":"2026-07-26T20:41:38Z","snapshot_observed_at":"2026-08-03T07:58:45.449135Z","submitted_at":"2026-07-26T20:41:38Z","title":"Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T11:00:16.150623Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2607.23835"},"observation_digest":"sha256:24072c049148cbacfcc315f5b9116e5804c979f011e2672cbe4b0fee3d84f28b","observation_id":"102db97d-c0fb-4f68-ac02-554b4a632b0c","resolution":{"observed_at":"2026-07-30T11:00:16.150623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-01T00:57:38.003121Z","title":"Hénaff, Alexander Kolesnikov, Xiaohua Zhai, and Aäron van den Oord","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26001","last_updated":"2026-07-28T17:18:11Z","snapshot_observed_at":"2026-08-04T20:25:47.135794Z","submitted_at":"2026-07-28T17:18:11Z","title":"Sharpness-Aware Minimization and Muon: Robustness under the Spectral Norm","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T00:57:38.003121Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2607.26001"},"observation_digest":"sha256:604086e5129f674ddf408271532084cbf8683f011f055a1c3b5c059ffa794eff","observation_id":"675b06ff-38b1-49d0-904c-663fd557d613","resolution":{"observed_at":"2026-08-01T00:57:38.003121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.07159/citation-record","integrity":"/paper/2006.07159/integrity","json":"/paper/2006.07159/citation-record.json","paper":"/paper/2006.07159"},"outbound":[],"paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2006.07159."}