{"as_of":"2026-08-07T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:264458c2f2d6ceb2487ba2e1a10b7b53aa2fb56ace741d6309dce72e0ca9befe","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:08:37.081122Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:26:05.863088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.24181","snapshot_observed_at":"2026-08-02T05:26:05.863088Z","title":"Hudson, Ye Xia, Skanda Koppula, Andre Araujo, Joao Carreira, and Niloy J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16314","last_updated":"2026-07-15T00:58:45Z","snapshot_observed_at":"2026-08-07T02:32:13.619549Z","submitted_at":"2026-07-15T00:58:45Z","title":"Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:26:05.863088Z"},"links":{"cited_paper":"/paper/2602.24181","citing_paper":"/paper/2607.16314"},"observation_digest":"sha256:52479b4e59aca8b97c4a4cd5c6c0260ab643de9e537475e0aaf96c20d74bd0c0","observation_id":"bfd85a2f-f3b8-4892-abda-a9fe302d48cb","resolution":{"observed_at":"2026-08-02T05:26:05.863088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.24181/citation-record","integrity":"/paper/2602.24181/integrity","json":"/paper/2602.24181/citation-record.json","paper":"/paper/2602.24181"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.418112Z","title":"Cross-modal knowledge transfer with- out task-relevant source data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.418112Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:4fee7413de9e2414296e4b95404351610d50da578be9763026a7b5d72698e42f","observation_id":"c4ab06af-d80b-43ad-b20b-0c1606faffcb","resolution":{"observed_at":"2026-08-02T20:08:30.418112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11041","last_updated":"2018-02-26T16:54:14Z","snapshot_observed_at":"2026-07-06T06:06:46.772265Z","submitted_at":"2017-10-30T16:17:34Z","title":"Unsupervised Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11041","snapshot_observed_at":"2026-08-02T20:08:30.516147Z","title":"Unsupervised neural machine trans- lation.CoRR, abs/1710.11041, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.516147Z"},"links":{"cited_paper":"/paper/1710.11041","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:787de5845158c432e02879927df2dae8f94e6afc5cef3ad84eab4167f43f9b28","observation_id":"8337e498-d7f6-46d1-80fb-168fed035c23","resolution":{"observed_at":"2026-08-02T20:08:30.516147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.647686Z","title":"Spatial-aware multi-modal contrastive learning for rgb-d salient object detection and beyond.Information Fu- sion, 124:103362, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.647686Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:b06b05944cd32d163b3dc6c0e045cb9a04a328d3153d6a3a041da4fe760ce825","observation_id":"87450015-f6e0-48e8-81d4-8e17c0afda7f","resolution":{"observed_at":"2026-08-02T20:08:30.647686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.732866Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.732866Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:aed425c4ea88071ba8e562646e4de1798e6a44ddcbc8934b501bff5b48b06066","observation_id":"25366554-0a3c-4f89-babb-8ed9002b7ef8","resolution":{"observed_at":"2026-08-02T20:08:30.732866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.847082Z","title":"Cross-lingual language model pretraining","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.847082Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:a7aa454fda36473a192bd284e8c8b21850017ee825516a6e76e57badb5b61136","observation_id":"dd4ff651-bd10-434a-bb51-03bc4d41b3bf","resolution":{"observed_at":"2026-08-02T20:08:30.847082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.947765Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.947765Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:31bd2b173746efa622c9f8f6a0aa21a53d38b95f9602b92a561777dd8fff0b71","observation_id":"2ff1759f-c074-46d3-bba3-6639daf7900d","resolution":{"observed_at":"2026-08-02T20:08:30.947765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.098872Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.098872Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:a1a3e8bf86eba91a14e7e2e6a9a1897bb86504eb592df3f09c22c580eb983c1b","observation_id":"8ed312dc-7786-4b06-840c-ab7bc87926ce","resolution":{"observed_at":"2026-08-02T20:08:31.098872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.174754Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.174754Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:04f0a22310aa83c0215bcf750781f14b3a820eeabb4dd74f94d6a17009e7f1b2","observation_id":"2e30d775-d470-487c-b598-d986855a9386","resolution":{"observed_at":"2026-08-02T20:08:31.174754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-02T20:08:31.343820Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.343820Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:acd71ef5109ef3bb8bc820ccff124e84071cb53bd3c417934bca0b5fe20c79ff","observation_id":"5d66bcf7-42a1-4d9f-8240-5af0f7359d51","resolution":{"observed_at":"2026-08-02T20:08:31.343820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.432706Z","title":"Prob- ing the 3d awareness of visual foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.432706Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:01dab212952b25a087ecc3c186dd9435324e467311127648df0ddfae0331ace2","observation_id":"c5ae598b-dace-45bd-a301-e1d81f1c2dd3","resolution":{"observed_at":"2026-08-02T20:08:31.432706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.574298Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.574298Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:afc1abaff36c66616b22d1e2f1cf6dfd8d7655401099351d33f8a48737dafce5","observation_id":"e50ec73d-b83a-4dfd-bb27-81ed5ce0a388","resolution":{"observed_at":"2026-08-02T20:08:31.574298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.709038Z","title":"Dantas, Luigi Di Caro, and Dino Ienco","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.709038Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:905e96af90c3a6d245d22c5848a4580b514b4c174d01a07100cec99739efdabf","observation_id":"1a616629-3c03-400f-a5a4-a225eed41a79","resolution":{"observed_at":"2026-08-02T20:08:31.709038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.816513Z","title":"Omnivore: A sin- gle model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.816513Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:cc46614d2bbbd73f2d5b271a6b0baa23899b5862b27fd9a4a0e980fef74d033a","observation_id":"3d9796c5-70c2-40cc-8fae-093a3350f685","resolution":{"observed_at":"2026-08-02T20:08:31.816513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.890796Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.890796Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:aefe1640a21d111d30e478ce4a49558fe329bc9bf9ae4c6fec70b3a4afd7626e","observation_id":"16caaca9-e0e0-4378-9ead-8777f5240bee","resolution":{"observed_at":"2026-08-02T20:08:31.890796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.103039Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.103039Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:d69151d7faa124ce35170a8b278400a3a4c2c67e8a7866e33200edd04e14e174","observation_id":"0430cd56-7cd2-43ac-9a1c-b9c760a384b3","resolution":{"observed_at":"2026-08-02T20:08:32.103039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.217414Z","title":"The inaturalist species classification and de- tection dataset, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.217414Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:50e801bc28fc428d3d3235851273bdbe5883292fe5f45554cb8892755f36d2a2","observation_id":"ca389ea4-af40-43d4-b0df-81fd717e6464","resolution":{"observed_at":"2026-08-02T20:08:32.217414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.336039Z","title":"Mask3d: Pre-training 2d vision transformers by learning masked 3d priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.336039Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:33a3fefc7673e432290e5394c3930cd4a0e40e3276f32226cca32a8ed8338f5d","observation_id":"5164ff88-437f-4b49-aa13-68df61fb520d","resolution":{"observed_at":"2026-08-02T20:08:32.336039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.480704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.480704Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:d57f3e7932f6f81f46b2abc34c81df5beddf9e6f90bcee0e61af87e74db275f2","observation_id":"ee0bce46-934b-49b8-9e5e-2c66ec09a7ae","resolution":{"observed_at":"2026-08-02T20:08:32.480704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.584745Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.584745Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:6c0f5f19fbd756d5b9f3ccfcb5f315ab70baa47e379124d65749c6a980eed5e5","observation_id":"97db1390-e301-4fd5-8b3e-f2efcbc898e9","resolution":{"observed_at":"2026-08-02T20:08:32.584745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.698128Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.698128Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:821c7505f74ad9e42be08a894495a66eb528a684765126776bad7a4376785188","observation_id":"6671bdda-1c2a-42b2-a91b-972cd4a78c3e","resolution":{"observed_at":"2026-08-02T20:08:32.698128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.873713Z","title":"Multi- modal contrastive masked autoencoders: A two-stage pro- gressive pre-training approach for rgbd datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.873713Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:d090df872f959a60341d71506928834acd627af80d19d59dba704337c2f70af6","observation_id":"2798e5b0-21d4-4a04-82ad-9547018b9250","resolution":{"observed_at":"2026-08-02T20:08:32.873713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.001693Z","title":"NA VI: Category- agnostic image collections with high-quality 3d shape and pose annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.001693Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:df0574923bd98f378af6dc7c078cd042f7dd1c536b1a3bad72790de0df0bd6d3","observation_id":"5ec8fcf5-6cf6-4a93-9a34-031a93a3478a","resolution":{"observed_at":"2026-08-02T20:08:33.001693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.161108Z","title":"Google’s multilin- gual neural machine translation system: Enabling zero-shot translation.Transactions of the Association for Computa- tional Linguistics, 5:339–351, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.161108Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:341071aaa9fe87445b1666e85a589147512783c7d212d330880e69fe54b5f1a1","observation_id":"61ee9790-a290-42f8-8b0b-0bb3c7f049b2","resolution":{"observed_at":"2026-08-02T20:08:33.161108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.249449Z","title":"Dy- namicstereo: Consistent dynamic depth from stereo videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.249449Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:cf4223b926c6a460dfe739846e9e173713d2ad59127615203a5fd3bc9707df3f","observation_id":"d9c4ac43-32b2-4787-be04-dec9c2a3990f","resolution":{"observed_at":"2026-08-02T20:08:33.249449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.384538Z","title":"The retinex theory of color vision.Scientific american, 237(6):108–129, 1977","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.384538Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:bb9c81797a80b202cf744248dc755a56425aa47bb00a41a9405fc2af3fb59bb1","observation_id":"0a1a3d9e-8086-48e5-a333-a02f7ebc0192","resolution":{"observed_at":"2026-08-02T20:08:33.384538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.547415Z","title":"Uni-perceiver v2: A gener- alist model for large-scale vision and vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.547415Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:960e3734defee42a49b38994c4e922e51c3f1c6089d9170fbc2cd97be38572d8","observation_id":"e1432e4b-0683-4e69-8da3-9333f4171661","resolution":{"observed_at":"2026-08-02T20:08:33.547415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.731063Z","title":"A closer look at invari- ances in self-supervised pre-training for 3d vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.731063Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:ac9f9feb6cc432faf59165546b2c1d7d50029cbd6496fb73765784e6db3a2ef8","observation_id":"5d3ec7a5-afc6-4820-b6b4-f0ef02907c10","resolution":{"observed_at":"2026-08-02T20:08:33.731063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.802426Z","title":"Contrastive multimodal fu- sion with tupleinfonce","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.802426Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:29d54a4d392e5d7407254e8b528433ae03dd06a968d5792cad097c4551e00c0e","observation_id":"fb6cb484-e8a5-4128-bb06-8ee3e802567b","resolution":{"observed_at":"2026-08-02T20:08:33.802426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.861631Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.861631Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:93eb72baaa736e9de713c99b115f6b0dad547cc999f6582f9d3d5d9056e9fbf9","observation_id":"f3f26e30-4f9f-4409-8da9-3357437d0aa7","resolution":{"observed_at":"2026-08-02T20:08:33.861631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.979151Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, au- dio, and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.979151Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:f94572494fa1be58247e0f6bad433044c383f9cec2307cd8bf909ff50d85c3a4","observation_id":"fdd3495c-84d2-415b-90d9-0608da5c4d5d","resolution":{"observed_at":"2026-08-02T20:08:33.979151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.098445Z","title":"Ma-avt: Modality alignment for parameter-efficient audio-visual transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.098445Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:9069612850c543d65eaf7516065b185431a6f997c971eca82ba8bea7f2a48e18","observation_id":"8533d64d-01b6-422d-b382-2d22c95ff803","resolution":{"observed_at":"2026-08-02T20:08:34.098445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.207183Z","title":"TIPS: Text-Image Pretraining with Spatial Awareness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.207183Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:d39cd24f0089cd92a27e54f778683d5c16e76273de1cd8aa06843424828ca08c","observation_id":"3da60b0b-60dc-48c2-ad4c-f9f728d08e14","resolution":{"observed_at":"2026-08-02T20:08:34.207183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.261314Z","title":"Large scale visual food recognition, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.261314Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:1ec5944a54c2ae4c3a9704029d6d9327efe12c7bcc31c310666bc1cb0dbc77ee","observation_id":"22915d5d-f162-468f-97c7-c25a476610ac","resolution":{"observed_at":"2026-08-02T20:08:34.261314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.349160Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.349160Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:20c8dda99f9415e568f3905ee36b48a89ad7187ec2d8e5bb5d048c882f6f0d0a","observation_id":"76aa84be-f5b1-43d5-807d-f843558942bf","resolution":{"observed_at":"2026-08-02T20:08:34.349160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-02T20:08:34.436108Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.436108Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:7d79979bc6b020a850754c38bd4ec149f7a10dc25fc49779d80f51208451fb42","observation_id":"cc49ad89-1e04-4196-9ff0-9bdb40abc99a","resolution":{"observed_at":"2026-08-02T20:08:34.436108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T20:08:34.539397Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.539397Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:bf721879a5f8937e02a7a43a52fa769abf2df44e9240853148ba2561e866f7d8","observation_id":"35fb48d8-d0de-4cac-aedb-d14e65b7b7ce","resolution":{"observed_at":"2026-08-02T20:08:34.539397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.635007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.635007Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:92731cec52b83b03e84b21ec69dd910baa763fc457b5118ed5a52b6779c451bf","observation_id":"f7fc82de-f603-4121-bd3d-4a0c1d2109e1","resolution":{"observed_at":"2026-08-02T20:08:34.635007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12634","last_updated":"2021-09-01T16:21:13Z","snapshot_observed_at":"2026-08-07T10:00:45.682572Z","submitted_at":"2020-06-22T21:39:56Z","title":"RP2K: A Large-Scale Retail Product Dataset for Fine-Grained Image Classification","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12634","snapshot_observed_at":"2026-08-02T20:08:34.697363Z","title":"Rp2k: A large- scale retail product dataset for fine-grained image classifica- tion.arXiv preprint arXiv:2006.12634, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.697363Z"},"links":{"cited_paper":"/paper/2006.12634","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:af0a62467681e6ca62699be9e8ea7203b2aa37e8265eaf5ac63988ada8a45b18","observation_id":"480bfd97-0bbd-40dc-81ab-ec8f7f0b74a1","resolution":{"observed_at":"2026-08-02T20:08:34.697363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.847462Z","title":"Susskind","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.847462Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:340454dc0ff824cc776851438cbbba24975180e04097488860fccdac34c7e5a9","observation_id":"5319969a-02cd-4780-83a6-46d82ee08dc2","resolution":{"observed_at":"2026-08-02T20:08:34.847462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.956458Z","title":"Deep metric learning via lifted structured feature embedding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.956458Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:05cf3eed0801a7f64eab2722bd89b10f6fda87149df31ce78fab6155ab16481e","observation_id":"365c19e4-0773-4a3f-b6b5-6ef3e941f089","resolution":{"observed_at":"2026-08-02T20:08:34.956458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.133853Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.133853Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:1afed92dbe88a0e2b57fcb17975d7b11248525ff91dc0c48d0ec4a1b1acb8a55","observation_id":"c46b1b79-01ab-4c9f-a8a6-9e7b5f5403e0","resolution":{"observed_at":"2026-08-02T20:08:35.133853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.254409Z","title":"Sequence to sequence learning with neural networks.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.254409Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:1339f190b298f94e86eb6d77fc87c69949ad723af5bd01a840d8c6c55ec5b851","observation_id":"4fc759f0-78fa-4455-8487-2b75353b8c58","resolution":{"observed_at":"2026-08-02T20:08:35.254409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T20:08:35.354646Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.354646Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2f30e52265a065c61115b3feea00ec9d3846ee5634177897171e0c8f8d2255dc","observation_id":"c499003b-7b93-4343-b691-b8a2502c91a9","resolution":{"observed_at":"2026-08-02T20:08:35.354646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.487554Z","title":"Con- trastive multiview coding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.487554Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:fca4d74cd45215830116bed112461dfe8db044aaaf95e00481ca5ab0db462c0c","observation_id":"5f664293-6f23-4dd1-bf2e-4f0d2d212d04","resolution":{"observed_at":"2026-08-02T20:08:35.487554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.613794Z","title":"Normalized object coordinate space for category-level 6d object pose and size estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.613794Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:591b33830628f0dec33d4f937d249c16d008038885c6f9282d8c0560e7c8d628","observation_id":"1681d64c-8b23-4c4c-bf47-babf2893dc67","resolution":{"observed_at":"2026-08-02T20:08:35.613794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.715215Z","title":"Tartanair: A dataset to push the limits of visual slam","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.715215Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:8e671e769b952d527bc5c5aa17c4521afe7412220e344537c576d393f3993bde","observation_id":"89da3704-38c9-41e9-9859-1d9591083257","resolution":{"observed_at":"2026-08-02T20:08:35.715215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.871115Z","title":"Weyand, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.871115Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:331037c80fadfec28eec64431a91c96479800686d2f8893d7275ca773f7a1fc1","observation_id":"61f8c26f-41e9-4f35-a01c-6f1ea73fd1da","resolution":{"observed_at":"2026-08-02T20:08:35.871115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.948678Z","title":"Comae: Single model hybrid pre-training on small-scale rgb- d datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.948678Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:ac9d94a069062e30a559dda653c45da98f396cee030343ae5aaed352ee1d89e3","observation_id":"953dc62d-1e54-414e-b77c-39c06b987ef7","resolution":{"observed_at":"2026-08-02T20:08:35.948678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.042462Z","title":"Pace: A large-scale dataset with pose annotations in cluttered environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.042462Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:d795df27bca5597280d8e70c31f054be600834379dd9b09aa0dd6e3fe1a4fa30","observation_id":"785f0218-45dc-4b6e-ab92-39cd0664e0e7","resolution":{"observed_at":"2026-08-02T20:08:36.042462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.171697Z","title":"Colour coding in the cerebral cortex: the re- action of cells in monkey visual cortex to wavelengths and colours.Neuroscience, 9(4):741–765, 1983","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.171697Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:148894b89981316b4e6ab66bc87af4639a20a77d24d4d4785bbdbbefece825e1","observation_id":"e6dd3706-ec9e-4d8e-ac9d-df4bd1bc832f","resolution":{"observed_at":"2026-08-02T20:08:36.171697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-07-06T06:06:04.571585Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-02T20:08:36.301530Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.301530Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:ccd76f376c7d8ed1518d0e6c48bc2323371a179df026aeb6e3a149503452cd96","observation_id":"02b3718a-bc15-4657-a564-d9ee5d55d0df","resolution":{"observed_at":"2026-08-02T20:08:36.301530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.397239Z","title":"Towards uni- fied representation of invariant-specific features in missing modality face anti-spoofing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.397239Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2faf1169035609c223a64c8f20eef5e7c59499cad9a3847311c36d2707c957bf","observation_id":"fc53afc7-2eff-4a24-9b8a-b2cbcf37a4fa","resolution":{"observed_at":"2026-08-02T20:08:36.397239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.506756Z","title":"Harley, Bokui Shen, Gordon Wet- zstein, and Leonidas J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.506756Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:447106cc6f46a5655c45bb33f0bbae19af5300d1dd158c910811ff935fbd49db","observation_id":"64bfc636-1f70-4076-9a54-adb4773e3f65","resolution":{"observed_at":"2026-08-02T20:08:36.506756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.599423Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.599423Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:55e0b6e560b657c4fb1e599135677513fbc99d6d51da92afe01b771cddab4b1d","observation_id":"317d2e0e-b118-4918-9c21-643498c476d2","resolution":{"observed_at":"2026-08-02T20:08:36.599423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.708956Z","title":"Uni-perceiver: Pre- training unified architecture for generic perception for zero- shot and few-shot tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.708956Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:f25c23d3a3ba9e4263ab63a3c12365fbf3f180a8338b46475363aef8f17911ee","observation_id":"5fdbc378-aa12-4f20-8501-fce86eccfe51","resolution":{"observed_at":"2026-08-02T20:08:36.708956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.824126Z","title":"hard positives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.824126Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:9bf2ac5ad5677dfce5760eaeef76c2880f1cdd2adc9ce373d0509c027f16be04","observation_id":"0f7420b6-2b16-4fe2-b906-a34b0aa257d6","resolution":{"observed_at":"2026-08-02T20:08:36.824126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:37.017386Z","title":"Diagnostic Metrics Expanding on Fig 1, we report detailed cross-modal align- ment and cross-scene discernibility metrics before and after Omnivorous training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:37.017386Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:afb2bc9d90d1ec4e93eda898ca44ffbbba10df333ae1159891f671a2a81353dd","observation_id":"348b6eb6-ac4b-4168-b6ce-5b7b9f1edb3e","resolution":{"observed_at":"2026-08-02T20:08:37.017386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:37.081122Z","title":"adapter-on-top","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:37.081122Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:fb57ee3f8a5d4ef3fdd9163b9eb99ef58a9591d80c5e70b4dd62d34550a67fdd","observation_id":"f6d5bc12-02c1-4944-ae0a-466b3145fa14","resolution":{"observed_at":"2026-08-02T20:08:37.081122Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.925825Z","title":"pad- to-patch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.925825Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:58a7f6726fedcfd3eb437a4c3441a5e7a3215a461cce244e47ad275ec4b2068e","observation_id":"c88de4cb-0312-4d6f-8f0b-da5019cc5023","resolution":{"observed_at":"2026-08-02T20:08:36.925825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T20:08:29.492757Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2602.24181."}