{"as_of":"2026-08-13T10:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3054f48c788259889b1d3e6cf472113205a630d81c813f381c2051051d9f6f91","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:59:36.446502Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15787/citation-record","integrity":"/paper/2411.15787/integrity","json":"/paper/2411.15787/citation-record.json","paper":"/paper/2411.15787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.514480Z","title":"Asano, Christian Rupprecht, and Andrea Vedaldi","venue":null,"work_id":"8882cd71-c278-469c-b74c-9aec3d508f3e","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.162993Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:d351eecac1881df8a608b006646d6d2460dac5ccd014ac80bc5b482e9100a375","observation_id":"c0c18bca-5231-4214-b82b-0e51ceb643c7","resolution":{"observed_at":"2026-08-12T13:59:37.518865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.502847Z","title":"BEit: BERT pre-training of image transformers","venue":null,"work_id":"3a995837-dd67-4833-b480-8e6c9d99a738","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.167722Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:080140226442f64236a69a10c0364949bb0fe21a8a6a58bcbfbf059ea9771e22","observation_id":"fb9c483a-0a2e-4aa0-95d1-237f9ae77cf2","resolution":{"observed_at":"2026-08-12T13:59:37.507105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.489467Z","title":"Cascade r-cnn: Delving into high quality object detection","venue":null,"work_id":"cc5a1846-31f8-42e6-96ef-bff083c9b263","year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.171857Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:145c64369c7e43dc1b279978bdabd0e99331317f9d106e0043c0cb7b442ecbac","observation_id":"81363a80-e5b7-4c4c-93aa-0416cae652cb","resolution":{"observed_at":"2026-08-12T13:59:37.493756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.478842Z","title":"Unsupervised learn- ing of visual features by contrasting cluster assignments","venue":null,"work_id":"db4cc7e0-483b-4edb-8f42-2763a1588cce","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.175892Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:ba11269203278ddce8d81ccbc41c3735b2aff31d3bde018c06db7d5012893489","observation_id":"17b47991-8b28-4e0b-9141-b7f273e49974","resolution":{"observed_at":"2026-08-12T13:59:37.482258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.467762Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"f92227fd-235a-4dd9-a322-a3b9dc035683","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.180754Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2822bf29b5da6a8797340d025460ea2ee9a57583d0ddb94e86c2bac08876c2e0","observation_id":"0eb08d6c-8a62-4bb8-87af-39508d7990a7","resolution":{"observed_at":"2026-08-12T13:59:37.472053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.455457Z","title":"Mixed autoencoder for self-supervised visual representation learning","venue":null,"work_id":"db8daae7-72aa-4aed-8b36-3895f0a21882","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.185131Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:d2446724be3d0d84070adc33b9541cb393732fc142ec0d8fd24b0b90f15aaa98","observation_id":"e5b8be40-8107-4031-972d-4d6a660ce06f","resolution":{"observed_at":"2026-08-12T13:59:37.459500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.441757Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"232bf94c-eb18-4341-89bc-3e55f0bba43d","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.189448Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:9875c7df0c75290f66bfa2ca4eda0ede9a5c7754298b5574fdf19a8481430cb3","observation_id":"bae4412f-d772-4e0f-80d8-54654691c16e","resolution":{"observed_at":"2026-08-12T13:59:37.446793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.431071Z","title":"Exploring simple siamese rep- resentation learning","venue":null,"work_id":"db8875d0-7086-4061-900c-feabbbb4399e","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.193352Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b59166caccd2da5103ac431358420f7ae60e53e7351c53b081c8d4b947d5c49e","observation_id":"4987cec4-5022-4483-86b2-723da00bcfe6","resolution":{"observed_at":"2026-08-12T13:59:37.434514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.419172Z","title":"An empiri- cal study of training self-supervised vision transformers","venue":null,"work_id":"addc9b97-0d05-4302-bc17-5583852fef04","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.197964Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:91d24e79a759b7b89abd1d1f5d1ffdc47308e7700a66a77da08d12d70fc83333","observation_id":"7b450849-3c64-41c3-b76d-bf7cd4ad6571","resolution":{"observed_at":"2026-08-12T13:59:37.423402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.405984Z","title":"Convit: Improving vision transformers with soft convolutional inductive biases","venue":null,"work_id":"7f7ee1a1-805c-4229-af13-ee41e670119e","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.202247Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:37746fe49e7bc93382e193573b6d1137d1cbd7365d4335660f18710860217e90","observation_id":"1c7a8955-0b96-42f2-b548-25581cf233fe","resolution":{"observed_at":"2026-08-12T13:59:37.410405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.393985Z","title":"Ensemble methods in machine learn- ing","venue":null,"work_id":"86627ddb-699f-4fca-b74f-79a5d19ded05","year":2000},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.205999Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:69efdc7c9355f2a5c8e068c69a3324743f83c6d9a4467fa04acecd4c24354a9c","observation_id":"d5345f7c-f55e-466c-8da6-f9b683ef5111","resolution":{"observed_at":"2026-08-12T13:59:37.397794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.380606Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"4690e6e2-fb31-4b3d-b940-e431f7c837dc","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.210402Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:ff2bcd801095f70ec3b63d6b7383859cc7babebb3e8024c17d6cacb3edf19050","observation_id":"7c14abbd-a1ad-4f6c-9577-b8b7051979d7","resolution":{"observed_at":"2026-08-12T13:59:37.385594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.367183Z","title":"Whitening for self-supervised representation learning","venue":null,"work_id":"9cacd323-fac1-4ab5-a1d3-2afffa7b5d30","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.215043Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:f9b9ca99a29b12d86b305e0d40ff983af8157a51e33ea6cce5b8f1d3b809d1e5","observation_id":"59e7332b-e982-491d-9d09-8a3b37c71d86","resolution":{"observed_at":"2026-08-12T13:59:37.371780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.353309Z","title":"Seed: Self-supervised dis- tillation for visual representation","venue":null,"work_id":"42797bb9-8dd7-43be-bec1-ecd0b652d110","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.218838Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:d297c559b80e93eec382b1cd24bd7b24e92d73137ebfdc248c692a27101457dd","observation_id":"f324fea3-b88c-4cbd-95d9-b320c9086d2e","resolution":{"observed_at":"2026-08-12T13:59:37.358369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.341458Z","title":"Evolved part masking for self-supervised learning","venue":null,"work_id":"4c0e4529-4a5d-4c2d-b58b-e7fa5a362286","year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.222715Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:efec66d1460a8fb4dd7e266fd97c276679f11023e60e7b62ae72d95f9b4dcaab","observation_id":"f8a93134-6acc-4218-9dec-85847ba44a80","resolution":{"observed_at":"2026-08-12T13:59:37.346320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.325528Z","title":"Ganaie, Minghui Hu, A.K","venue":null,"work_id":"52d305c1-6f09-4a35-92c8-e136e5485d2b","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.227572Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:5e2b0a8ef3b03b9f289a9c586408adcbcc79a980db4ef38d0fab7a5c3d2ec214","observation_id":"1df1351e-b688-472e-8008-58ad63218e85","resolution":{"observed_at":"2026-08-12T13:59:37.330615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.312235Z","title":"Large-scale un- supervised semantic segmentation","venue":null,"work_id":"fac72a23-5fe5-44a2-af5e-e67d13f5fd22","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.232442Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:10d3d5aa556cea29c7be5fa345689c763ebb707ed14eac14dfe56def56575d91","observation_id":"cc5b256c-db5d-4777-a2d4-2980d658d30e","resolution":{"observed_at":"2026-08-12T13:59:37.316715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.186403Z","title":"Richemond, Elena Buchatskaya, Carl Doersch, Bernardo ´Avila Pires, Zhaohan Guo, Moham- mad Gheshlaghi Azar, Bilal Piot, Koray Kavukcuoglu, R´emi Munos, and Michal Valko","venue":null,"work_id":"8a96c727-abe6-487c-916c-8db3e827d0bf","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.236321Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:75a353df5515a320710b00f7109801f845e6771098f3195d77c561a51dec0c5f","observation_id":"87d73ed9-4a22-4f77-a574-d3764fe50431","resolution":{"observed_at":"2026-08-12T13:59:37.245865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09741","last_updated":"2022-07-11T04:21:37Z","snapshot_observed_at":"2026-08-11T14:46:55.089040Z","submitted_at":"2022-02-20T06:35:18Z","title":"Visual Attention Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09741","snapshot_observed_at":"2026-08-12T13:59:36.240463Z","title":"Visual attention network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.240463Z"},"links":{"cited_paper":"/paper/2202.09741","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:dae326caff8b41855e4dc24e04c701d9a0b1b66a2938a26b67f3140d09c40488","observation_id":"0007e657-5c59-4277-9ac2-129af3be0f57","resolution":{"observed_at":"2026-08-12T13:59:36.240463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.173615Z","title":"Hansen and P","venue":null,"work_id":"3878b26e-4d3b-4c63-ae01-832c5e7eb595","year":1990},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.245057Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:00f64dbf783fc64f6c7b9951c06108ad2b6ea6c4640ab323a9830cfc132c4bb9","observation_id":"202ee373-4dee-40f8-b622-5c150b8e821b","resolution":{"observed_at":"2026-08-12T13:59:37.177669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.160805Z","title":"Training independent subnetworks for robust prediction","venue":null,"work_id":"d017a265-2636-48fa-a95b-bac5d4887e2e","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.249656Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b2b4241dedb794ecbc01abb377534f3f4dbb572785ca66ff1b4747f63472e1df","observation_id":"ec2b9bb3-731d-42c2-8a6a-304c77232e7a","resolution":{"observed_at":"2026-08-12T13:59:37.165226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.253645Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.253645Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1d4063ff105e620c50cafa0234b5f8681859f72b1bc7d2d600348588f85da66a","observation_id":"6f0a9f0a-c6a9-420a-b565-579b2f1db22f","resolution":{"observed_at":"2026-08-12T13:59:36.253645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.140789Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"4b95e079-4d4f-42db-acc4-fb9c5236e4f4","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.257724Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:b1efcf138b98daa8e8eb98daeecbb1bad4c2ceef8db2bbf421f89085863c6f47","observation_id":"7307fe2b-58c4-4e12-be64-f897cce54176","resolution":{"observed_at":"2026-08-12T13:59:37.144942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.128795Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"88dfb5fb-fd04-40b6-bd80-0fa518e07f2f","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.261961Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:bf41d2ae4257e66bd4b9a7f7a5539517f0ab89f9893585bce971a2c90646a686","observation_id":"fec79ee1-7fa5-4f2b-9c1b-320cee2d22b1","resolution":{"observed_at":"2026-08-12T13:59:37.132864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T13:59:36.265938Z","title":"Distill- ing the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.265938Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e710d0578fc53ca30e56e380c97509097b45c7edeabc4f724d008baa66858552","observation_id":"ae5b7a43-a9ee-4420-8f01-4c65f282ca8a","resolution":{"observed_at":"2026-08-12T13:59:36.265938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11943","last_updated":"2022-11-22T01:39:45Z","snapshot_observed_at":"2026-08-08T06:06:28.334347Z","submitted_at":"2022-11-22T01:39:45Z","title":"Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11943","snapshot_observed_at":"2026-08-12T13:59:36.270510Z","title":"Conv2former: A simple transformer-style convnet for visual recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.270510Z"},"links":{"cited_paper":"/paper/2211.11943","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2ac6482c47a7569c294dae67584220d026ad347a975b06db6df28ac322998582","observation_id":"f91d5ffd-e3db-4dee-ac1b-1705c7950631","resolution":{"observed_at":"2026-08-12T13:59:36.270510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-12T13:59:36.274517Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.274517Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e57cac3491b6097c529cb189af3161de85a52a59f9d3425c4777dcc77df2b7a6","observation_id":"2c8310df-939a-47f3-ba8c-54e875f15300","resolution":{"observed_at":"2026-08-12T13:59:36.274517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.116167Z","title":"Similarity of neural network representa- tions revisited","venue":null,"work_id":"20a72803-5f39-47c3-b58c-bdc7804275b1","year":2019},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.279665Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:5bc19b6f2fbfe121f0da09ceed5b39f0504bc466131ae27a9a12ca2e98f7c827","observation_id":"008a7f77-e186-44e7-8e9b-595500a28f5c","resolution":{"observed_at":"2026-08-12T13:59:37.120725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.103860Z","title":"Fractalnet: Ultra-deep neural networks without residuals","venue":null,"work_id":"98ef8027-d279-4c60-b82d-af36a5e0676a","year":2017},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.283495Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:0f25097647c7b6342f4368f0d03a7b2264d685f89b9911493e7d0c652d4a5b4b","observation_id":"6b864517-9da5-4755-9925-88bcbaf7e41c","resolution":{"observed_at":"2026-08-12T13:59:37.108217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06314","last_updated":"2015-11-19T19:19:58Z","snapshot_observed_at":"2026-07-06T04:37:08.670695Z","submitted_at":"2015-11-19T19:19:58Z","title":"Why M Heads are Better than One: Training a Diverse Ensemble of Deep Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06314","snapshot_observed_at":"2026-08-12T13:59:36.287012Z","title":"Why m heads are bet- ter than one: Training a diverse ensemble of deep networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.287012Z"},"links":{"cited_paper":"/paper/1511.06314","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e66dfc0ca410521c058042d5f19e89759fd4e600643bee1bad63137cfa3d90c7","observation_id":"cf0c168f-5f8b-47c9-b486-193d522a2456","resolution":{"observed_at":"2026-08-12T13:59:36.287012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.092457Z","title":"Sere: Exploring feature self-relation for self-supervised trans- former","venue":null,"work_id":"304ee2fb-f54d-445c-a508-f598318a5382","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.291248Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:12935305772b8d9c5f42a46db58fdaf890b29f61b8da6868427970c6f9702a92","observation_id":"49c894ea-0fc9-4cbd-be3b-b64fc9434d9c","resolution":{"observed_at":"2026-08-12T13:59:37.096601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.05108","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.622223Z","title":"Enhancing representa- tions through heterogeneous self-supervised learning","venue":null,"work_id":"2e4a694b-7bda-415f-8d05-d46438314762","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.294927Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:8560d41c7371e380a036c05b6861d84a491c16e46c89c71cc803553367a17111","observation_id":"06f74ad0-5d71-4f4f-8297-eb3141445aee","resolution":{"observed_at":"2026-08-12T13:59:36.630796Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.079853Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"9d724c20-85e1-45cc-86c1-eac4ada8e929","year":2014},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.298601Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:5f43d1a61d217a824aabb07fc4548ede642a8ec1f3782c03eb44ae65add9f7f5","observation_id":"7de05d14-dcb8-4fab-be4f-7cea56036150","resolution":{"observed_at":"2026-08-12T13:59:37.084032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.067429Z","title":"Swin trans- former: Hierarchical vision transformer using shifted win- dows","venue":null,"work_id":"f081ddc9-fd33-4de9-9a64-3a6f60f1fc75","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.302744Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:30e3ff289ff107d2f5b06aa8bd15a1ccee65336789992c6129107905dd8d1f79","observation_id":"1e928978-8500-4391-873d-2a7a81ef28c1","resolution":{"observed_at":"2026-08-12T13:59:37.071789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.053270Z","title":"A convnet for the 2020s","venue":null,"work_id":"eb531301-488d-495a-8379-b836f743bd2b","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.306788Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:78763ded1b99a4b761dab9a3f3d008795d5d25d14367f71e6956f0e075747f14","observation_id":"cd04de15-3d21-4fa2-bd93-99c50f2f8caa","resolution":{"observed_at":"2026-08-12T13:59:37.058450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.039113Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"5373b063-e644-4db4-8d4e-4990aef0e617","year":2019},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.310991Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e85b1309d72df3ade06730b5fb45487ab2f5c0a4695ac4b2aff1847141bfe96f","observation_id":"fe97687c-bdf2-4f79-a15a-b052e55841bd","resolution":{"observed_at":"2026-08-12T13:59:37.044230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.025789Z","title":"Representation uncertainty in self-supervised learning as variational inference","venue":null,"work_id":"72dd84a3-fe40-4e62-8c2d-698a88097f2c","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.314763Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:28149ff1ea258999b6789da86043771e5f7ac49490a483a6a0588445f8e2a2dc","observation_id":"81876898-bc47-4c23-9244-b503f4ac24ce","resolution":{"observed_at":"2026-08-12T13:59:37.030120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:37.011441Z","title":"Simreg: Regression as a sim- ple yet effective tool for self-supervised knowledge distilla- tion","venue":null,"work_id":"16d8a696-e5b4-4d43-8a95-ec7ffd8c5797","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.318518Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:a87ef2803ec28be74186a45350bf23f6e35d16557949cd278338c2e138d1e49c","observation_id":"474571af-d00b-4c85-9f9e-7093000d1393","resolution":{"observed_at":"2026-08-12T13:59:37.017322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T13:59:36.323425Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.323425Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e8934121d11259f9b08d535d038b3ab8e31f38a063a295d481bb50995c02e7d2","observation_id":"58b883a7-a95f-485c-965d-8b9157c8bdb5","resolution":{"observed_at":"2026-08-12T13:59:36.323425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.327999Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.327999Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1df7a99f3e0ba9c9ee38dc7445ad3439a7d3039746d06890ab5e93411183c1b2","observation_id":"e92f2de2-92a5-4f0b-90d8-4b6528726863","resolution":{"observed_at":"2026-08-12T13:59:36.327999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.991809Z","title":"Learning common rationale to improve self-supervised rep- resentation for fine-grained visual recognition problems","venue":null,"work_id":"63a25ad9-8dd0-4411-b8af-cd9b46dc0a37","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.332762Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:228d4972cb1ea7a43bc03c3558cee29826759597738a9513a89331bdc77f74b2","observation_id":"30511b61-22e1-4182-bfb2-190f132ed2ca","resolution":{"observed_at":"2026-08-12T13:59:36.995993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.979127Z","title":null,"venue":null,"work_id":"7373ea89-61b6-487a-b1ea-909edf165c96","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.337204Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:7c021a0ab71f59dd376cf10f94c73c5a074a159fa359e8285c4f49eed7f41a98","observation_id":"6c11bba4-cc9b-4d59-b780-d51ed92533c1","resolution":{"observed_at":"2026-08-12T13:59:36.984006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.967266Z","title":"Multi- mode online knowledge distillation for self-supervised visual representation learning","venue":null,"work_id":"c0c70179-8c08-4e74-97b5-68c873796c77","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.341166Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2e53643958a93d29693b86ad937cb7a8a8c16ce9bf316b167069b0bff4ec10eb","observation_id":"1397c6fb-8ffa-482b-9707-6664ac7e44ae","resolution":{"observed_at":"2026-08-12T13:59:36.971471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.954860Z","title":"Semantics-consistent feature search for self-supervised visual representation learning","venue":null,"work_id":"de1fe4d4-6427-4e0e-bb55-81d299859e59","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.345473Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:ca88cb62f3cbcd87ee12301e30b2465ce87afa7c01d74f5aa73de2b28b84ad37","observation_id":"39d4be1e-013c-4f9a-ac70-79b84717ee06","resolution":{"observed_at":"2026-08-12T13:59:36.958797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.942704Z","title":"Dropout: A simple way to prevent neural networks from overfitting","venue":null,"work_id":"a035d952-ca0d-41cc-87be-033a113b1739","year":1929},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.349178Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:eb4e2daf765bc54989288943b0eeb0c16edf76c4faebb843efa8bd96736b33e1","observation_id":"01ba14a2-f08d-40cd-be01-5faafd0dab63","resolution":{"observed_at":"2026-08-12T13:59:36.946527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.930035Z","title":"Siamese image modeling for self-supervised vision represen- tation learning","venue":null,"work_id":"cb6a4dfb-bd2e-4756-8acb-17b5400450d5","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.353103Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:60c59dca9a2e7c47803d95c8495b27ed1a254abab9db201e4b46f11ecca384c2","observation_id":"0ffb2b9b-743a-455d-9305-745c44fb2bd1","resolution":{"observed_at":"2026-08-12T13:59:36.934827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.916683Z","title":"Un- derstanding self-supervised learning dynamics without con- trastive pairs","venue":null,"work_id":"045609d7-977c-4c34-8d71-0b316cda1991","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.357880Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:f2ffd85b5a60dde2f7fb555bf4fd97eb93ff3f5d3979707b35ac4f2492f38b65","observation_id":"5160aa41-7918-4047-808c-b87342537b04","resolution":{"observed_at":"2026-08-12T13:59:36.921604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.904642Z","title":"The inaturalist species classification and de- tection dataset","venue":null,"work_id":"ba39eb80-c0ec-4a45-b01f-f6600e9ac82f","year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.362071Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:7f9facd41af4e6fb23d6bbb00dc0ca2b9e4452b2b9b7f9cd12bb30032163bce5","observation_id":"d4306c5c-5350-40be-a1a1-e9d2f647d87e","resolution":{"observed_at":"2026-08-12T13:59:36.908604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.365916Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.365916Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:5a75e5ee35a51777c1abc4a01040576150ed71d5cfcadb25aaa52e0e54fec5ef","observation_id":"fd3cc78a-db4f-4275-9230-f92fded43f8e","resolution":{"observed_at":"2026-08-12T13:59:36.365916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.884347Z","title":"Dense contrastive learning for self-supervised visual pre-training","venue":null,"work_id":"30e7a356-8a4e-4599-acbd-c8d6994a023a","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.370044Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:c4bfe28b27f4c15d225d58995fed870937a04d2f8406570f4e8e70fe7a23e5ef","observation_id":"c21843a7-1cc4-4fb6-b6d0-a03cbfb301fd","resolution":{"observed_at":"2026-08-12T13:59:36.888226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09133","last_updated":"2023-01-12T18:45:58Z","snapshot_observed_at":"2026-07-06T12:19:44.050065Z","submitted_at":"2021-12-16T18:59:59Z","title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09133","snapshot_observed_at":"2026-08-12T13:59:36.374197Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.374197Z"},"links":{"cited_paper":"/paper/2112.09133","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:0a2da7ebf745b8184586348bd7b11ec25b8a601a8051fe01242e6926be9275c1","observation_id":"0b6c0f23-d613-4c04-a131-7ab4fed5a8bf","resolution":{"observed_at":"2026-08-12T13:59:36.374197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.873102Z","title":"Batchensemble: an alternative approach to efficient ensemble and lifelong learning","venue":null,"work_id":"7c6bef70-ca3e-4b42-a640-ad23342e5b63","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.379007Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2aae30f560b7cefc93165b19461070cedebb9acf50e26b50040439f6c516dac7","observation_id":"8f63cfc6-8ea1-4a29-8c9c-fbd761f90e77","resolution":{"observed_at":"2026-08-12T13:59:36.877196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.860739Z","title":"Con- vnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"87eea922-ced8-45c6-a7ee-b6e44717b78a","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.383605Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:3b8d785230eb52a66245938f5d908c1382a91e47ff4a897d36c29313d4f17132","observation_id":"fd8cabfb-f044-4e51-ae64-d8cf6949b0e4","resolution":{"observed_at":"2026-08-12T13:59:36.865107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.846852Z","title":"Cvt: Introducing con- volutions to vision transformers","venue":null,"work_id":"549618e2-f416-4589-b6f8-9736a3819f3a","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.387576Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:831f4ec565f29a84b7b7b22420613604c839bf2904b15cc382dc4eda89f787e9","observation_id":"3f8ca473-1b5c-482f-ad48-83bae95b1767","resolution":{"observed_at":"2026-08-12T13:59:36.851238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.832944Z","title":"P2T: Pyramid pooling transformer for scene understanding","venue":null,"work_id":"5b25e156-62cb-4248-b6c4-287a3b4b4626","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.391428Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:e00aca8e8f1258011a56c81ccb51da524a4415da98b8e0680f18c422963fe3d7","observation_id":"d1933b00-fa25-46b6-9444-27b306a7c594","resolution":{"observed_at":"2026-08-12T13:59:36.837973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.820786Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"c35ecf7b-e6fd-4815-9d20-4956fd5191b7","year":2018},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.395599Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:0d30b54be0ed86c54a0c41ae2e338f6fae1979366e4ea8573fbc9208091219df","observation_id":"85ef4907-c63c-486a-81d0-55e8f7d0a51e","resolution":{"observed_at":"2026-08-12T13:59:36.824794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.809115Z","title":"Detco: Unsu- pervised contrastive learning for object detection","venue":null,"work_id":"0358517b-d1e8-4c1a-b10e-3231fe612856","year":null},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.399528Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:1b18bcfd13e536e366d10b081dca0d4800cbae1dde7868f8820c59dcc717d183","observation_id":"b3a14ab8-cde0-4d9a-b440-18f5bb7d8396","resolution":{"observed_at":"2026-08-12T13:59:36.813107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04553","last_updated":"2021-05-11T17:28:00Z","snapshot_observed_at":"2026-08-09T13:08:28.913810Z","submitted_at":"2021-05-10T17:59:45Z","title":"Self-Supervised Learning with Swin Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04553","snapshot_observed_at":"2026-08-12T13:59:36.404002Z","title":"Self-supervised learning with swin transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.404002Z"},"links":{"cited_paper":"/paper/2105.04553","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:361cfee2ca7d890b945b94a2b39f5560823e8e33488a883d99d2a95a6ca57c98","observation_id":"e9c44f02-2f1e-4160-ba2c-222945df8fcb","resolution":{"observed_at":"2026-08-12T13:59:36.404002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.797536Z","title":"Propagate yourself: Exploring pixel-level consistency for unsupervised visual representation learning","venue":null,"work_id":"c74fc69f-8372-4b38-a5ce-a34c3d3f4b06","year":2021},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.408074Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:bed40290b380a16dd65668502593c5b15902c611a7d75aea2e213b671708f800","observation_id":"586afe26-a476-4a99-b125-432adefc9de2","resolution":{"observed_at":"2026-08-12T13:59:36.801568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.412172Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.412172Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:dd4b88eaab86316ae1fca05f9799b502b6abcc34d504a9ee06fe9022b00fd57d","observation_id":"2262c200-fa96-41d5-9fda-4b9c8c84af89","resolution":{"observed_at":"2026-08-12T13:59:36.412172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.777797Z","title":"Bag of instances aggregation boosts self-supervised distillation","venue":null,"work_id":"bec812bc-cd90-4709-a94f-96fa950924ae","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.416426Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:2749a5eeecb4af74e609842d64a92438ad9bc0911f6f37ffda1706612897e2ec","observation_id":"6aab7386-a01d-4f1e-a02d-c4deaeeaa838","resolution":{"observed_at":"2026-08-12T13:59:36.782035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.420129Z","title":"Joint unsuper- vised learning of deep representations and image clusters","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.420129Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:464de2569f83fd38a25d1ed15b74e1e91a0dfcf63157389b26b53890dfa074a5","observation_id":"d73d5289-4ec1-4238-b808-479c9960f467","resolution":{"observed_at":"2026-08-12T13:59:36.420129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.755672Z","title":"Decoupled contrastive learning","venue":null,"work_id":"8ab5351e-6a9f-4a3f-a017-bf8e016160d7","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.424067Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:c3bf7400d77ac67ef9319df5a03fae91ab60042fc8a1f6e91aad91c9057f8239","observation_id":"b611e978-ca13-4602-a3a5-b61a99a31d0e","resolution":{"observed_at":"2026-08-12T13:59:36.759788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.742093Z","title":"Online deep clustering for unsupervised representation learning","venue":null,"work_id":"cbea7ee5-ec22-487b-8aa9-744318b42dc5","year":2020},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.428108Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:7ad32e5cde9fdf7a89aefeb6a868190b22bb865bca5385d7ff186fee12cf7965","observation_id":"da304176-fd51-44a5-8855-0610b6db12f6","resolution":{"observed_at":"2026-08-12T13:59:36.745952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.727984Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"79466df3-6e9b-49e3-b3b7-89e09c398635","year":2017},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.432014Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:9f2f72a4ae401c9a5a7f9f4bb87e3468077722164fe63f18cf2267105b87cd96","observation_id":"d104ba81-a887-4d37-9d54-85f9fd059ddd","resolution":{"observed_at":"2026-08-12T13:59:36.732631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.715335Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"a3c9a13f-20dd-4a61-93c4-05646a14f2af","year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.436927Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:9334812017707f4f47fcf589c6734ebded31a3a9abf0a78849bcda7d0abb0b22","observation_id":"59d1a300-238d-4504-bd43-6c4df54e38fb","resolution":{"observed_at":"2026-08-12T13:59:36.719476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14415","last_updated":"2022-03-27T23:42:05Z","snapshot_observed_at":"2026-08-12T07:17:17.539338Z","submitted_at":"2022-03-27T23:42:05Z","title":"Mugs: A Multi-Granular Self-Supervised Learning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14415","snapshot_observed_at":"2026-08-12T13:59:36.441292Z","title":"Mugs: A multi- granular self-supervised learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.441292Z"},"links":{"cited_paper":"/paper/2203.14415","citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:32797bd7477d4a8162f5e9a9efb2a946e8c9dac83de9a037561c94c206e8dcf0","observation_id":"3209ecb5-4892-4949-a2d5-7eb2ad445a7b","resolution":{"observed_at":"2026-08-12T13:59:36.441292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:59:36.703545Z","title":"Multi-label self- supervised learning with scene images","venue":null,"work_id":"90ad0c5b-ba6d-410e-a5cb-a5f46301406d","year":2023},"citing_paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T13:59:36.446502Z"},"links":{"citing_paper":"/paper/2411.15787"},"observation_digest":"sha256:860d64ad1b785be7a5fd39147ffd49d1d98179354672dabcb27bc956222967c4","observation_id":"a1d707bd-7ebc-4ab5-baa6-8d2b9186b074","resolution":{"observed_at":"2026-08-12T13:59:36.707319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15787","last_updated":"2024-11-24T11:33:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:51:43.248554Z","submitted_at":"2024-11-24T11:33:17Z","title":"Multi-Token Enhancing for Vision Representation Learning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":52},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2411.15787."}