{"as_of":"2026-08-07T08:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75d92a30865edd7132f75f956b553486eb1ae17fc00958b13cba06df878b8420","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:43:40.606136Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:56.509722Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-07T00:32:15.123562Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T19:27:56.785857Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2103.14030"},"observation_digest":"sha256:6df6030f87d0db563be24f2e25ef8714d9abfa35b0f7f032a2d08f0040101398","observation_id":"2212ddb7-89fa-46a9-899e-e24b0331cab8","resolution":{"observed_at":"2026-05-15T19:27:56.944252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:bb6620ec03ff51eec6fd5dcf02e1c56658e952adbc308935fafb514bf3ad1b21","observation_id":"27655d9f-a601-4848-8062-06195cc422f0","resolution":{"observed_at":"2026-05-14T23:07:42.452808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:0aefc90f6f8423c9a57223a42152b5282dd49c328839e506f19dd8375dabcc07","observation_id":"20bf5ead-4004-41af-b2ca-25e534e3039a","resolution":{"observed_at":"2026-05-16T07:02:53.836536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2408.12406","last_updated":"2026-04-03T03:35:40Z","snapshot_observed_at":"2026-08-04T04:50:28.469898Z","submitted_at":"2024-08-22T13:58:08Z","title":"Generalized SAM: Efficient Fine-Tuning of SAM for Variable Input Image Sizes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T21:26:32.186947Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2408.12406"},"observation_digest":"sha256:87ed74447b56d3e09817e78290b64958a5987e7f8078f85929eb0a2be01c1ef2","observation_id":"db8502d9-d9ca-4485-8058-95c3c5ec85a8","resolution":{"observed_at":"2026-05-23T21:28:27.563406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2504.14386","last_updated":"2026-04-10T20:17:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-19T19:20:47Z","title":"LOOPE: Learnable Optimal Patch Order in Positional Embeddings for Vision Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T18:18:56.091429Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2504.14386"},"observation_digest":"sha256:382886c7efb55efa43b905ae2430ccf999fd1965721ac826dcc42db195412aa3","observation_id":"2513cc64-b3f4-40ec-a2c8-d7071577fe94","resolution":{"observed_at":"2026-05-22T18:21:55.991100Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-07T04:43:40.606136Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-07T04:34:33.563581Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.606136Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:f2616231222990e2a3ae0d141b131b85810186b83e109d455278fdcc34d7409f","observation_id":"dcc5ce5f-76eb-4247-8dea-4353601196d6","resolution":{"observed_at":"2026-08-07T04:43:40.606136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-06T18:32:09.704815Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08178","last_updated":"2025-07-10T21:19:30Z","snapshot_observed_at":"2026-08-06T18:22:41.726828Z","submitted_at":"2025-07-10T21:19:30Z","title":"Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.704815Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2507.08178"},"observation_digest":"sha256:5a4598d9a288a67528d0563edfad0d317b9fe879eef42f6ac72ab6610d06f611","observation_id":"d3a3f5fd-6340-46d1-af72-99fcbb171e40","resolution":{"observed_at":"2026-08-06T18:32:09.704815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-06T15:19:59.017983Z","title":"Condi- tional positional encodings for vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16260","last_updated":"2025-07-22T06:17:44Z","snapshot_observed_at":"2026-08-06T15:11:47.919329Z","submitted_at":"2025-07-22T06:17:44Z","title":"ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:59.017983Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2507.16260"},"observation_digest":"sha256:37f3425d9cd98186770e664039b1dfb7dfa3314d1d3260d28be54abd21b3f08d","observation_id":"8987f68c-8c40-440b-bc33-52f6ac536e7a","resolution":{"observed_at":"2026-08-06T15:19:59.017983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-05T17:13:11.776775Z","title":"Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18308","last_updated":"2025-08-23T08:02:07Z","snapshot_observed_at":"2026-08-06T17:55:19.594772Z","submitted_at":"2025-08-23T08:02:07Z","title":"CoPE: A Lightweight Complex Positional Encoding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:11.776775Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2508.18308"},"observation_digest":"sha256:c61bfca738965735ebd58531f380b3de2f0806dc47b5c069f84c2fb3a5f23883","observation_id":"38c2ff56-6dd6-4526-84fb-d3c22f7b6628","resolution":{"observed_at":"2026-08-05T17:13:11.776775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-05T10:36:59.387017Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03973","last_updated":"2025-09-04T07:58:52Z","snapshot_observed_at":"2026-08-05T10:36:57.332431Z","submitted_at":"2025-09-04T07:58:52Z","title":"SAC-MIL: Spatial-Aware Correlated Multiple Instance Learning for Histopathology Whole Slide Image Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:59.387017Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2509.03973"},"observation_digest":"sha256:a7c5be949d874564b69638906f7932c8a7329cfa38e0d23532c6aebbc3ace1b5","observation_id":"b24d652f-9c45-4d74-a47d-4d3de200c058","resolution":{"observed_at":"2026-08-05T10:36:59.387017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2604.05215","last_updated":"2026-04-06T22:27:36Z","snapshot_observed_at":"2026-07-06T22:54:00.211106Z","submitted_at":"2026-04-06T22:27:36Z","title":"Hierarchical Mesh Transformers with Topology-Guided Pretraining for Morphometric Analysis of Brain Structures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:21.736766Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2604.05215"},"observation_digest":"sha256:21e2a3bc76557614e5d67b2951ffed63405c8f344e0af17df55dc5e0be482f2c","observation_id":"ba805d2e-9a36-4721-9bb3-b04ec0ed478a","resolution":{"observed_at":"2026-05-10T23:25:54.006092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2604.21035","last_updated":"2026-04-22T19:29:41Z","snapshot_observed_at":"2026-07-30T11:22:05.443849Z","submitted_at":"2026-04-22T19:29:41Z","title":"Masked-Token Prediction for Anomaly Detection at the Large Hadron Collider","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T23:24:59.497990Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2604.21035"},"observation_digest":"sha256:1c3aaec70fcafd2675db788e7563796082764a4f638413680c014aa4b30406f7","observation_id":"8183770e-7660-4844-a811-e3bc34453479","resolution":{"observed_at":"2026-05-11T14:11:04.330841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2605.11131","last_updated":"2026-05-11T18:40:13Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:40:13Z","title":"USEMA: a Scalable Efficient Mamba Like Attention for Medical Image Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:13:37.134769Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2605.11131"},"observation_digest":"sha256:73863c201adebe1968d154bcd1bfefdb280b149a6e669687a9d55b28262e77cc","observation_id":"7bee24b5-3fa0-4a53-b292-afdb8feb4d2d","resolution":{"observed_at":"2026-05-13T07:17:29.569616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2605.25949","last_updated":"2026-05-25T15:27:43Z","snapshot_observed_at":"2026-08-02T05:39:31.031529Z","submitted_at":"2026-05-25T15:27:43Z","title":"Small Models, Strong Priors: Architectural Inductive Bias for Parameter-Efficient Neural PDE Solvers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:14:36.959998Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2605.25949"},"observation_digest":"sha256:74d6f53ff074486bb28a1df9b9e5edbcb368b16a0bfd08b360041cac7c4e2eea","observation_id":"52959f8e-ec8f-4b95-9285-f7f071eae726","resolution":{"observed_at":"2026-06-29T22:24:00.986789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:5a191448c02664fc8b6c9ade00d89724139c4118196f872f90c533e90ff4a3ad","observation_id":"931c443e-be63-4654-9069-576441a40e0f","resolution":{"observed_at":"2026-07-03T01:27:30.487775Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2606.24498","last_updated":"2026-06-23T12:30:04Z","snapshot_observed_at":"2026-08-05T20:07:28.394395Z","submitted_at":"2026-06-23T12:30:04Z","title":"VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T00:59:43.745654Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2606.24498"},"observation_digest":"sha256:e2f5f79b8eb9e96ef8de4f3678ba847abecbc7695426c83d8c6984c8f27dc087","observation_id":"13d8427a-7d78-401a-a191-d5817240c59b","resolution":{"observed_at":"2026-07-04T16:09:56.511381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2606.31585","last_updated":"2026-06-30T12:38:58Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:38:58Z","title":"DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T05:39:21.642584Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2606.31585"},"observation_digest":"sha256:e2089a19348e2ff144b1fb2c86790f587dc1fa016fed7603fbd3799562ca4a6d","observation_id":"9a359755-f395-4fbc-ac6d-50e024e99554","resolution":{"observed_at":"2026-07-01T10:15:44.815071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2607.00249","last_updated":"2026-06-30T22:58:09Z","snapshot_observed_at":"2026-08-06T17:00:22.997717Z","submitted_at":"2026-06-30T22:58:09Z","title":"Device Passport: Enabling Spatio-Temporal Pretrained Models to Generalize Across Input Layouts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-02T19:32:45.679147Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2607.00249"},"observation_digest":"sha256:aabee7500ecb6ca2ca4d21db05da237a0e7a8ea98ee0fc21b3ec5a7d0d35281d","observation_id":"b6aec985-8936-44c3-9c7e-4bb20c02a4c6","resolution":{"observed_at":"2026-07-02T19:37:18.453593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-13T02:23:52.225787Z","title":"& Shen, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09526","last_updated":"2026-07-10T15:35:06Z","snapshot_observed_at":"2026-07-15T23:18:28.702991Z","submitted_at":"2026-07-10T15:35:06Z","title":"ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T02:23:52.225787Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2607.09526"},"observation_digest":"sha256:bada58eec2bbbba39050a9ed9e672d12573c8fc71c229e6be19d315cf64483b8","observation_id":"e08238e2-1901-404b-bb4c-ab96f4a925c0","resolution":{"observed_at":"2026-07-13T02:23:52.225787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2102.10882/citation-record","integrity":"/paper/2102.10882/integrity","json":"/paper/2102.10882/citation-record.json","paper":"/paper/2102.10882"},"outbound":[],"paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2102.10882."}