{"as_of":"2026-08-07T07:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be63aed004897c2130b6dd6f19684c2b002a550aa2fbbd583f928b4c4c9e6fe1","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:27:27.457813Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T00:18:06.989944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T00:19:46.830591Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"cited_work":{"arxiv_id":"2508.16317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16317","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.16317 (2025)","venue":null,"work_id":"38b07e93-b791-47c8-bb94-970ea2319d68","year":2025},"citing_paper":{"arxiv_id":"2604.20392","last_updated":"2026-04-22T09:53:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T09:53:28Z","title":"Self-supervised pretraining for an iterative image size agnostic vision transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T00:18:06.989944Z"},"links":{"cited_paper":"/paper/2508.16317","citing_paper":"/paper/2604.20392"},"observation_digest":"sha256:fee4bc3a92ec974fc8fe1435cd6e24ea30b0bfb15cc7d78b60303648ac1e7fc8","observation_id":"5adc7cf5-6218-46ef-94a0-ab5649bd6a69","resolution":{"observed_at":"2026-05-10T00:19:46.831894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.16317/citation-record","integrity":"/paper/2508.16317/integrity","json":"/paper/2508.16317/citation-record.json","paper":"/paper/2508.16317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1412.7755","last_updated":"2015-04-23T16:49:23Z","snapshot_observed_at":"2026-07-06T04:04:42.444853Z","submitted_at":"2014-12-24T20:58:23Z","title":"Multiple Object Recognition with Visual Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7755","snapshot_observed_at":"2026-08-05T17:27:27.307944Z","title":"Multiple object recognition with visual attention","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.307944Z"},"links":{"cited_paper":"/paper/1412.7755","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:30d4e5ee5eec8a732c7fe4aa002fd3876b76b2fa1d7aefeaa6b6999e23a014bd","observation_id":"0c8306b9-7663-4232-8c24-e05fde8a6198","resolution":{"observed_at":"2026-08-05T17:27:27.307944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.312353Z","title":"Recurrent memory transformer.Advances in Neural Information Processing Systems, 35:11079–11091, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.312353Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:25dbfebc71818ad45c0ed232f7758d12b3a96a06bdd7f5624bf58a5c54f46758","observation_id":"927a8ded-f759-4f72-8949-2ea34848252d","resolution":{"observed_at":"2026-08-05T17:27:27.312353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09103","last_updated":"2020-10-18T20:55:49Z","snapshot_observed_at":"2026-08-06T13:30:42.765573Z","submitted_at":"2020-10-18T20:55:49Z","title":"Unsupervised Foveal Vision Neural Networks with Top-Down Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09103","snapshot_observed_at":"2026-08-05T17:27:27.315322Z","title":"Unsupervised foveal vision neural networks with top-down attention","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.315322Z"},"links":{"cited_paper":"/paper/2010.09103","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:424169a6f7efd7533ec6bb7a2bc885d37dbfe57e604c851ab02ccb1aaf8ef3fe","observation_id":"76f8050a-e11c-4d45-bdec-1cb159a25abc","resolution":{"observed_at":"2026-08-05T17:27:27.315322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.319481Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.319481Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:16ab1237a92cd3de02120b4c293c8d7039f40ab35e75a677fbd16647627fad16","observation_id":"e6dfe1e8-1524-4205-b161-7a7b20bedb88","resolution":{"observed_at":"2026-08-05T17:27:27.319481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.323004Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.323004Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:d4a393bef5c7e1c7bf293b5956f7e31536af80473f379b4e7c8f5c11cf0b3437","observation_id":"b3aaa650-34d9-4903-a1ff-157b3166428c","resolution":{"observed_at":"2026-08-05T17:27:27.323004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.325912Z","title":"Crossvit: Cross-attention multi- scale vision transformer for image classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.325912Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:18602a620f0cb178eb665319f757a793384909acc46a4793a552710e31ff10a6","observation_id":"8fd0df24-9575-4499-9c72-ffe64e97bda5","resolution":{"observed_at":"2026-08-05T17:27:27.325912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.329215Z","title":"Twins: Revisiting the design of spatial attention in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.329215Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:6a06bdcda0fb6c6a476ae540e82aa10fa529f4df1455e4630e092a1263bb04c7","observation_id":"f9068d13-2f5d-46f2-b32b-c763bb70f79b","resolution":{"observed_at":"2026-08-05T17:27:27.329215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-05T17:27:27.331915Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.331915Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:587b1820dcb7f5dbe74156fcf9e2df8db7ca29c9c9a7e8478e7502a3d8087a55","observation_id":"8cd95916-f42c-4cbf-adbc-918a8140f988","resolution":{"observed_at":"2026-08-05T17:27:27.331915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-05T00:06:47.268747Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-05T17:27:27.335478Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.335478Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:272b551be850280ac741eb9f31ac1e1caddc287cac97cafb7b7f57a7eb96ed60","observation_id":"19075cf4-b951-4568-9071-75f6726d3fe8","resolution":{"observed_at":"2026-08-05T17:27:27.335478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.338506Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.338506Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:ac9b037d4aebd2258620e8238927f600abbdc7974dd1987e9a753858954437ce","observation_id":"6ca2e5bf-ce41-48f1-b0f7-7ad4fdc9a6dc","resolution":{"observed_at":"2026-08-05T17:27:27.338506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.341479Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.341479Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:4f36bb072ed97181e69884dea1e069f005d4e5ae6b1e7055f5043307415438fd","observation_id":"c1dce6c8-e76b-45a0-bffe-f61e0e53d208","resolution":{"observed_at":"2026-08-05T17:27:27.341479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.344472Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.344472Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:6541fb49b670dd49bb8a44d066f27d067e949ee03bc0097a2dcbde26682401c5","observation_id":"aaf57278-b173-4168-b37f-92f2a593a554","resolution":{"observed_at":"2026-08-05T17:27:27.344472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.347313Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.347313Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:c3d1d069a8df71efb4a23f902de0850ef6c9ec345117e82ac3f535993ec71c4c","observation_id":"cd9a9ecc-e463-4993-813d-b69c6f6f83d1","resolution":{"observed_at":"2026-08-05T17:27:27.347313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.350398Z","title":"Levit: a vision transformer in convnet’s clothing for faster inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.350398Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:7b45979fd8aeaedd54c0ac039fbe8f3b121f5b33f8e62c0d07eec4ecfafbd2ec","observation_id":"9d6dada1-ce50-4a24-a437-ad3b1b399603","resolution":{"observed_at":"2026-08-05T17:27:27.350398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03274","last_updated":"2020-06-05T07:50:40Z","snapshot_observed_at":"2026-08-06T04:24:58.454238Z","submitted_at":"2020-06-05T07:50:40Z","title":"GMAT: Global Memory Augmentation for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03274","snapshot_observed_at":"2026-08-05T17:27:27.353476Z","title":"Gmat: Global memory augmentation for transformers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.353476Z"},"links":{"cited_paper":"/paper/2006.03274","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:1fe6fee3d0df886a4606d0d8c877bf1c08ccefa2bfc997c5de6b56580c876f9c","observation_id":"c15b22e6-0c54-4e8e-aadd-8a96b0755bca","resolution":{"observed_at":"2026-08-05T17:27:27.353476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.356848Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.356848Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:f7c08599128cb1ddf3c07bb77e2eb4b6e40bbbd62e2145a882011d156d1fe1a0","observation_id":"71b3601a-fb5c-4bde-9fdc-39f402495d78","resolution":{"observed_at":"2026-08-05T17:27:27.356848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.359634Z","title":"Rethinking spatial dimensions of vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.359634Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:ca97057f705ea07cccea57ab5763a3ea7684f79dd8c64babfdbaf4ca9d96ee44","observation_id":"1fce41d9-bef1-4e0b-b1a0-a33155f5f907","resolution":{"observed_at":"2026-08-05T17:27:27.359634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.362955Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.362955Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:ccc4842f894411611cc7cb83cb87518fc2dedef2cadaa0347678a85a5992d566","observation_id":"af1c7ca2-575d-46dc-bc05-1b8b7a613231","resolution":{"observed_at":"2026-08-05T17:27:27.362955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-05T17:27:27.365982Z","title":"Foveater: Foveated transformer for image classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.365982Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:108bad3aae790182a16f493229e3d0ceeb571e56e63044e3ae4bc604e5d7f724","observation_id":"4b1816c1-d9c0-45b2-bfd1-e280f749adea","resolution":{"observed_at":"2026-08-05T17:27:27.365982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.369577Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.369577Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:4337e87550c9bb331f6726a128ff89832fc79d17008d60a4c6c088c50d5acdc1","observation_id":"98bb2074-9493-4d4c-8edb-ec024923197e","resolution":{"observed_at":"2026-08-05T17:27:27.369577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.372280Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.372280Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:74d12585df96bbe3354b6b20b348870b07aa2d8bb2253f97f322943d5df97f7f","observation_id":"87a21bc2-22e8-4708-a579-c6890c405928","resolution":{"observed_at":"2026-08-05T17:27:27.372280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.375259Z","title":"The shape of ai to come! Talk presented at the AI Action Summit 2025, February","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.375259Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:50530a0ddc98a880bc79d338d8dc0c4f75b41d5881ff4641134f553422d51da4","observation_id":"b21999c8-807e-4d34-afef-ecaf1ad56060","resolution":{"observed_at":"2026-08-05T17:27:27.375259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.381369Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.381369Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:1c5279eb400ebb9526b35d2ce687988921bcc5271ec1f901516733edc31ebb1b","observation_id":"874d4f48-181a-4bc9-991c-b30b33576cae","resolution":{"observed_at":"2026-08-05T17:27:27.381369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.384475Z","title":"Swin transformer v2: Scaling up capacity and resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.384475Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:062b893e6f881cd9c9f06d1b710a275c8ae58cdba49acde7d28e0445efc62a93","observation_id":"42c87409-889a-47eb-92b7-833f2d6179c3","resolution":{"observed_at":"2026-08-05T17:27:27.384475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.387249Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.387249Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:a1a3ce29fa461d19c8216e282a4dba17ebe35451119cbd93f5c512ec876c28b8","observation_id":"1797c047-40c3-4b18-84ee-8f7d92039e23","resolution":{"observed_at":"2026-08-05T17:27:27.387249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.390154Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.390154Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:b758f418243e983abcb120df12630ecc46046b6403bba7776f5d8c1e423ce0a4","observation_id":"e91a171c-f011-456f-81fa-4bff63703a76","resolution":{"observed_at":"2026-08-05T17:27:27.390154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.393193Z","title":"Biologically inspired deep learning model for efficient foveal-peripheral vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.393193Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:7dd79c3ac2dd3da333c0528714fe782c8de76876dfbf829de86a555d62ca34d4","observation_id":"5c347d50-b1ec-403d-81f6-f15313cf9843","resolution":{"observed_at":"2026-08-05T17:27:27.393193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.396652Z","title":"Implicit-zoo: A large-scale dataset of neural implicit functions for 2d images and 3d scenes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.396652Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:5451a861d598ea0cd0ae2d1fa8eb7f78719a4341030a113ca6b8e595d62763fc","observation_id":"9dd77574-90b7-4942-a527-3ca615b0a47b","resolution":{"observed_at":"2026-08-05T17:27:27.396652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.399521Z","title":"Recurrent models of visual attention","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.399521Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:0c7164bd14b283d8e9d66eaed042374f8a6132c92c8c7cb318bf8b29f0cfac64","observation_id":"1bc456a7-46b0-4cc3-bf0e-17a4f878922e","resolution":{"observed_at":"2026-08-05T17:27:27.399521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.402827Z","title":"A focused backpropagation algorithm for temporal pattern recognition","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.402827Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:1707ac89a23ed7c8e8244f718107f4c33906a3572a528fb73f113ee4b4d5032a","observation_id":"b48966fb-0c63-4651-83cb-0f33d89b9957","resolution":{"observed_at":"2026-08-05T17:27:27.402827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T17:27:27.405864Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.405864Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:79c68dfe7219e5bde81a333b7568515a68731f9b88d5e7732913a3d15108466f","observation_id":"2435bb80-3ff5-4bbc-97c1-b56ba8a7efc9","resolution":{"observed_at":"2026-08-05T17:27:27.405864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T17:27:27.408925Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.408925Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:57dd8c3920f61fb0c55f0330177646310ad41db6319064554ee8fb505543f9f5","observation_id":"48d4fc6e-9e8f-40bd-acd3-ceb99b965205","resolution":{"observed_at":"2026-08-05T17:27:27.408925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.412060Z","title":"The utility driven dynamic error propagation network, volume 11","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.412060Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:4b70dc23d98de906cdbdf57c995ffb5b0ec56533f554e411854f050fc533cddb","observation_id":"989c24ae-3e9a-4302-a5c8-f4ab83a36fac","resolution":{"observed_at":"2026-08-05T17:27:27.412060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.415649Z","title":"Learning to generate artificial fovea trajectories for target detection","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.415649Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:9290be54073c231811e81a6a25de6bbb9d5c3ea8c984ab28bf0222b516f6f71d","observation_id":"4a252d4e-56bf-4346-8abd-e2766b715858","resolution":{"observed_at":"2026-08-05T17:27:27.415649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T17:27:27.418789Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.418789Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:bab8144182e07f16f0bc0f262e428b42016d148c311d6acfc2b55cd55b22b6cf","observation_id":"5179d160-0a2f-4669-b194-7892ebda47ac","resolution":{"observed_at":"2026-08-05T17:27:27.418789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T17:27:27.421857Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.421857Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:e45e0dddc49c1c54fcef304c35f43655ff94db13ae20e0cb7306b3cedaa4edba","observation_id":"b9a4db0a-45d7-440e-81c6-7c63814bfb5b","resolution":{"observed_at":"2026-08-05T17:27:27.421857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-05T17:27:27.424852Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.424852Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:c3ba8fb6742b3f971ca9e1988dfe83f061560cfbef9f8b17e4880d660a4a7810","observation_id":"f2f43293-0f23-40df-8516-3ec868624b0f","resolution":{"observed_at":"2026-08-05T17:27:27.424852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.427895Z","title":"Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.427895Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:ca06f66082b8e7996e42f59730536aad717eea9a387666040e15540234cf7e53","observation_id":"a741a6e9-efd4-4ca6-92eb-4c377c255371","resolution":{"observed_at":"2026-08-05T17:27:27.427895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.430683Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.430683Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:2744913568147205c487d34391fdc8456dd9afba98ccb2176219dc3dcc464def","observation_id":"b9b68948-deba-4e4a-8d6b-1cc4eccc121c","resolution":{"observed_at":"2026-08-05T17:27:27.430683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.433377Z","title":"Fixing the train-test resolution discrepancy","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.433377Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:1c63b6e614bc42b1af9e0aaba9ac01923e0d9c0a19381d12c39c5422901793e3","observation_id":"06fa8854-08a9-4831-9663-404560e1f09a","resolution":{"observed_at":"2026-08-05T17:27:27.433377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.436126Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.436126Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:3d3c6b077c577ea76469208db0a040f3e14e8aff4cdd8075352f61f60d542b78","observation_id":"c3ac5e17-72f8-48c0-ada2-10a8eee68f8a","resolution":{"observed_at":"2026-08-05T17:27:27.436126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.438932Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.438932Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:837b6bb19ce4c94db8ac4b5e72fa9b49330fb2e1d2d862d3b5631fde09eb5b3a","observation_id":"bf4ad697-0d87-4c00-881b-3044eda8f240","resolution":{"observed_at":"2026-08-05T17:27:27.438932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.442174Z","title":"Generalization of backpropagation with application to a recurrent gas market model","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.442174Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:ed40c656d91ca5e344368b506bc6eb9ccd4319cd2ababcaadf4b842a9cdc58f1","observation_id":"165d1bf8-f90b-421c-a49b-418a0760a1ee","resolution":{"observed_at":"2026-08-05T17:27:27.442174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.445077Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.445077Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:ed1dd1ae34c2e2aa2ea24a81546578d2d8067a1b640c89bab762d9a93e960fb2","observation_id":"3b8af0ec-c7a8-458f-97a2-51a01d46ca96","resolution":{"observed_at":"2026-08-05T17:27:27.445077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06891","last_updated":"2022-04-12T20:57:54Z","snapshot_observed_at":"2026-07-06T10:04:17.971100Z","submitted_at":"2020-10-14T09:03:36Z","title":"Memformer: A Memory-Augmented Transformer for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.06891","snapshot_observed_at":"2026-08-05T17:27:27.447770Z","title":"Memformer: A memory-augmented transformer for sequence modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.447770Z"},"links":{"cited_paper":"/paper/2010.06891","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:90e6f23472e6c8ee46ca8c7031ac1a50322fcc0c49946b0513899c1636871568","observation_id":"3f04c197-1320-4127-b732-0d3446cc14c1","resolution":{"observed_at":"2026-08-05T17:27:27.447770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.450958Z","title":"Neural fields in visual computing and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.450958Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:3c39cfdf40b414feb4c2c8cd1e36681951b55aef864b8dba87f1584c18ffc87b","observation_id":"905ebcd7-5c79-456f-aecd-eada393113de","resolution":{"observed_at":"2026-08-05T17:27:27.450958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00641","last_updated":"2021-07-01T17:56:09Z","snapshot_observed_at":"2026-08-07T02:29:59.839572Z","submitted_at":"2021-07-01T17:56:09Z","title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00641","snapshot_observed_at":"2026-08-05T17:27:27.454271Z","title":"Focal self-attention for local-global interactions in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.454271Z"},"links":{"cited_paper":"/paper/2107.00641","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:42e7ea7809512d9015e3706b72449b6595799e7033046cc0b674104ac8cc0e42","observation_id":"afac8872-93a0-4c4c-8016-5053ab299a07","resolution":{"observed_at":"2026-08-05T17:27:27.454271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-07-06T06:06:04.571585Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-05T17:27:27.457813Z","title":"\"\"Extract for a given zoom level","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.457813Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:6e0fde17215939b76d3a53bc2a2757c31b46649fd32d0e22bb031bd4864a1522","observation_id":"8ffb39f8-4169-4983-87c7-b5a4406cbcc1","resolution":{"observed_at":"2026-08-05T17:27:27.457813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:27:27.378175Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T17:27:27.378175Z"},"links":{"citing_paper":"/paper/2508.16317"},"observation_digest":"sha256:fdccd8d8f2271342432e7d22c4d5b182afa18196a3f5801c9d36fffd7b2f1f2e","observation_id":"587bb495-b9dd-44c7-bd01-1131514e119e","resolution":{"observed_at":"2026-08-05T17:27:27.378175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16317","last_updated":"2025-08-22T11:57:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T10:32:33.118170Z","submitted_at":"2025-08-22T11:57:49Z","title":"Vision encoders should be image size agnostic and task driven"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2508.16317."}