{"as_of":"2026-08-15T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7e57010b5c61834a690f3dd61dd5547297e3b3c0f448ba68bc2d97e6d876b45","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:23:56.952459Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10999/citation-record","integrity":"/paper/2507.10999/integrity","json":"/paper/2507.10999/citation-record.json","paper":"/paper/2507.10999"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:53.673418Z","title":"Imagenet classification with deep convolutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:53.673418Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:872718a5367fc503d96b300c845ce5c92afeeff42de0f50d3b731344d3d4a5a9","observation_id":"f759757f-d6eb-4c35-9ca6-4228bd445e81","resolution":{"observed_at":"2026-08-06T17:23:53.673418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:24:00.234506Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":"9bf8371e-0a15-472d-9a5a-fe2c2a35e7a4","year":2015},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:53.754253Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:db8b8921259eb472882ae7440b69bb2ace03650b663cd4c9ec152a264543f17f","observation_id":"3456eefa-e567-4c88-822f-af5e3a6b3fdf","resolution":{"observed_at":"2026-08-06T17:24:00.385836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:53.826756Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:53.826756Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:e7f4c7f6b10d7f58e56332c710aa815db29797df940bc54dd790da4eb06427f5","observation_id":"99ee193b-d972-4646-bd50-4bd5fb194b90","resolution":{"observed_at":"2026-08-06T17:23:53.826756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:53.884614Z","title":"Efficientnet: Rethinking model scaling for con- volutional neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:53.884614Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:a861c92a0cecbe61a22ae0d8d9a17e0473fa59a33130e5be105744f14d8a82ea","observation_id":"9ca99b18-239c-4be0-a08a-87a9ace8a2ca","resolution":{"observed_at":"2026-08-06T17:23:53.884614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:53.976021Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:53.976021Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:a99870c45f9c219f64ffc845b1a8a1155790dcbd5b16054abe47274dc417636e","observation_id":"7a859a63-2a50-404f-9617-7c5bff52f11e","resolution":{"observed_at":"2026-08-06T17:23:53.976021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.050396Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.050396Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:fe3b54761de42b7c651b80842a8b0bfdd1eeae2ba4bc28b2663365349872bc12","observation_id":"e9caa1c5-7383-4321-9a56-523089851745","resolution":{"observed_at":"2026-08-06T17:23:54.050396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.140107Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.140107Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:18f1dcdf64f67fd5ff820357491a8d7b98dcd2d4bf904694529f8de28adfd353","observation_id":"678eaf8c-f7a4-4d3d-89d8-5a91d11c652d","resolution":{"observed_at":"2026-08-06T17:23:54.140107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.234297Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.234297Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:86400f5c9c1adeac6606dd16770268c7551d021ec2610c77780edb2223b8370b","observation_id":"8de47692-5489-4a0e-90d5-9862fd036ea0","resolution":{"observed_at":"2026-08-06T17:23:54.234297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.302769Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.302769Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:6807cf5c320cd9aaed70b9d3d7e058577e9a68c978ed0bc5a7ebc9ada36d5728","observation_id":"fa6db881-5cd7-4d84-8fc4-4d53117d9f4f","resolution":{"observed_at":"2026-08-06T17:23:54.302769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.362040Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.362040Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:006b5862471b5045d729f58fbb0b69c1284692f90712af4e765cf72e87a7a098","observation_id":"d5504a45-6a31-483f-bb69-105525523873","resolution":{"observed_at":"2026-08-06T17:23:54.362040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.917042Z","title":"Rethinking attention with performers,","venue":null,"work_id":"1bd923bc-1510-4a4e-aa5d-26e82790d286","year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.442839Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:86308357b6d384c9a05537f605baff38331fe253c5056f6a8fdb18b31c53f7d1","observation_id":"5bf3e1eb-c6d6-453d-9787-fcce202213f3","resolution":{"observed_at":"2026-08-06T17:23:59.950362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.790108Z","title":"Video swin transformer,","venue":null,"work_id":"5f0c7074-f0c1-4508-8f4b-98ac039be99f","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.534803Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:91ca49ae938018f673e04cd1ccd53108a90d8108093b870d9eb519ba7d06b78b","observation_id":"da20834b-dccf-46aa-b0a0-58a5873c5d0e","resolution":{"observed_at":"2026-08-06T17:23:59.847836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.675560Z","title":"A convnet for the 2020s,","venue":null,"work_id":"683a3dba-c265-4eda-af10-e1cc63dbb136","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.612030Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:3759bf07481f8bdaeb1a4105ef245bdc3cf4dc76c401eea827bdb949a7cb6a91","observation_id":"f80b5880-025d-4e2f-bfce-e24ed8768d97","resolution":{"observed_at":"2026-08-06T17:23:59.724419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.650676Z","title":"Scaling up your kernels to 31x31: Revisiting large kernel design in cnns,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.650676Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:8c254d8e2e43806189c3a8b6f33d7f9852a2c556fbe6eba93374bc47f760fc5e","observation_id":"a497652b-5cf1-426a-b258-87debc6447b7","resolution":{"observed_at":"2026-08-06T17:23:54.650676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:54.735552Z","title":"More convnets in the 2020s: Scaling up kernels beyond 51x51 using sparsity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.735552Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:34a2d847df4a44772cc78cdda290090909cecc57da017cd0426eea04f752cc2e","observation_id":"3cc8b325-9e8f-4c69-842c-9ea767024190","resolution":{"observed_at":"2026-08-06T17:23:54.735552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.546513Z","title":"Conv2former: A simple transformer-style convnet for visual recognition,","venue":null,"work_id":"3b4974e8-d42a-463a-abb2-c59612c0fd76","year":2024},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.839848Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:e3404c2a51632b75f9e9734e902aa1b61eb95727edad8948b03a276bc10c7a5d","observation_id":"022df224-cc7b-41da-a09f-3395afd9da0e","resolution":{"observed_at":"2026-08-06T17:23:59.598627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.435332Z","title":"Hornet: Efficient high-order spatial interactions with recursive gated convolu- tions,","venue":null,"work_id":"28a2f6e0-1f43-4bae-904d-aaf368704cd4","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.902539Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:948bcdc123acc103f2f5873605159d762e3251543b2c0fc99e93407642f1ab45","observation_id":"441c86d8-b084-420a-bc5e-e4487ef7ca90","resolution":{"observed_at":"2026-08-06T17:23:59.482766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.333633Z","title":"Moganet: Multi-order gated aggregation network,","venue":null,"work_id":"86fdbcab-1e8e-4003-bcfe-87572a04cdaa","year":2023},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:54.970964Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:0b9525a03dc48a601acd81fd0f0910b17d230c61ca609ca7477dec8a777216b5","observation_id":"24e95e5b-2280-4859-afe1-453a002fd821","resolution":{"observed_at":"2026-08-06T17:23:59.381977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:55.058886Z","title":"Mlp-mixer: An all-mlp architecture for vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.058886Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:23c29995ae0cc64f4694e0f0836572b2c589d722557502b024f5f347a391cac9","observation_id":"f632263f-15b1-41a0-b411-501fa67a5c4f","resolution":{"observed_at":"2026-08-06T17:23:55.058886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:55.199047Z","title":"Resmlp: Feed- forward networks for image classification with data-efficient training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.199047Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:58a98e2b064d13758f9760eaf1da5c7f16438c94d39cfaceebfcc661893d1909","observation_id":"5310b241-42c8-4939-ab01-ec6996cac0f4","resolution":{"observed_at":"2026-08-06T17:23:55.199047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:55.329368Z","title":"An image patch is a wave: Phase-aware vision mlp,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.329368Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:39373a75d283b8595aae9721719488f83f442b5e645a67224c45086cf6779de0","observation_id":"93fc153a-3823-410b-82b3-3dcb9e50b6e7","resolution":{"observed_at":"2026-08-06T17:23:55.329368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10938","last_updated":"2021-06-21T09:16:51Z","snapshot_observed_at":"2026-08-07T18:56:07.129325Z","submitted_at":"2021-06-21T09:16:51Z","title":"A Game-Theoretic Taxonomy of Visual Concepts in DNNs","version":1},"cited_work":{"arxiv_id":"2106.10938","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.10938","snapshot_observed_at":"2026-08-06T17:23:57.091711Z","title":"A Game-Theoretic Taxonomy of Visual Concepts in DNNs","venue":"cs.LG","work_id":"1ad22958-8b7a-4309-9c6a-20e08175dc52","year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.420669Z"},"links":{"cited_paper":"/paper/2106.10938","citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:32d2f9cca30f7fc7669bdf0aede3345db7dd31cf9810830805b41b8090f07f6c","observation_id":"b527c652-59c6-42bc-a558-a6f363245962","resolution":{"observed_at":"2026-08-06T17:23:57.183454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.180740Z","title":"Discovering and explaining the representation bottleneck of dnns,","venue":null,"work_id":"0470dfd6-7f0f-4a5e-88aa-a89b3a6bb9a7","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.511296Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:b2bf80c77467705bd150e2dd4ed6330848d3cb9bd6f57ea7d6d993e099c679ce","observation_id":"f391e3ab-433f-4b91-81bf-42671fccb45e","resolution":{"observed_at":"2026-08-06T17:23:59.228588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:59.066036Z","title":"Towards a unified game- theoretic view of adversarial perturbations and robustness,","venue":null,"work_id":"e2506084-eb0c-442e-a5f4-6f517e1a8372","year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.565857Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:3cdceea7f140d492eaf28e3c2f9848336f57620c0fd3e0aa61639eb657ce6e7b","observation_id":"4e19623d-a7e8-4aa1-a008-db335b2dae32","resolution":{"observed_at":"2026-08-06T17:23:59.111011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.966115Z","title":"An impartial take to the cnn vs transformer robustness contest,","venue":null,"work_id":"df05207d-f5a7-4260-b07f-98997f1a7bb5","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.665270Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:530ec4fd3c4d5c845f1b52c4dd5bdb2cdcf4da4ae4b35b556aa7da761cbd007d","observation_id":"921a6a57-144d-4d3f-8c44-fc1c0b052a88","resolution":{"observed_at":"2026-08-06T17:23:59.006923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.868867Z","title":"Efficientformer: Vision transformers at mobilenet speed,","venue":null,"work_id":"9b7a2065-70b4-4b5a-ad97-54980f4c08a5","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.733378Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:c21e4e3ff0ebc5457662b6fd05a2f410e441bbc96015587694aea1c4a0472b59","observation_id":"acb50404-095a-4152-b8d8-26875241c53b","resolution":{"observed_at":"2026-08-06T17:23:58.910354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.748767Z","title":"Mobilevit: Light-weight, general-purpose, and mobile-friendly vision transformer,","venue":null,"work_id":"04c0e11e-8a51-400b-b391-5aeeee65515e","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.807472Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:d67149187f726cd9d0c212f8bb204cb64c408691cd3cc4c996f69b0d2f65eee9","observation_id":"c9f9056b-6078-46d9-813c-ca8fc15908f8","resolution":{"observed_at":"2026-08-06T17:23:58.804677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:55.885507Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.885507Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:b835d2b5aa49369f5ba61d5eb30d2a1cd7b71cbb802acbea90c5e6d932c44ec9","observation_id":"9c6e4dd6-87e0-4bcf-9de0-df1a3f685286","resolution":{"observed_at":"2026-08-06T17:23:55.885507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.601762Z","title":"Shufflevitnet: Mobile-friendly vision transformer with less-memory,","venue":null,"work_id":"24b61951-3072-47f9-9014-2496c163eac2","year":2024},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:55.982211Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:ff79e9da99f48861f39dae3b7beb7a3703d5468e707452d1d1b90580dc6a777a","observation_id":"76fd3537-7ec5-48e9-ab40-b94a676b1b5f","resolution":{"observed_at":"2026-08-06T17:23:58.656674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.487613Z","title":"Visual attention network,","venue":null,"work_id":"9d65d7a1-9449-447f-b543-8409adac1ee9","year":2023},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.050801Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:86aaee95902fba663135152b4a7339e999d543123e70774683098bb0c6405024","observation_id":"63e61212-8c69-4c61-bffe-d9afc52e8060","resolution":{"observed_at":"2026-08-06T17:23:58.527575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:56.127785Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.127785Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:7a17615fb23b6af80b6501c0a280634671915b79b934d4fce47f129a72b6f6f0","observation_id":"e89e484e-698b-4d6a-90cb-d3a712528dbf","resolution":{"observed_at":"2026-08-06T17:23:56.127785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.333275Z","title":"Global filter networks for image classification,","venue":null,"work_id":"30e5a7aa-7a96-437c-9d08-911c28b07f10","year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.212605Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:af768bf8a8047e4942450ae1d24b5e245c1f91342d6cbe3f61aa3c19b5ac3aa5","observation_id":"16043f09-d7a1-440b-b3de-6edeccf8a992","resolution":{"observed_at":"2026-08-06T17:23:58.388111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:56.301211Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.301211Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:fcc8597de732f005d8a66b0d71c8928a3508bef12ecb23604c97913caaa82845","observation_id":"e9c6fed1-8df6-4d16-8dee-41374704358c","resolution":{"observed_at":"2026-08-06T17:23:56.301211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.167623Z","title":"Early convolutions help transformers see better,","venue":null,"work_id":"e07f6872-4bc8-4891-b4b9-f128845c610d","year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.305452Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:005877e32df72c60ac25879850278c536da5c36e1f88860ec9bda352aa2e15a0","observation_id":"cbf8d823-4e20-41ea-8cf8-89ac1b2a65d0","resolution":{"observed_at":"2026-08-06T17:23:58.224743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:58.019634Z","title":"Rethinking vision transformers for mobilenet size and speed,","venue":null,"work_id":"772bfd35-c82a-48e5-ab7a-9f236241b865","year":2023},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.310374Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:8c8d7d7ae5dea3338ca24f5311f5bae91abd907df489c36219e635c4139b3517","observation_id":"d5649b72-61b2-4672-a110-b08b3b963202","resolution":{"observed_at":"2026-08-06T17:23:58.065566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:57.865242Z","title":"Mobileone: An improved one millisecond mobile backbone,","venue":null,"work_id":"72eaf7db-e9cc-4f55-b6b5-80fc73be66b3","year":2023},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.354686Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:eb6c463f5ff03520572b4eba5e56e8fe72d86edb9aaf4905ab7f8703b1149e6a","observation_id":"a6cf1a49-2cc7-46a2-850b-b212ffa79bd9","resolution":{"observed_at":"2026-08-06T17:23:57.933127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:57.715053Z","title":"Deformable {detr}: Deformable transformers for end-to-end object detection,","venue":null,"work_id":"f3faa23a-2ae8-4891-bbde-fdaa75b43d0f","year":2021},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.438506Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:85b0332a2dd1266879fd8dbfda58462c09ef07fafb33551592a1edf1ddfd9df0","observation_id":"425953f8-d064-4830-9036-236b158b1480","resolution":{"observed_at":"2026-08-06T17:23:57.771653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:57.559153Z","title":"Detrs beat yolos on real-time object detection,","venue":null,"work_id":"22c5136f-2387-47ef-9bc9-280968676af4","year":2024},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.562689Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:5285a3c765344bbbcda2d48bae018d3ef43882051304f36982a102bcc712436a","observation_id":"fbe65cb3-9615-4ac7-985a-39f3972d259d","resolution":{"observed_at":"2026-08-06T17:23:57.619686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:57.403585Z","title":"DAB-DETR: Dynamic anchor boxes are better queries for DETR,","venue":null,"work_id":"dbecf704-6324-4df1-a49f-fd8069359edc","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.708214Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:b39b6df7317cd7f32fe8af561951e7b0431418c04b894b7ff328276bcc5526a3","observation_id":"05f42290-4b9c-4c1a-8027-83cef029963c","resolution":{"observed_at":"2026-08-06T17:23:57.439721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:57.250404Z","title":"Dn-detr: Accelerate detr training by introducing query denoising,","venue":null,"work_id":"6e5a1b21-2eb9-4a07-a71e-6a0db6eb7e0f","year":2022},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.820057Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:1f8cd0ab6d627b9b28a403b916e19be0bf782875f714ccb54efc65afc72806cc","observation_id":"254f1945-2c15-412b-92f1-ab92dd689705","resolution":{"observed_at":"2026-08-06T17:23:57.324452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:23:56.952459Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:23:56.952459Z"},"links":{"citing_paper":"/paper/2507.10999"},"observation_digest":"sha256:cf833d72555b3bcdee1b8fdbee06d239115b5f9edae2061c3b1d455ef1b9e172","observation_id":"908aa594-bce4-44c0-b4fa-435cc9e97222","resolution":{"observed_at":"2026-08-06T17:23:56.952459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10999","last_updated":"2025-07-15T05:34:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:57:53.730899Z","submitted_at":"2025-07-15T05:34:56Z","title":"SpaRTAN: Spatial Reinforcement Token-based Aggregation Network for Visual Recognition"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2507.10999."}