{"as_of":"2026-08-08T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b23c9202b59e7f63a1795a431975306319f1e9565134024935ca25b2bac79533","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:03.479929Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12982/citation-record","integrity":"/paper/2506.12982/integrity","json":"/paper/2506.12982/citation-record.json","paper":"/paper/2506.12982"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.534247Z","title":"Computing receptive fields of convolutional neural networks","venue":null,"work_id":"5be931a8-e0a7-4b06-b479-205a3a7b1d61","year":2019},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.047124Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:e527e409d1b43a182443b89895a8814772153ad8b267e8bc882a2fe4fbcaa63b","observation_id":"121603b3-c3c8-4fa1-91cb-0d361e9a426d","resolution":{"observed_at":"2026-08-07T00:42:05.536866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.528035Z","title":"Advances in medical image analysis with vision transformers: a comprehensive review","venue":null,"work_id":"76b8d9a2-4fab-42df-aff7-45f35ec716fb","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.133965Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:f6179aa18d7bbfa2c482c0b76749b95bc2a526c2842e5ed616b4075af66d7bca","observation_id":"d9c37fc8-f615-41b0-b61b-32b42d6841be","resolution":{"observed_at":"2026-08-07T00:42:05.530417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.520718Z","title":"Med-former: A transformer based architecture for medical image classification","venue":null,"work_id":"d9fae5ac-5936-4c12-ac58-683b9a7db8d6","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.178727Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:2674e1b4d8549ea046dd073dad9bf68c859acbf620e12217c7f9b578c747c9cb","observation_id":"298bc71d-fd4c-457e-bb0e-de4202cf6ffd","resolution":{"observed_at":"2026-08-07T00:42:05.523287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.513516Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":null,"work_id":"38874d5d-8c10-4215-ab71-6adfa5408dbb","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.235061Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:b867603a5b66e33db41491dc1f7c587800a64bbda24cc475590171a5c6f87410","observation_id":"e314b164-6d93-4c17-bac4-6063c24cea80","resolution":{"observed_at":"2026-08-07T00:42:05.516390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:42:00.295713Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.295713Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:abebc9a2dbf2b1346f1d83a352b1048dffcfe9307ec54e5fcd2473b2516e55a8","observation_id":"50520a72-5c57-44a4-8a2c-aed2f291d68b","resolution":{"observed_at":"2026-08-07T00:42:00.295713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.507135Z","title":"Convit: Improving vision transformers with soft convolutional inductive biases","venue":null,"work_id":"5ff4cc40-c21d-46ac-b499-2b1d2175c4aa","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.354803Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:fd9a490abdb09ef7eec55a96cc260f7bf94a1ca5d0ec900d06eb927e5bbcb333","observation_id":"b3af8723-7c72-4972-8629-18843815f874","resolution":{"observed_at":"2026-08-07T00:42:05.509453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.500313Z","title":"Rmt: Retentive networks meet vision transformers","venue":null,"work_id":"eb0f927f-1e78-4d9f-a26c-5f7ae6e0921a","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.411487Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:22dd910d19396ea31ad7034583e11ef0f616152ddff6cb37be33fd9d933f12cd","observation_id":"d4639b79-7dd1-4def-b9ba-5baafb7d5221","resolution":{"observed_at":"2026-08-07T00:42:05.502640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.493867Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"08666a5e-1bc4-40b7-af88-cf7f8041a19c","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.507518Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:834f0f87d3022cb21fdd67f817ae9a09dc6c0c99d1136d096a100b649584b41d","observation_id":"1f0487c9-c931-4c7b-b903-10e3e60a3165","resolution":{"observed_at":"2026-08-07T00:42:05.496119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.486825Z","title":"Higt: Hierarchical interaction graph-transformer for whole slide image analysis","venue":null,"work_id":"f152a6cc-4dff-4103-9e68-f3f647711d91","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.562683Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:84f77bd329192f05b1cd8e4fc3db3ea2ec2a3c365523ac2226214ccc76c743d8","observation_id":"d4222645-5575-48b0-9e1a-89fe1025b94e","resolution":{"observed_at":"2026-08-07T00:42:05.489171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.613900Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.613900Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:675ecb732ca15580386ad2407997b04740f1d09a3c73eb10c49e950441c45f47","observation_id":"5f5091d8-991a-4355-94ed-01c3315b7ef6","resolution":{"observed_at":"2026-08-07T00:42:00.613900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.476030Z","title":"Conv2former: A simple transformer-style convnet for visual recognition","venue":null,"work_id":"625edbad-1b82-4ddb-b142-64392f674bc5","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.668212Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:ab0a71382ff600d90ed0d8cdad04227b366f4bfb80b495793c8d98f953ff52d5","observation_id":"def84805-d051-4d8a-bd84-ccae8d84e67e","resolution":{"observed_at":"2026-08-07T00:42:05.478390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.721756Z","title":"Benchmarking self-supervised learning on diverse pathology datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.721756Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:64dedb72c6990789d666697f22f672c12912b3e376a823bd8675c974ffeb2ddf","observation_id":"92195be2-b7e0-409c-8cb0-cc7e922c4c70","resolution":{"observed_at":"2026-08-07T00:42:00.721756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13492","last_updated":"2021-12-27T03:24:03Z","snapshot_observed_at":"2026-07-06T12:22:32.240903Z","submitted_at":"2021-12-27T03:24:03Z","title":"Vision Transformer for Small-Size Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13492","snapshot_observed_at":"2026-08-07T00:42:00.774613Z","title":"Vision transformer for small-size datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.774613Z"},"links":{"cited_paper":"/paper/2112.13492","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:1b9486b4960424424e6d29b6e5ef7549d2d35059ceb3272d67d3b1a270c3eeb9","observation_id":"9b464d33-8b4f-4436-ac47-0df59a554708","resolution":{"observed_at":"2026-08-07T00:42:00.774613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.465858Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"e7c6620f-d4c4-43d4-baf0-2cc438531d7d","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.855810Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:23cd814ee15f6d8b47867b5dab00b96c53f40c1ffcaa536f0887cf841d150c81","observation_id":"3053d9d7-c1e7-44c5-a0a8-de337fa5567b","resolution":{"observed_at":"2026-08-07T00:42:05.468463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05707","last_updated":"2025-02-12T13:35:59Z","snapshot_observed_at":"2026-07-06T10:58:50.936587Z","submitted_at":"2021-04-12T17:59:22Z","title":"LocalViT: Analyzing Locality in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05707","snapshot_observed_at":"2026-08-07T00:42:00.924074Z","title":"Localvit: Bringing locality to vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.924074Z"},"links":{"cited_paper":"/paper/2104.05707","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:1161e17b4139b133983b28f3caa08dc3a22365d66c7071025ec549f8a04b16fc","observation_id":"52397976-09f5-4ae8-9038-7b709136d20c","resolution":{"observed_at":"2026-08-07T00:42:00.924074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.459026Z","title":"Scale-aware modulation meet transformer","venue":null,"work_id":"55afa277-41ef-4ed7-9602-51c9a0077ebb","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.975737Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:9a8fa204d81e8d938d13fe164ae4a666ededa017f98add0ef029e190a8f96545","observation_id":"5f28b332-df95-4833-b04a-638ef511a154","resolution":{"observed_at":"2026-08-07T00:42:05.461660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.452665Z","title":"Exploiting geometric features via hierarchical graph pyramid transformer for cancer diagnosis using histopathological images","venue":null,"work_id":"2b04a276-b76c-4d48-8895-cf0dec689f5b","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.050750Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:e6f4c56e9e3f96a9a3b86be453f034b8873182eb0fba1048651568f04f456774","observation_id":"cdd0b2fb-d693-44db-8011-068cc29c180d","resolution":{"observed_at":"2026-08-07T00:42:05.455126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.446142Z","title":"Efficient training of visual transformers with small datasets","venue":null,"work_id":"f2e2c5de-c78c-4399-8bab-9d237b9027b1","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.186246Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:60db3d0f24b5f16c3cee2aeca8f2455aa2a8d32efa2c5cbe5888e9f02b4c3bf1","observation_id":"5e1bf034-b649-4439-931d-92c2e631d6c2","resolution":{"observed_at":"2026-08-07T00:42:05.448424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.439136Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"093c8154-c983-4e59-a4cb-1bc6659a6fc9","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.293237Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:0c1b88507ee2fbd09e6665ab42438e6bb1795c605156d3176ae86448b82b0f25","observation_id":"3f4df035-9a75-439e-a79c-e617f38d61ce","resolution":{"observed_at":"2026-08-07T00:42:05.441813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.432426Z","title":"Hybrid ladder transformers with efficient parallel-cross attention for medical image segmentation","venue":null,"work_id":"4bac9f46-cb2f-445b-91b3-8bfb2801f831","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.341331Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:a5eb54310df52202ad605d48c5542c38ffde667dac18121617e34aa9e919debd","observation_id":"eeb6cd80-34e1-48e8-8777-2d5faebc73f0","resolution":{"observed_at":"2026-08-07T00:42:05.434969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.425530Z","title":"Medvit: a robust vision transformer for generalized medical image classification","venue":null,"work_id":"858f52e3-51a6-4410-a8ae-9a0fbdd62c5b","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.430781Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:64dc7548c6da45b19f68ccbf9698b8146f7318fea64feea5ee8f93b5ae0fda61","observation_id":"65557212-abf7-4534-b817-70631fa746e1","resolution":{"observed_at":"2026-08-07T00:42:05.428180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.398333Z","title":"Cell-detr: Efficient cell detection and classification in wsis with transformers","venue":null,"work_id":"027e60c0-f743-4dcb-8561-ad6ea66dd426","year":2024},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.662919Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:d5f68a00d1e6388b8b3896e650223906ad477b34feb5d9c46193aec651d040bc","observation_id":"18ce1c21-9bc2-4adc-b51f-0a62698bd0cb","resolution":{"observed_at":"2026-08-07T00:42:05.421183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.218840Z","title":"Do vision transformers see like convolutional neural networks? Advances in neural information processing systems, 34: 0 12116--12128, 2021","venue":null,"work_id":"ddb71c7e-976e-429e-9bac-f364cec78430","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.795141Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:bd3096cf858b6cc98e027c4b52f95b89bc12cc1f32fa7844063278010964f06b","observation_id":"00624969-f0c4-4b55-8cff-7f266306305d","resolution":{"observed_at":"2026-08-07T00:42:05.305020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:05.111677Z","title":"Transformers in medical imaging: A survey","venue":null,"work_id":"f3e0f05e-6e31-466f-bdb0-c0cda8b20ced","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.938556Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:a678f706147ce391e115bb091486a7b7e6709a26119101e71565940dddc18eb1","observation_id":"78f39b2a-4334-4bc3-8079-eb6aa7f762a9","resolution":{"observed_at":"2026-08-07T00:42:05.209668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.901005Z","title":"Transmil: Transformer based correlated multiple instance learning for whole slide image classification","venue":null,"work_id":"a573f721-74a1-4000-8dc3-c0bee0a6b6fc","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.070143Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:ac7bc25f9355bfef87d92be60a4fde836f66ddfdfbcba87fa0136f4200988937","observation_id":"7469ffd3-ae0c-49b7-9e3e-835abbd6deea","resolution":{"observed_at":"2026-08-07T00:42:04.989612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.687808Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"2cef2019-0235-467d-9fef-a7b2c04f08f3","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.235797Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:334e1930fc88ada8997c5da5b6fa69e1cd0b82c1673b74748a135d68d9fc395c","observation_id":"92a00660-ca49-474d-9aae-997f94d1973c","resolution":{"observed_at":"2026-08-07T00:42:04.786575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.437049Z","title":"Uctransnet: rethinking the skip connections in u-net from a channel-wise perspective with transformer","venue":null,"work_id":"756830db-44e8-4144-af20-2b8a55bb53f2","year":2022},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.352240Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:ac79937f04fe3a969a143b5b5bc0de57e5366a953be6c31315d28e6451e384a4","observation_id":"0c0b9d61-4cf6-4e23-a466-f9b00e5cca5a","resolution":{"observed_at":"2026-08-07T00:42:04.591573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.553062Z","title":"The cancer genome atlas pan-cancer analysis project","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.553062Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:713bbbc8d033253c557b620f0e6415a2a248c5f16153f5519cf5ffdc447c9b08","observation_id":"121df421-3e5a-4ac0-afa0-34baf9cc7704","resolution":{"observed_at":"2026-08-07T00:42:02.553062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.279135Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":"bee7c88b-55c4-4681-b0ec-08debee8be97","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.701230Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:a7583c1f36d1da78396df3e2d29d622a6bbeda5d963c159a30af8413efc240da","observation_id":"2ea0001f-c4b9-4962-9c5b-63b9e7cdde7c","resolution":{"observed_at":"2026-08-07T00:42:04.415585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:04.055099Z","title":"Co-scale conv-attentional image transformers","venue":null,"work_id":"7ed6065f-28f5-4cc0-84b1-55af6391f62f","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.815883Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:49804965137a6b143b164ececeaf0e1d3e1083b95175e98e46d6f934ced6d66d","observation_id":"5b54213b-59f5-44c4-a77a-9f180444fed0","resolution":{"observed_at":"2026-08-07T00:42:04.170358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:03.891533Z","title":"Incorporating convolution designs into visual transformers","venue":null,"work_id":"bfa3a62b-5edb-4f38-a313-eccd03f0fed3","year":2021},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:02.981271Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:8df477030d2df7156342bac4f4526856f4523f8ae6d3222c7b270ff6328af795","observation_id":"22ee1fca-c355-4cad-817c-890a6cf07767","resolution":{"observed_at":"2026-08-07T00:42:03.960318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06978","last_updated":"2024-11-13T10:29:01Z","snapshot_observed_at":"2026-07-06T17:00:11.930733Z","submitted_at":"2023-12-12T04:38:30Z","title":"CLASS-M: Adaptive stain separation-based contrastive learning with pseudo-labeling for histopathological image classification","version":4},"cited_work":{"arxiv_id":"2312.06978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06978","snapshot_observed_at":"2026-08-07T00:42:03.652437Z","title":"CLASS-M: Adaptive stain separation-based contrastive learning with pseudo-labeling for histopathological image classification","venue":"cs.CV","work_id":"cfe1fc73-1d09-4c78-a75f-207b0b3530fa","year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:03.137920Z"},"links":{"cited_paper":"/paper/2312.06978","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:8813ad92fe44322becd0fef3e2d23d57e7db0f063a878bc2d2fd7c2e6f7ac831","observation_id":"7267ffd3-39ec-4805-a027-f49bd04c39d4","resolution":{"observed_at":"2026-08-07T00:42:03.788724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:03.322168Z","title":"Crossformer: Transformer utilizing cross-dimension dependency for multivariate time series forecasting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:03.322168Z"},"links":{"citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:13d58b4588025a74a8ded22dabcd99bcb4c377f3a8dc957ed167454c56cd1b86","observation_id":"002b6ea9-b74b-47ae-ab6c-537edb0442c0","resolution":{"observed_at":"2026-08-07T00:42:03.322168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-07T00:42:03.479929Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:03.479929Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2506.12982"},"observation_digest":"sha256:5c8a5319221a76d2aa04237462ff472a871d06eecd12db9e435f11cdd6025c70","observation_id":"edb0aeb1-3b24-468a-9ba1-c8724a95bdc9","resolution":{"observed_at":"2026-08-07T00:42:03.479929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12982","last_updated":"2025-06-15T22:42:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:35:00.417557Z","submitted_at":"2025-06-15T22:42:57Z","title":"DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2506.12982."}