{"as_of":"2026-08-13T05:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a78955419ab545d0e47988d59c1b0c08771f632acbb1302515e27e13a0254dd","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:15:22.887919Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14429/citation-record","integrity":"/paper/2411.14429/integrity","json":"/paper/2411.14429/citation-record.json","paper":"/paper/2411.14429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.473367Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.473367Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:bf05cb0a42af291b8cb14c1cd0d89e96d26683751af611fbf1d4144ed42a9873","observation_id":"85ec6c65-1333-490e-ad08-3faccc2cd0f9","resolution":{"observed_at":"2026-08-12T15:15:22.473367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.479201Z","title":"High-performance large-scale image recognition without normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.479201Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:0ac6075fc267674cbc23d3694cb220a82dc246e69b159e405969853170b8ddf4","observation_id":"6e13fda8-0217-41df-b529-f87e235e8181","resolution":{"observed_at":"2026-08-12T15:15:22.479201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.485564Z","title":"Regionvit: Regional-to-local attention for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.485564Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:f79692fbfb34d776863060c7fb702fb75bc0896c3a6ebc53f470dfe598da10e8","observation_id":"575d3e38-d4ce-4536-8244-5200b0306881","resolution":{"observed_at":"2026-08-12T15:15:22.485564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-12T15:15:22.490646Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.490646Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:ab6b51e73f09b025b3d2f1a57c6f2bb44f2c89e8cc5477048c95a1d8ca4017fc","observation_id":"92577866-f032-4765-a7f6-826adf46ba12","resolution":{"observed_at":"2026-08-12T15:15:22.490646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.497258Z","title":"Mixformer: Mixing features across windows and dimensions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.497258Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:f03bfff05f2752c3cbcc66cd24867cb78e28ea4ff4e83beb8e7c8cb7af2704bd","observation_id":"1b1964f5-579b-45c3-ab6c-d88843bae7cf","resolution":{"observed_at":"2026-08-12T15:15:22.497258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-12T15:15:22.502531Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.502531Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:cd3533553be07444a64b1a42c91b0d5b02c2bed3cf6b29240ccf849e04c5cef0","observation_id":"e0a296c7-cb84-4a71-bf8e-59af214b155d","resolution":{"observed_at":"2026-08-12T15:15:22.502531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-12T15:15:22.508849Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.508849Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:29ab45d69eaf1f5b41a2e5cc638ca414d302e6a4c49a819a9a9a03a266b9b233","observation_id":"8c995fce-d942-4a08-b3c4-1581c1abf564","resolution":{"observed_at":"2026-08-12T15:15:22.508849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.515367Z","title":"Twins: Revisiting the design of spatial attention in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.515367Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:797f85964670e8be4894948419068adf0b6bd14770e15b302858fae745ea8ee9","observation_id":"aa796205-2e8a-4e63-bbc0-620eee8759ff","resolution":{"observed_at":"2026-08-12T15:15:22.515367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:24.065410Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":"48cf2870-7242-48e8-9ba2-572b4a6f64b6","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.520564Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:42b2ea23ebe7681a27e98931715ce5e0c0505116ea4b56c882773dc77c2f4d38","observation_id":"601dfdc7-aa3e-4e1e-afa1-e0cdc0d3945e","resolution":{"observed_at":"2026-08-12T15:15:24.070229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:24.049972Z","title":"Openmmlab semantic segmentation toolbox and benchmark","venue":null,"work_id":"275c59cb-08d8-48b0-8379-3a5e0e821d2a","year":2020},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.525310Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c1ddf3b821c4fd1a1354d56b586b54588bdbecaec878a9c1ec7a025a50a48a6d","observation_id":"10146473-e53e-44d2-8817-76f176627026","resolution":{"observed_at":"2026-08-12T15:15:24.054908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:24.034358Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":"8a66d282-3f15-4d2c-8a42-4ec5616cd4f9","year":2020},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.530096Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:004a4ee4bf9f351a9eccf58c97b45046687c6981ad64379e2d6eefefa468d661","observation_id":"39f87492-986b-4906-b614-23c2a040a523","resolution":{"observed_at":"2026-08-12T15:15:24.039588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.534952Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.534952Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:8cfaee5417255df7abb15f3e03d1a861a68e3d52d049db328839060e9f199e7e","observation_id":"b631f5e7-ed14-4224-87e3-bea6341558bd","resolution":{"observed_at":"2026-08-12T15:15:22.534952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.539649Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.539649Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:1da43985c9065d356062340be659d1ce987f300647705f7256b0a2cc547ffa64","observation_id":"69998699-e92a-4ad8-8e35-04f0500bb553","resolution":{"observed_at":"2026-08-12T15:15:22.539649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.998704Z","title":"Cswin transformer: A general vision transformer backbone with cross-shaped windows","venue":null,"work_id":"f2466fe5-6163-499c-bda2-e9b0c65dc3a8","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.544343Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:b9324fcab87f872fc6021026b0fcc64adb8899d1ea301012d50ad07cfe35f264","observation_id":"f5561a5d-fb6b-4a22-903b-7574b64cc779","resolution":{"observed_at":"2026-08-12T15:15:24.004354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.548993Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.548993Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:796f03294a01a760122f83ce681b5bb94cc85df046b9e7d283d75182ad4d0559","observation_id":"5de1cfa8-2c6e-4e69-ad9b-f9bc722a1bd7","resolution":{"observed_at":"2026-08-12T15:15:22.548993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.972145Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis","venue":null,"work_id":"6b41c8d5-5dfa-4157-999f-e0c8372838da","year":2016},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.553760Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:694d8d0c9fc7af42f85f189abb97fc01cdafbd6b3af7f6a3850e84dd206dbfce","observation_id":"277458b5-8800-4377-939c-1bb54742e2b2","resolution":{"observed_at":"2026-08-12T15:15:23.977514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.955517Z","title":"Paca-vit: learning patch-to-cluster attention in vision transformers","venue":null,"work_id":"e222f5e7-378d-4b8b-8fee-6e216e6f277f","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.558335Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c76ac8553ac34d464252dce28c50be403841df4a24280b6403c336767ce18a0f","observation_id":"f7b292ce-d2c2-4461-b342-f63166df136f","resolution":{"observed_at":"2026-08-12T15:15:23.961116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.940823Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"fd3567a4-4f87-437b-861a-44fcb89d39d2","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.562881Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:177e9b2006a45a3181113b16dc3ec75080a115849d6c43327228bd7111e16b0e","observation_id":"07734779-3b05-4a23-a3e5-dd1419365dbb","resolution":{"observed_at":"2026-08-12T15:15:23.945582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.925569Z","title":"Flatten transformer: Vision transformer using focused linear attention","venue":null,"work_id":"d502f11c-71c3-4ac4-b547-94978c62175e","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.567905Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:ae0cfd17234a6325781be0e8e1f155176ac00e71ba5339e684cf5eef955625f8","observation_id":"0c3ed845-77d1-4541-8d97-172f286a8e12","resolution":{"observed_at":"2026-08-12T15:15:23.930569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.909604Z","title":"Neighborhood attention transformer","venue":null,"work_id":"cb1f8836-e535-42d6-ab2a-8f057a5c3656","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.572522Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:316dccf95dca4e12399c663c58b8b22e2ae2a3c619d697ff1e5d87c39ab02cea","observation_id":"060daf9b-4efd-49d2-84d0-09e3485cdb35","resolution":{"observed_at":"2026-08-12T15:15:23.915125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.893227Z","title":"Mask r-cnn","venue":null,"work_id":"18d7fd5c-8edf-4c19-a71b-17b1d6bc8a0d","year":2017},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.577426Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c6cb8897c44aea394fbb5147af240f86febef8087436e3ac1314da91c0514c62","observation_id":"8d34bee4-5db0-4c50-8e03-f995303685a7","resolution":{"observed_at":"2026-08-12T15:15:23.898705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.582165Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.582165Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c2777553d10f83fca7877b3f6c8af8debd7b6987655ca8e7947627b897d71771","observation_id":"4e9946a9-0230-4ee2-90dc-e53d280b4777","resolution":{"observed_at":"2026-08-12T15:15:22.582165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.586747Z","title":"Squeeze-and-excitation networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.586747Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:e63fbb7e61eb2b9184877e24f429aded30ab873191189ef183c49b2d5cf81cd2","observation_id":"2456e701-6b9d-4a64-bc77-d77180d10247","resolution":{"observed_at":"2026-08-12T15:15:22.586747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.858206Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"61d3cf8d-5f4b-42ed-9dba-141d7ef2cf09","year":2016},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.591293Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:e5cefe51002550ff06122fc45c7a5d3ba812bba9ff7a25400710b5bb05691476","observation_id":"29559a36-52fa-4884-86a9-4c6356a7e59e","resolution":{"observed_at":"2026-08-12T15:15:23.863077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08248","last_updated":"2020-01-22T19:44:43Z","snapshot_observed_at":"2026-08-09T22:11:18.505621Z","submitted_at":"2020-01-22T19:44:43Z","title":"How Much Position Information Do Convolutional Neural Networks Encode?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08248","snapshot_observed_at":"2026-08-12T15:15:22.595672Z","title":"How much position information do convolutional neural networks encode? arXiv preprint arXiv:2001.08248, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.595672Z"},"links":{"cited_paper":"/paper/2001.08248","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:f3f6caa6ac4d8a52315886cb02d3ad06beb563ace3c73779eef3fa5365f25d40","observation_id":"349aa6a6-6c53-4e1f-b8f5-6caea1440096","resolution":{"observed_at":"2026-08-12T15:15:22.595672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.601161Z","title":"All tokens matter: Token labeling for training better vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.601161Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:d1be0e5430677e413e656420d2a271660ff572d30115c8fb90de987f5da410ab","observation_id":"11ea65da-416b-48b3-a128-3407c1d3b1fd","resolution":{"observed_at":"2026-08-12T15:15:22.601161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.605844Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.605844Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:fca905c2dac7b8625ce416d9b79f134382272c68ed96e84f812e3d634c07232c","observation_id":"3afcd94a-b170-45e8-ae78-976303ae3437","resolution":{"observed_at":"2026-08-12T15:15:22.605844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.822991Z","title":"Panoptic feature pyramid networks","venue":null,"work_id":"6ab6f940-9c1c-4e28-8369-f3fba659552e","year":2019},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.610377Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:30ebfc9f16646a7f70f72cb3cf3ce1cafc33e8eaae438adaf2c8c0985164c07c","observation_id":"56b2cf3a-529c-43b0-84e4-3dd26e28a4e8","resolution":{"observed_at":"2026-08-12T15:15:23.827731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.807459Z","title":"Uniformer: Unifying convolution and self-attention for visual recognition","venue":null,"work_id":"c9d7a557-5bf7-46f7-b6e1-5501ad659644","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.615020Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:4c1794aaf7ebcec32bbeaa6b34b380a9003e6fb2ba93e7336b112bd4b9f6106a","observation_id":"3f2e5312-18fa-4a6e-9acd-2b1a84ea9e56","resolution":{"observed_at":"2026-08-12T15:15:23.812703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.792260Z","title":"Clusterfomer: clustering as a universal visual learner","venue":null,"work_id":"d117e09c-883e-49ce-8a86-673f47fa29fa","year":2024},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.619573Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:d105e56df714e0564a512f014ed23225b83bfbec6b23bb26f536c83fdcb4ee08","observation_id":"8478aeed-fa30-49c4-8dc7-8bece1ab76df","resolution":{"observed_at":"2026-08-12T15:15:23.797270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.776455Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"c09c9b66-90d0-4829-80f1-ac30343d2f28","year":2014},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.624233Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:156d07becc8e6f235f2796a8fed8f04f3d918b3be834db897fc62ba52cf8fd4a","observation_id":"b677d9d5-eff8-4b45-a739-db88e90842ed","resolution":{"observed_at":"2026-08-12T15:15:23.781713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.628846Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.628846Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:1b01a2d463fd1a5bc0fc96c798ea650cd63429840a60c308ee65aa388d245fb1","observation_id":"28f92658-c9cc-4cad-9021-b179b3f898bd","resolution":{"observed_at":"2026-08-12T15:15:22.628846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.633545Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.633545Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:295d956010a53280edaa7527e4a6f6d87ccdb3189ea4b042d2373e5c651229e7","observation_id":"0814d827-6fec-46ea-bb0d-ed6ede6cc3f1","resolution":{"observed_at":"2026-08-12T15:15:22.633545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.741451Z","title":"Scale-aware modulation meet transformer","venue":null,"work_id":"27703e61-45cc-46cf-94d8-3f1b26b6c925","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.638218Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c96e93066c15fcaa526967967c1541ba13383015d8bed40b9dca61f1dfb37fb3","observation_id":"b2ed5c2b-24ed-4b35-8291-8bd5a6cc7efe","resolution":{"observed_at":"2026-08-12T15:15:23.746302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.642872Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.642872Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:89970661e183733502c4a6eb931a7c4bce8785c255222a68fc3f4a56fd8c57d6","observation_id":"d78dbcfa-7982-42f5-80ef-046cbea6162e","resolution":{"observed_at":"2026-08-12T15:15:22.642872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.648958Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.648958Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:b2d8c21b19d6646003e25ea69dc7c49ec75e27096d5c4b8f6c4b82a25f9d3d1b","observation_id":"20fd367f-32ad-450f-ae16-7586f1e1f546","resolution":{"observed_at":"2026-08-12T15:15:22.648958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.705520Z","title":"Stochastic gradient descent with warm restarts","venue":null,"work_id":"4cca6743-384a-4c8d-88c5-a0b8989941eb","year":2017},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.653860Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:6b7f512eede6c3cc60412daf27860f711808538e3307d9a9a08d96e8f68a31bd","observation_id":"08e274b4-2eb3-434d-a2a2-6cec33af6aa0","resolution":{"observed_at":"2026-08-12T15:15:23.710531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.689441Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"63f5e29d-2f68-4a3d-bdc9-422e9cd3d393","year":2019},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.658430Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:3ac5136b6df0a22acc4d2bba18588f0acd70961311778a336a403d74b0e9c892","observation_id":"67f1a967-156b-4f1d-9352-ed25ba37e34e","resolution":{"observed_at":"2026-08-12T15:15:23.694264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.663125Z","title":"Understanding the effective receptive field in deep convolutional neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.663125Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:bc89996189561ee61cb1a49fa503aaa9c5a8e56227028e0bcdef7a899b45e4ba","observation_id":"811dda20-5f93-4a53-bf67-b916f19d64f4","resolution":{"observed_at":"2026-08-12T15:15:22.663125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.663636Z","title":"On the integration of self-attention and convolution","venue":null,"work_id":"23d4654a-e0d6-47d4-89d6-7d49c9fdb8a1","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.667715Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:b36fe5e53ebc9f75b9234514108d19277cc131d688cb572b8d84aaedc0795c82","observation_id":"d26f9cf3-eedb-4ff9-94bf-bedf9a98ed08","resolution":{"observed_at":"2026-08-12T15:15:23.669184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.648264Z","title":"How do vision transformers work? In International Conference on Learning Representations","venue":null,"work_id":"d02f2ff0-2c4d-4681-9f6c-ed1ee1223c83","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.673152Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:f029730b44ab082de6ddf8a8f64ee4d9e3e95a17faee82b70b7a76ca73d9ba3b","observation_id":"86f18108-76e6-4d03-89f4-aad15f100b5e","resolution":{"observed_at":"2026-08-12T15:15:23.653251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-10T23:31:51.746878Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-12T15:15:22.677701Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.677701Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:7265119ceb85f2178db98a739905b5ed75cdc20422e543d8c1e3f37c4327a5a5","observation_id":"8c52ff4f-e782-485d-8c4a-7917b806d9f7","resolution":{"observed_at":"2026-08-12T15:15:22.677701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.632676Z","title":"Sg-former: Self-guided transformer with evolving token reallocation","venue":null,"work_id":"59101717-da85-474c-9c09-2c0aa8742f18","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.683934Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:aff94c2153e8a049a0213b2e895dbb7d9f828f839099dbd53966be774f298d47","observation_id":"7d2d9425-0051-4a0c-9647-f8003afb9af8","resolution":{"observed_at":"2026-08-12T15:15:23.637641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-12T15:15:22.688586Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.688586Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c4f50fa28963e684be8932a710cf740cf82a025d08c244c6cbbbbf8c8d7eed69","observation_id":"8f447da8-b00f-4745-a3d5-37c81f920de4","resolution":{"observed_at":"2026-08-12T15:15:22.688586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.615555Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"fecdabef-0e46-4e41-bc87-ad60beecb745","year":2016},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.693643Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c51e6d798da1a5137d2e1f098529251586182f1f680530abda6f8f8398c12baa","observation_id":"c957a076-e7b5-462b-bc6a-a893ef048b2e","resolution":{"observed_at":"2026-08-12T15:15:23.620814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.699611Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.699611Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:e64a082513d01b4b16343815d13d7f00113f2eaafe68eb385c8276ee69a41dae","observation_id":"b8d1b302-4d1a-4165-9f47-6bae7e6a7358","resolution":{"observed_at":"2026-08-12T15:15:22.699611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.590266Z","title":"Maxvit: Multi-axis vision transformer","venue":null,"work_id":"b56494e7-c62b-442e-be2a-7227d1df954d","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.704544Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:f77fccf55bc4dfde9f82c4440a4f2bdee134174d5895bc8d8e66673de0fd6ec3","observation_id":"b3f5029a-4064-4d07-bc5e-a06e52549b7c","resolution":{"observed_at":"2026-08-12T15:15:23.595037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.709136Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.709136Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:68ba3cd8eaa4396db4c843f496f427e51a73e31e82eee4039661a634ef6aa231","observation_id":"097efe03-527f-4a90-80af-8915d55197d6","resolution":{"observed_at":"2026-08-12T15:15:22.709136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.564870Z","title":"Fast transformers with clustered attention","venue":null,"work_id":"ac4fb4a1-abe5-49bd-b2a7-fbf401e78b34","year":2020},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.713791Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:20d99d7ef4d53a3dfea10a7a8d8ba386fd008501b55676c31c41e46061630b0a","observation_id":"25f076be-721c-4358-a2c3-630252303d85","resolution":{"observed_at":"2026-08-12T15:15:23.569689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-12T15:15:22.718558Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.718558Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:dd18f556823a4241ea06284a29f59d5271ca0c1d3721f6f1f867a560f9548898","observation_id":"671dc6b3-bceb-4adb-ba08-247306c7051a","resolution":{"observed_at":"2026-08-12T15:15:22.718558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.548724Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":"798fed7a-c30b-4c95-a2ae-8597b67bcd25","year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.723620Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:571dda7dfc61c4f5b6f1876dc4111493a1871a36fa816e527da2523de8a47058","observation_id":"3f160672-9376-4a07-8645-75a305ce7584","resolution":{"observed_at":"2026-08-12T15:15:23.554280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.728316Z","title":"Internimage: Exploring large-scale vision foundation models with deformable convolutions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.728316Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:7eb1a8b54ccd971496f1dde4612dcee7e9e0bb89e37165a710af2eec8353a7c7","observation_id":"46981908-6003-4abf-aba5-5d9a28dbf5c7","resolution":{"observed_at":"2026-08-12T15:15:22.728316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.521780Z","title":"Crossformer: A versatile vision transformer hinging on cross-scale attention","venue":null,"work_id":"484a383d-6b49-4797-a286-dbfc8cf6a690","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.732770Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:725c7ef63bc7345c42f9613ba0082415429c779dd9a5b1330dde1b576a33713e","observation_id":"37546beb-fec2-4028-8a5a-67d65e1bb292","resolution":{"observed_at":"2026-08-12T15:15:23.526889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.737393Z","title":"Pytorch image models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.737393Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:4c4118bc8fcb88f9cb693133757d296470f30d12b45311d4297d06370fee08ff","observation_id":"e25f9852-2ff8-4577-b39d-c1a3fd08fe2a","resolution":{"observed_at":"2026-08-12T15:15:22.737393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.742139Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.742139Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:7791b972226fe91e4d050df8553d067c6f4b2048fff56c9cc36a2a4624c713d2","observation_id":"2363af27-ee8c-462c-b387-5b23004cf27b","resolution":{"observed_at":"2026-08-12T15:15:22.742139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.484409Z","title":"Vision transformer with deformable attention","venue":null,"work_id":"f5a6d79f-0d13-4073-bc9e-25afdbd4a8c3","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.746602Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:9a63a7720034d216001cd8cb1b62b1a8474b1e8ac3ad6c00b3ed136fe5acfcec","observation_id":"72b7e3a2-3828-4fb0-8c1f-9b6fac3b54cd","resolution":{"observed_at":"2026-08-12T15:15:23.490534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.466991Z","title":"Unified perceptual parsing for scene understanding","venue":null,"work_id":"c00340ba-2b76-472b-b377-a26afc220a0f","year":2018},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.751192Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:cb441617e8edc2117e1eed810cc0a08bc4835985316f4d55568173ffcbdd9d84","observation_id":"432a43ca-7941-4232-8daa-c5a5f9d37b39","resolution":{"observed_at":"2026-08-12T15:15:23.471885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13138","last_updated":"2022-08-28T04:18:27Z","snapshot_observed_at":"2026-08-04T19:41:47.851990Z","submitted_at":"2022-08-28T04:18:27Z","title":"ClusTR: Exploring Efficient Self-attention via Clustering for Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.13138","snapshot_observed_at":"2026-08-12T15:15:22.755707Z","title":"Clustr: Exploring efficient self-attention via clustering for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.755707Z"},"links":{"cited_paper":"/paper/2208.13138","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:0f2302a559c837db855de901b595a9342b58b34b4f73b16a36afd30662ada430","observation_id":"c57ac0cd-f838-4904-b964-df1166874530","resolution":{"observed_at":"2026-08-12T15:15:22.755707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.451368Z","title":"Moat: Alternating mobile convolution and attention brings strong vision models","venue":null,"work_id":"f257958a-0325-4423-8456-5f51ba11c0cb","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.760844Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:1d8d56cd3e53a59bb34e3d5c228bedb769476768c5f919b62975001b48c7d7a0","observation_id":"6273dae9-623d-47b8-a650-862cb13558df","resolution":{"observed_at":"2026-08-12T15:15:23.456508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.434620Z","title":"Scalablevit: Rethinking the context-oriented generalization of vision transformer","venue":null,"work_id":"e7748541-93c7-4383-9205-60102c03c010","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.765408Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:c8ebad297b5c0712d5afd67b0bdc353966efcd4f0cf5129db6a7625cdafc51d6","observation_id":"127dccab-3294-49da-a40b-af70cca364a3","resolution":{"observed_at":"2026-08-12T15:15:23.440771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.418773Z","title":"Wave-vit: Unifying wavelet and transformers for visual representation learning","venue":null,"work_id":"66d48cbe-9be8-4131-9a12-ba481f7a9e69","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.769944Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:66dfec4117abae47fa4f57d9057fe723f1cc5fef900ffb0951c954b2a0552e34","observation_id":"781f0422-c2e3-43c2-9731-2aadaa43b699","resolution":{"observed_at":"2026-08-12T15:15:23.423595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.403763Z","title":"Dual vision transformer","venue":null,"work_id":"6e9882db-9e7d-4c94-a974-3efec40740df","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.774538Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:0ba5aef77c0daee9018ca4f23afe14a1cc2b5e7304eaf19fae9706cc151a163f","observation_id":"c6cc6a64-fbd2-430b-b27f-7529164bee92","resolution":{"observed_at":"2026-08-12T15:15:23.408500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T15:15:22.778999Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.778999Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:aa2e38fe673d957a8313d0088d35abd65a7a3e4c072d5ae6a2b8a1fa2e1c2124","observation_id":"3104cb3c-de13-4103-9518-77fe4e6b2634","resolution":{"observed_at":"2026-08-12T15:15:22.778999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.783904Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.783904Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:93e5808c1675b319a45f102dade970412b0bc95af9fe23b12acf1dd2158205ad","observation_id":"f37b6ea9-5c22-4d9f-9f7c-e9eb59b32ebd","resolution":{"observed_at":"2026-08-12T15:15:22.783904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.789468Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.789468Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:6350db24d6b984204d6eb34d1839ec35cc4516eec498be8c2d17f01fcd48aba2","observation_id":"96127753-1662-4284-bb34-aa11a01db413","resolution":{"observed_at":"2026-08-12T15:15:22.789468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.367598Z","title":"Not all tokens are equal: Human-centric visual analysis via token clustering transformer","venue":null,"work_id":"d239c1d6-17d5-4c13-9d39-71e7215d195e","year":2022},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.794116Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:4c5724f165333133e934748b986b8545c3e5b13c565b4541d4c7caeb2835c9e0","observation_id":"d8f1911c-4a38-40ff-b5e0-44c2b85ef318","resolution":{"observed_at":"2026-08-12T15:15:23.373093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.352645Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":"0ddf1083-cc5a-4b10-bc7b-381f361a70a1","year":2018},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.799921Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:3486736e62aa338ef31804e5bebcf132d02db7f27d2d682b5e0acaa8b913117c","observation_id":"f871d40c-118c-4d34-a125-1b3cb92efa2a","resolution":{"observed_at":"2026-08-12T15:15:23.357107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.337521Z","title":"Dense distinct query for end-to-end object detection","venue":null,"work_id":"d5c740c1-115c-4f4d-a1cf-2d3213c5d4f5","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.804553Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:7f898651266f74273f58c3371f4067c535a56e252729081f6e2d294d93095e83","observation_id":"99390d75-5c34-4505-9944-84d99160ca84","resolution":{"observed_at":"2026-08-12T15:15:23.342338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:22.809225Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.809225Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:d11e75dc42d62e71f40b9aefd7276b6592d8480645107fee5a80d0205db1e264","observation_id":"101fe6df-b352-47df-a1b5-995a62413be6","resolution":{"observed_at":"2026-08-12T15:15:22.809225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.311564Z","title":"Biformer: Vision transformer with bi-level routing attention","venue":null,"work_id":"70639413-c79a-480a-a1cf-c635af8da4b7","year":2023},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.813803Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:3e2bb8c1d1abdaf6e1809450091713407e341202a3c48ac4dc981c8176fb0298","observation_id":"177a1496-b5a7-426c-a01f-b677ad510484","resolution":{"observed_at":"2026-08-12T15:15:23.316422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.296863Z","title":"The contributions are summarized at the end of the Introduction (Sec","venue":null,"work_id":"9b3da981-4343-4992-9e24-51e186ed9822","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.818678Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:bf6791a7f767d167511710d08e826d39433aeac01ea565f61e9bfab6e836b4f7","observation_id":"47e9e79a-7146-40d9-968c-9b10fe497bb2","resolution":{"observed_at":"2026-08-12T15:15:23.301750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.281582Z","title":"Limitations","venue":null,"work_id":"8a96cd39-59ff-4b5d-9fc6-c323b9b15ba6","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.823780Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:8cfd95071ce7268a9e9f2dc9de55d2f7000295a905ca036635a54795259e22c9","observation_id":"61e3f61e-ef81-41b8-bad8-74c9db0db45c","resolution":{"observed_at":"2026-08-12T15:15:23.286061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.265799Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"e4e88fd4-cd5d-4984-942c-5338d1433e7e","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.828772Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:0d9ca57fab249c26942e4b1da6781ebc0f26e2c41931b43dde514b1fbdc4f92d","observation_id":"64ea8b7e-7c8b-4a03-ba5f-f73450c340ae","resolution":{"observed_at":"2026-08-12T15:15:23.271088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.249655Z","title":null,"venue":null,"work_id":"d2d73b1e-bd84-4ab9-a3e4-98b45002425e","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.833652Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:76cdb71e0f4768e7e28460ae2fda86cc62ae17ae368915922f6831ddf6b5459c","observation_id":"54e4fca1-90b6-4f1d-9cd1-bb07ad6ab8e5","resolution":{"observed_at":"2026-08-12T15:15:23.255235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.234448Z","title":"We will release the code upon the acceptance of this paper","venue":null,"work_id":"65c9156a-44cb-47df-8e51-6b35b8d024aa","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.838807Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:90d7c8681bc069274d46cd9c2187a91f468603e975562d0b57590c3381bee396","observation_id":"6093176e-68bb-4a1c-9bb9-65cdeda95d99","resolution":{"observed_at":"2026-08-12T15:15:23.239351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.219018Z","title":null,"venue":null,"work_id":"38d6b51c-e43f-4e80-b167-dc6f4e73df14","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.843504Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:47c310ee0c323f48701660dcccbac9858642161c3538276c8093c14195cd1de1","observation_id":"c1aad93e-ca16-4315-a9a3-41f42c0312e3","resolution":{"observed_at":"2026-08-12T15:15:23.223830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.203285Z","title":"The experimental results are not sensitive to random initialization","venue":null,"work_id":"52654e26-6f3c-45a7-872d-b0135ca97be1","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.849169Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:e5c2e4f6370b9cf27575f192341482b6e8a6f646417e4ed1138ccd6965eed3dc","observation_id":"39acc319-7392-46c0-b341-9a35519da408","resolution":{"observed_at":"2026-08-12T15:15:23.208439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.188522Z","title":null,"venue":null,"work_id":"515d7513-dc0b-49eb-8417-b07474afa8d8","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.853815Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:59edb5cb8235ae917008cf41834337b29403967f7113267ad1bcfdde9b5f0551","observation_id":"ba19d142-b8d1-42a2-b77a-88c08d78cd56","resolution":{"observed_at":"2026-08-12T15:15:23.193193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.173196Z","title":"We only use existing and publicly available datasets for evaluations","venue":null,"work_id":"65d634c3-674e-4a5e-b438-f68252902106","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.858221Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:dd57630904d0a8be5ad55a8ca91c02c9b066071ca7bf54c3aa79ef499faa29b6","observation_id":"5b5c2858-117e-415c-ba42-37ba7f8a4875","resolution":{"observed_at":"2026-08-12T15:15:23.177914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.156583Z","title":"It is too broad to discuss the societal impacts of such a general topic","venue":null,"work_id":"4e3743a8-6f00-47e6-a4d9-f90ffd0443e3","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.863391Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:9d5e6538368d085ad2d35864bb0ad84e47a06cf63b5ef09dfb63f20f8639fbc0","observation_id":"5174d3b6-a2ba-4438-bae1-c4cd00b5589f","resolution":{"observed_at":"2026-08-12T15:15:23.162268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.140058Z","title":"It poses no such risks","venue":null,"work_id":"0caa5534-ccf8-4f02-be79-2a5bf973d90d","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.868619Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:f09e976abd8aceb33049e981c26527e12e7757928a33e7a8be8d434eb54036c9","observation_id":"accd94e5-e3eb-474d-9757-15c9fb2dfc09","resolution":{"observed_at":"2026-08-12T15:15:23.145084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.124990Z","title":"These works are properly cited","venue":null,"work_id":"af468096-6b49-4075-aaed-d5004e44667a","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.873273Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:bde866337027069889463e099de2448a0d187fe156d26ffec0495ae79fae82e0","observation_id":"5df8bdaf-1c5c-416d-98ae-f241e660f4b4","resolution":{"observed_at":"2026-08-12T15:15:23.129743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.109143Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"5ddb87b2-d662-4c75-bf88-196edfaf6a26","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.878078Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:a43500058f10f1d10c93aa67a7ba21d50df95744bca9595b2f08af978ee52191","observation_id":"fc9cc2ca-ae0b-41e7-bfe3-79412e961492","resolution":{"observed_at":"2026-08-12T15:15:23.114445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.093507Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"8e3d49a1-8c1a-4391-8afc-dafe98bc1461","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.883149Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:035cb19ce3b8891c97ddfddfa39330c83b10fc2177d3fb1d74fea9ad89209197","observation_id":"af19c8cc-0c12-4688-bcdc-09c8d8769274","resolution":{"observed_at":"2026-08-12T15:15:23.098801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:15:23.075617Z","title":"Guidelines: 23 • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"244eb50b-5700-4964-9ea2-603b01142606","year":null},"citing_paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T15:15:22.887919Z"},"links":{"citing_paper":"/paper/2411.14429"},"observation_digest":"sha256:3694c359c8d8df1a09f24ccbeb05d7f66186c84d2de8c93edae874d940d707c8","observation_id":"55fae290-e9b2-42a3-a17b-34eb33397eda","resolution":{"observed_at":"2026-08-12T15:15:23.082865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14429","last_updated":"2024-11-21T18:59:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:09:04.988010Z","submitted_at":"2024-11-21T18:59:08Z","title":"Revisiting the Integration of Convolution and Attention for Vision Backbone"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2411.14429."}