{"as_of":"2026-08-13T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:343e72f8d70c3fccc37c098bc4337bdddfa44f27fa996ae6aaa68ddc7422eaf9","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:43:31.987951Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18995/citation-record","integrity":"/paper/2411.18995/integrity","json":"/paper/2411.18995/citation-record.json","paper":"/paper/2411.18995"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T10:43:30.467766Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.467766Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:522c83afc718c880b675c8931edc2515392548d2e0e27a7e9c6efd1a3b3b081c","observation_id":"c7de7d48-ba92-4b66-8577-9f33223c599b","resolution":{"observed_at":"2026-08-12T10:43:30.467766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-12T10:43:30.508733Z","title":"Mmdetection: Open mmlab detection tool- box and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.508733Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:377fbabc23bd1f858649d149a593171b5ba168ad6ccd55ecaaf6bc55fd2341b1","observation_id":"7475193f-5158-467a-ace5-713f4e0b2708","resolution":{"observed_at":"2026-08-12T10:43:30.508733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10224","last_updated":"2022-03-18T08:45:29Z","snapshot_observed_at":"2026-08-08T08:30:35.914721Z","submitted_at":"2021-07-21T17:23:06Z","title":"CycleMLP: A MLP-like Architecture for Dense Prediction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10224","snapshot_observed_at":"2026-08-12T10:43:30.546956Z","title":"Cyclemlp: A mlp-like architecture for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.546956Z"},"links":{"cited_paper":"/paper/2107.10224","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:131e4197a14d41b939a6093eb8ee6d831f6c30994f94a25a27e2cce63a6ea9c3","observation_id":"10321d41-0599-4d38-80f6-c09ac586fcb8","resolution":{"observed_at":"2026-08-12T10:43:30.546956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:35.003500Z","title":"Twins: Revisiting the design of spatial attention in vision transformers, 2021","venue":null,"work_id":"349d6c2c-08a6-43d4-8f3a-f4b11d4c453f","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.552877Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:51e405c373f7954be919bfac5badec9ea241c6e732d73e83c70f3335cf23b291","observation_id":"39a28443-e4a1-4509-9530-e1271565b2c6","resolution":{"observed_at":"2026-08-12T10:43:35.070608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:30.627245Z","title":"Mmsegmentation: Open- mmlab semantic segmentation toolbox and benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.627245Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:063f39c20115fd3411f645d7af29a94d6122392e219af6a90ec7ebe117396c36","observation_id":"38fee022-f3ce-46fc-9af3-cb39d6b99425","resolution":{"observed_at":"2026-08-12T10:43:30.627245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.869452Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":"cdc4389a-04a9-4479-a555-121311c71485","year":2020},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.688855Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:64ba468b33bb08edccdd401df82aa50c439e8309a1cfd43aa7122ba2c7592827","observation_id":"d348127d-e7fc-4b8a-84af-5b9fa2414222","resolution":{"observed_at":"2026-08-12T10:43:34.917980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.854366Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":null,"work_id":"5a275453-4dfb-43ff-847c-10b1b62ece06","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.738670Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:13f59fddfd3e35396b7034787aa6a894d735cab9a7c1dcdb4b983b10f742a10c","observation_id":"aaa21eac-edf0-464d-87df-3800442065ce","resolution":{"observed_at":"2026-08-12T10:43:34.859205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.798278Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"cc9c291b-0ca8-4720-a190-50f3939ac2b7","year":2009},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.744332Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:2c7fdde91487d695cc0e387cf560cfe0fad70944ed13e1e49e7c5f30c0afdf8e","observation_id":"2c4525cc-c989-4802-9513-0e2f03475a57","resolution":{"observed_at":"2026-08-12T10:43:34.832140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T10:43:30.796276Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.796276Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:d5343df092d22ccb169dd0db93637a27b82d267bd6c8dc374222b8e2b8737bf2","observation_id":"9841c4be-b33b-4317-beb2-93eade38f88f","resolution":{"observed_at":"2026-08-12T10:43:30.796276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-08-10T18:08:12.282553Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-12T10:43:30.849424Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.849424Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:f122bf766796c1e78c18311166d68c50ba6929a0c2096e7fa749577f79b70906","observation_id":"f0d87a41-ce01-46e2-bcab-4827e813cb0d","resolution":{"observed_at":"2026-08-12T10:43:30.849424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.627189Z","title":"Segnext: Rethinking convolutional attention design for semantic segmentation,","venue":null,"work_id":"6dea8a9a-5e70-4a27-86b5-8c750eeedde9","year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.872013Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:40cc160b72a497b630dcfb783a1ac2cdbbb8838f0a50d38bbc4d5e58097252c0","observation_id":"bd35d36f-b548-49eb-af81-00f068998dad","resolution":{"observed_at":"2026-08-12T10:43:34.726346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09741","last_updated":"2022-07-11T04:21:37Z","snapshot_observed_at":"2026-08-11T14:46:55.089040Z","submitted_at":"2022-02-20T06:35:18Z","title":"Visual Attention Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09741","snapshot_observed_at":"2026-08-12T10:43:30.877886Z","title":"Visual attention network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.877886Z"},"links":{"cited_paper":"/paper/2202.09741","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:5da89645dabd02c570950d50db7bbc1728afa3c89ed17e831ff887d0b0e7ed16","observation_id":"e9170c0f-c16c-4480-8fb4-a70225783446","resolution":{"observed_at":"2026-08-12T10:43:30.877886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.612403Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"850dad4d-9fcb-4769-8661-e01d18a34641","year":2016},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.900984Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:fe90091e799eb923f479c11a99d0ab200338542bdbaef3fdeb35afbde8882304","observation_id":"b4b86f3a-ccc3-42c6-9343-2aaeb8f003ab","resolution":{"observed_at":"2026-08-12T10:43:34.617654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.567017Z","title":"Mask r-cnn, 2018","venue":null,"work_id":"d913f44d-39eb-4765-b611-0345b1be4571","year":2018},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.967885Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:509225af246c2f18cdbd72ea864a139d0a808c6b8ce1f10634e5198d6a210977","observation_id":"1b8d0802-2d77-4adb-93bf-6fad9df567e1","resolution":{"observed_at":"2026-08-12T10:43:34.602047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.506817Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"830a2ae5-9387-48f4-b02b-4049cc24c655","year":2016},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:30.997621Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:eff2b9e80ae15bf24889414f291f1594e8ddb89e749c6e2b95e0f2a4d7d614d9","observation_id":"9a869c6b-0f24-41a6-b7d7-23d3e7b6be31","resolution":{"observed_at":"2026-08-12T10:43:34.556396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.365372Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization, 2017","venue":null,"work_id":"1992bc08-3fa2-471b-92fd-00806583238f","year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.038529Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:98488de94678910c4a7b74a8417a78582f13056da8dce999e9696eba8f1bb13b","observation_id":"bed20438-0074-4926-b6e5-a5a779e30582","resolution":{"observed_at":"2026-08-12T10:43:34.424854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.351204Z","title":"Batch renormalization: Towards reducing minibatch dependence in batch-normalized models, 2017","venue":null,"work_id":"10e3dbb9-9a4c-4d49-92f9-bbcbce60ad5d","year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.051916Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:a200f6f03af07024d75271556c5bab2809f54e17bbcb0f16f62228d727df9064","observation_id":"29986528-00a0-4f41-93d0-31d13389fea1","resolution":{"observed_at":"2026-08-12T10:43:34.356058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-12T10:43:31.056554Z","title":"Batch normalization: Accelerating deep network training by reducing internal co- variate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.056554Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:5a88019f0c71fdc798f43e41e9e8470c9f3e42234cc97eae9a1604c76470c064","observation_id":"e595f8bc-5db7-46cf-a31e-7b9e1280c0fe","resolution":{"observed_at":"2026-08-12T10:43:31.056554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.336141Z","title":"Relational self-attention: What’s missing in attention for video understanding","venue":null,"work_id":"dcb5f0be-0ac4-41f8-95fb-d4058f16e5cd","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.061886Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:47b1560ed366290b05c652ddbb3c2d4d6bbadb40afcd80739b5e285525afb6a2","observation_id":"1fa7156f-bf36-4b4d-8030-57372fbb9e40","resolution":{"observed_at":"2026-08-12T10:43:34.341086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T10:43:31.086558Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.086558Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:b7b2c8a7c947f83ec10f281ae1375e26d464d69057d8b30853d7f3304d928d39","observation_id":"f2835c07-1940-4809-b32c-329e8f100596","resolution":{"observed_at":"2026-08-12T10:43:31.086558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.231862Z","title":"Panoptic feature pyramid networks","venue":null,"work_id":"08fc3c43-693e-4634-ab2a-457b8c71c90f","year":2019},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.148497Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:1f1045d5d46ceff525b2ed9d44f82f65c166c3445248209f463d3b9026ea7fc5","observation_id":"5722a313-f18f-455e-935c-0cd05c2e3472","resolution":{"observed_at":"2026-08-12T10:43:34.308883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.099723Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"c72b33b6-8d48-4aa7-9ec2-34c4cd18e5a5","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.193362Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:a69abb7c646b2d8f7bfbd73488b62c2676ba0d720b1b61e9a5d82a65106f3952","observation_id":"a9de85a0-e180-435f-98e7-8c8daa20cef3","resolution":{"observed_at":"2026-08-12T10:43:34.154322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08391","last_updated":"2022-03-17T06:59:03Z","snapshot_observed_at":"2026-07-06T11:30:03.281639Z","submitted_at":"2021-07-18T08:56:34Z","title":"AS-MLP: An Axial Shifted MLP Architecture for Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08391","snapshot_observed_at":"2026-08-12T10:43:31.249528Z","title":"As- mlp: An axial shifted mlp architecture for vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.249528Z"},"links":{"cited_paper":"/paper/2107.08391","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:e1f7a9abd4db80c1f6573c14e999b7de5b2aeceacc0644d2ae37ffe59978f823","observation_id":"d7166ac2-e40f-425b-b744-885ac63c940e","resolution":{"observed_at":"2026-08-12T10:43:31.249528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.273700Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.273700Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:9e7a6667f59a5f8cde0ff9ab69b1dee400cd4132ba57ddfe269ff3d855f34446","observation_id":"3ca758f5-1059-4aae-9d56-02f41a15dc4a","resolution":{"observed_at":"2026-08-12T10:43:31.273700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.075451Z","title":"Focal loss for dense object detection, 2018","venue":null,"work_id":"db5cbc20-fadb-4c74-a799-d88d3bbe531f","year":2018},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.278519Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:27e423d0ca8d0d58aef422255b1c40039a0d496cd8fc0f445db40b7ba2dcdfc9","observation_id":"331bfe55-e673-4641-87c1-7b13291d4340","resolution":{"observed_at":"2026-08-12T10:43:34.080426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:34.010225Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"4396263d-fcea-4609-ba02-5194a383218b","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.283982Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:5d1faa2af860b78e06075bd330cfdadeed2323c9d1c5e41b567090b789fcd691","observation_id":"50af3cc3-dbaa-4b87-ae15-d1ae37dfcb64","resolution":{"observed_at":"2026-08-12T10:43:34.057496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.288580Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.288580Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:478bf0e0d23dafa2168d5ebdb4a05575a79e643b4733af537a0cf87767aa8112","observation_id":"5732a23a-d106-486c-afc5-4c97c07cb58a","resolution":{"observed_at":"2026-08-12T10:43:31.288580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T10:43:31.345474Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.345474Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:2d621d3bf551975aea5c8cf20d3ba17c1d1e4dc06018266eb7eda1cdf6fc47b1","observation_id":"11d4a1a3-db15-4655-913e-64721d343196","resolution":{"observed_at":"2026-08-12T10:43:31.345474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.847147Z","title":"How do vision transformers work?, 2022","venue":null,"work_id":"3a7892a1-8868-4535-9b82-09c4fd973df9","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.408851Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:c62c0ce1de1015f55961f64efff996a1855e16790c2da196ee0cdd2fab71faf9","observation_id":"3637f4e0-8dfe-4153-86c9-994b75885459","resolution":{"observed_at":"2026-08-12T10:43:33.920037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.436305Z","title":"Semantic image synthesis with spatially-adaptive nor- malization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.436305Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:feb56adc698ff68114121c4737ed92c1e03df4a702d72ded08cd5898c263e692","observation_id":"66a09598-7ecb-4a39-b708-bd37f83e4407","resolution":{"observed_at":"2026-08-12T10:43:31.436305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.823618Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":"49f8a65c-8001-40e8-b8e1-4f4607d73618","year":2019},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.484874Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:125a6afd2daea03599078d252ded61c60ccf6b55d7fe4d93e80bad875d2723ed","observation_id":"1d79b78b-fc4a-46b3-94eb-64f62fc40bc7","resolution":{"observed_at":"2026-08-12T10:43:33.828294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.809677Z","title":"Acceleration of stochastic approximation by averaging","venue":null,"work_id":"5f3ba8fc-feea-4e4e-8ec8-4f4d2c89dd9f","year":1992},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.489768Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:c4c595ec900ea7e209178852131f10842e2d4ced59f3b5429b886aa0cafb2509","observation_id":"f007f04f-8fa1-4923-a4a2-595b4b2d6a9c","resolution":{"observed_at":"2026-08-12T10:43:33.813907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.765371Z","title":"What makes for good tokenizers in vision transformer? IEEE Transactions on Pattern Analysis and Machine Intelligence,","venue":null,"work_id":"7d75b24a-a9a0-4541-a9fc-c6b683bff677","year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.494333Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:b7afc4d0724b7aed2e3bd6ef39e579aca71e6f0b17685ecf93e0669374c80d06","observation_id":"7ec5e319-f1ad-4b0e-8730-94dc35119152","resolution":{"observed_at":"2026-08-12T10:43:33.799813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.499973Z","title":"Do vision trans- formers see like convolutional neural networks? Advances in Neural Information Processing Systems, 34:12116–12128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.499973Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:141930a701c3b1fc78d046f0c25e28e53c47c5943090ee6e1ccd45610729f5ae","observation_id":"85eb279b-be1e-4cd5-971b-1d3f423a896c","resolution":{"observed_at":"2026-08-12T10:43:31.499973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.570470Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks, 2019","venue":null,"work_id":"b1726ad6-fee1-4c4f-95a4-058e18a333f2","year":2019},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.504794Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:6c5bf32563c3de476ade1ed2a41db35129153ab53a2ce89253d3a7369bc643a3","observation_id":"a066e8f0-2382-4d92-9860-4fdfb750d206","resolution":{"observed_at":"2026-08-12T10:43:33.651012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.556178Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"1618efd7-b8c0-4ce7-bdbc-cef25ca7d7f4","year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.509672Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:201d1d7719afa6dfaf454b3da5290682a8d0269fa0cadc55cfb92287197acb6c","observation_id":"43ce6aa9-f109-4aee-8aa8-3c833791980f","resolution":{"observed_at":"2026-08-12T10:43:33.561151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.541997Z","title":"Powernorm: Rethinking batch normaliza- tion in transformers","venue":null,"work_id":"53281891-d269-4959-99c0-5b2f0b1a8eca","year":2020},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.514224Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:b3dc6047ac8676059ddacbf08fd204f33bd0d72b176ab08c6a2207a8dea51d04","observation_id":"00b7bd86-6602-4cb8-b4ae-862074991779","resolution":{"observed_at":"2026-08-12T10:43:33.546723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09456","last_updated":"2021-11-01T15:34:23Z","snapshot_observed_at":"2026-08-13T03:29:36.228075Z","submitted_at":"2021-10-18T16:47:45Z","title":"NormFormer: Improved Transformer Pretraining with Extra Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09456","snapshot_observed_at":"2026-08-12T10:43:31.585543Z","title":"Normformer: Improved transformer pretraining with extra normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.585543Z"},"links":{"cited_paper":"/paper/2110.09456","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:f4e878204691a9d5da339f78795624ac11f26cec8eb62b744934c43eef0bef3a","observation_id":"5b13d27e-365c-4453-a5ce-616fe2a4970d","resolution":{"observed_at":"2026-08-12T10:43:31.585543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.526930Z","title":"Evalnorm: Esti- mating batch normalization statistics for evaluation, 2019","venue":null,"work_id":"9836acf3-b9ec-4c4f-a7d6-004372291ac0","year":2019},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.661340Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:9f11b3946a46365492a235356a378d972a95331666361410a25c9fce4458d0ca","observation_id":"b5ae794c-f344-4b07-9303-94610bc313a6","resolution":{"observed_at":"2026-08-12T10:43:33.532254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.689239Z","title":"Rethinking the inception archi- tecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.689239Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:84cfbc496fd1abccd2a123988434c505211ae7e7c18ff645473463fdff55e0dd","observation_id":"2dd01271-4d17-4d0b-a9c3-50a8174ddd71","resolution":{"observed_at":"2026-08-12T10:43:31.689239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.693505Z","title":"Mlp-mixer: An all-mlp architecture for vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.693505Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:66545bb9b2031984f1bdd81a75ceb1fe4dbef1a667a3fe606b2a9ffa88bb66d3","observation_id":"af4e1c54-1194-4a2e-a0ac-16d053fd602c","resolution":{"observed_at":"2026-08-12T10:43:31.693505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.447249Z","title":"Resmlp: Feedforward networks for image clas- sification with data-efficient training, 2021","venue":null,"work_id":"e08d244f-d2e5-4a9a-9325-73643d6cb971","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.698267Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:db515dd5cf5e94ea6a3e165cdb69f364df47d4a7b1e150375093c66ead2d3f38","observation_id":"64fd3689-1a74-44e6-9569-c61fbf8cb174","resolution":{"observed_at":"2026-08-12T10:43:33.465429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.290253Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"0d625ff9-d354-4a19-9cd4-14875c9d6a73","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.702916Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:e0c55e43302ff2e18979924de84df56abdaa375f1bff2c76ff054b68fbea165e","observation_id":"a2ea657f-b050-44e1-909f-ceca805a7b5d","resolution":{"observed_at":"2026-08-12T10:43:33.349483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.243020Z","title":"Maxvit: Multi-axis vision transformer, 2022","venue":null,"work_id":"69c9e069-1f5b-4b9f-a71d-03cfabb367fc","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.707587Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:c00331f4b6eaeca7abb15191d5b86c4ff3e2bfd02f32d6a22550307f98dd2b95","observation_id":"e3b1bac5-b829-415c-8c37-3cb2e6eb3a82","resolution":{"observed_at":"2026-08-12T10:43:33.247621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.228951Z","title":"In- stance normalization: The missing ingredient for fast styliza- tion, 2017","venue":null,"work_id":"45d1a508-46da-4760-923b-85f6d41e92ff","year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.712066Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:40af23d8d42a10d8050b82a716576cd671f130f7a3c689549e89349281961760","observation_id":"a68175a4-aef5-436b-a78d-6f4fad36d37e","resolution":{"observed_at":"2026-08-12T10:43:33.233330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.214299Z","title":"Attention is all you need","venue":null,"work_id":"b69db8e5-0b75-4ee6-8573-acb3b74024fe","year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.716541Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:8304311136e0eccede0656bbbd042cf657650016a70e23dc062831afe6180c28","observation_id":"010ca6d3-2c3b-44b4-ae3d-80234adaec9c","resolution":{"observed_at":"2026-08-12T10:43:33.218969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10801","last_updated":"2022-01-26T08:17:06Z","snapshot_observed_at":"2026-08-12T08:16:03.683273Z","submitted_at":"2022-01-26T08:17:06Z","title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10801","snapshot_observed_at":"2026-08-12T10:43:31.721130Z","title":"When shift operation meets vision transformer: An extremely simple alternative to attention mechanism","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.721130Z"},"links":{"cited_paper":"/paper/2201.10801","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:32b54cb270b98e6a39944f600834ece141faff57a4308f3b708d6b0b635388ed","observation_id":"7ccb88f5-0263-4385-bd4d-493a491ee74b","resolution":{"observed_at":"2026-08-12T10:43:31.721130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.159424Z","title":"Ri- former: Keep your vision backbone effective but removing token mixer","venue":null,"work_id":"c344bc11-c1cd-4e72-82ca-2e9022102e5a","year":2023},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.725421Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:ec2e55624cad2ce2fca778e5d5b87fef95b0c88c429d7530aa9d5fa727177ec3","observation_id":"9d642eae-4c45-4e06-ae32-ec959ce8413e","resolution":{"observed_at":"2026-08-12T10:43:33.188014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.022166Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":"eb3e768e-9566-47c5-b9ad-eaa27a981640","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.729739Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:c040cb181285af2cbd9cab8242058ba324df1131466411abe43269de31e076ae","observation_id":"934a293f-64b3-41c7-9779-35f66fab10b0","resolution":{"observed_at":"2026-08-12T10:43:33.066818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:33.009057Z","title":"PVT v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"bef2b14a-94cd-4981-9ab3-34b395dd8008","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.734132Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:94382920fad69fd60945b6185803ab88ef47132c397780e46e59bf71dc5de3fe","observation_id":"58281994-c54f-402d-868d-32042a40b407","resolution":{"observed_at":"2026-08-12T10:43:33.013124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06108","last_updated":"2022-12-23T07:31:26Z","snapshot_observed_at":"2026-08-06T15:00:02.950461Z","submitted_at":"2022-03-11T17:29:54Z","title":"Active Token Mixer","version":2},"cited_work":{"arxiv_id":"2203.06108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06108","snapshot_observed_at":"2026-08-12T10:43:32.057162Z","title":"Active Token Mixer","venue":"cs.CV","work_id":"d9bd65b3-0cd3-41df-a5cd-243ba68c1062","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.748085Z"},"links":{"cited_paper":"/paper/2203.06108","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:16ec8fb39cf950cc575c16fd15258730e36e90a0c1741801d0b3f17508e27372","observation_id":"71d710a3-29b9-41b8-8a47-834aab5ee576","resolution":{"observed_at":"2026-08-12T10:43:32.104035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.994062Z","title":"Con- vnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"b3c1a719-6fa7-4b28-ae58-d6b45b71a8d6","year":2023},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.777059Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:af86a8b61129683c31af586be6ca03b079a540fd165ea276aa7fb85ef2a40907","observation_id":"aab8e676-b42c-4244-a709-ec76e82795de","resolution":{"observed_at":"2026-08-12T10:43:32.998901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.972593Z","title":"Towards stabilizing batch statistics in backward propagation of batch normalization, 2020","venue":null,"work_id":"11635a18-4c1c-412b-ad10-f64bf1a0e282","year":2020},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.835347Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:1144684ec2c411acccd0bffccebc70d86a0dc84196df0f74aae586ed00e7e9ab","observation_id":"b7f03e5f-06f8-4ac8-a329-0c203d9ea072","resolution":{"observed_at":"2026-08-12T10:43:32.983278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00641","last_updated":"2021-07-01T17:56:09Z","snapshot_observed_at":"2026-08-11T00:43:43.060128Z","submitted_at":"2021-07-01T17:56:09Z","title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00641","snapshot_observed_at":"2026-08-12T10:43:31.912949Z","title":"Focal self-attention for local-global interactions in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.912949Z"},"links":{"cited_paper":"/paper/2107.00641","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:d76e478e3d0c9ba145d063d3d90121c8378652b4f8cbf93dfa9477993c0fa108","observation_id":"fcb1aa8c-c73d-4f60-a7e9-adfe1931fdef","resolution":{"observed_at":"2026-08-12T10:43:31.912949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.888624Z","title":"Focal modulation networks, 2022","venue":null,"work_id":"5bb4453a-760c-4573-b0e6-be37e18f54dd","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.940912Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:b9d8ff03dcb9216834beed674416c7a5fc729b079406522370123ac52f0e7e22","observation_id":"60e22678-5467-4c24-bf79-d83fd66aa814","resolution":{"observed_at":"2026-08-12T10:43:32.915670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.788661Z","title":"Leveraging batch normalization for vision transformers","venue":null,"work_id":"ed3bd0c1-b11c-4f76-954f-3841a8683e5d","year":2021},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.952058Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:b330709bcf8e5989539d2af524dfaa1c2eb5b2e419a6863e8aff9fe513377ddc","observation_id":"2b092c62-72a5-4398-a493-7d7e1cf01390","resolution":{"observed_at":"2026-08-12T10:43:32.836864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.628765Z","title":"S2-mlp: Spatial-shift mlp architecture for vision","venue":null,"work_id":"01a07af3-26c8-49e6-8fb4-de63e607e662","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.956833Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:f1e3f6fd2d668e9029de4d078ec799da378602c2a9b84830aa07810354a7c7cd","observation_id":"482c18dc-8972-4260-b143-2d85abeea79a","resolution":{"observed_at":"2026-08-12T10:43:32.687788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.613068Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":"e75b1408-3eb6-426d-b21d-d3d1c9667288","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.961673Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:6d13d9583714b601634b45f7e11ca62a39c881c151f5bd0295acedbc04a28ea6","observation_id":"3d9b8806-7a7e-4cbd-bc12-361009d8e795","resolution":{"observed_at":"2026-08-12T10:43:32.618259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.587203Z","title":"Metaformer baselines for vision, 2022","venue":null,"work_id":"b1e5152d-fc63-4c05-845a-331cd5c5ff98","year":2022},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.965697Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:c821a1ccfdcfe86bdcbf35fc7d22953cc400390a7a65dbf67220843b7d07e6bf","observation_id":"377dfb90-3f52-4454-99f2-561b28605c99","resolution":{"observed_at":"2026-08-12T10:43:32.601707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.506123Z","title":"Inceptionnext: When inception meets convnext, 2023","venue":null,"work_id":"0396a461-05f7-46c4-b942-2c1b3a9940c9","year":2023},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.970308Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:40916fd5bf222468ffe7e58adc5f9e05fb6dd4ff22a458c28b4df6e906431261","observation_id":"686a3d8f-9eaf-4655-bd66-a73e7f99c996","resolution":{"observed_at":"2026-08-12T10:43:32.545384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:31.974627Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.974627Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:d9d8d98cfaf34db05bb8a2e216d9d8607524c35df0df45a001ce838f316dd2c1","observation_id":"fb307237-2f1d-4ee6-822f-a8b74b031bf0","resolution":{"observed_at":"2026-08-12T10:43:31.974627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-12T10:43:31.979103Z","title":"mixup: Beyond empirical risk minimiza- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.979103Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:a2ae8809c286605cc920e338a39ffdf5d090171a85d58cc7d761b7f50e64c4d8","observation_id":"0dd0aee0-f4f8-4da9-bff4-12b173bcb47f","resolution":{"observed_at":"2026-08-12T10:43:31.979103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.356717Z","title":"Random erasing data augmentation","venue":null,"work_id":"6cfde23c-af4c-401e-bfc6-ccf85e70d51b","year":2020},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.983603Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:4e895f627e035d52097ff8b4525452fe9b057e25dac514c8c0aa0f900ae01506","observation_id":"0c849c23-b374-4e99-a96e-0a26c994c2d6","resolution":{"observed_at":"2026-08-12T10:43:32.420065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:43:32.340457Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"0b7e9d5f-dd1c-4264-aa0e-3598507b0c01","year":2019},"citing_paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:43:31.987951Z"},"links":{"citing_paper":"/paper/2411.18995"},"observation_digest":"sha256:6a812fc46aa3598cac18fdf222d94ea46e75ffdec4401ac64a116847c699c9ef","observation_id":"efa4ee6a-aa2f-4b95-886f-71b7b68a6f3a","resolution":{"observed_at":"2026-08-12T10:43:32.346275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18995","last_updated":"2024-11-28T08:49:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T21:51:32.984125Z","submitted_at":"2024-11-28T08:49:11Z","title":"MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2411.18995."}