{"as_of":"2026-08-12T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f820cb96e1ff559ea3540554eb6e046a845bf3f61ab2b45d83326fda0d13111","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:34:02.333517Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18778/citation-record","integrity":"/paper/2412.18778/integrity","json":"/paper/2412.18778/citation-record.json","paper":"/paper/2412.18778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.617754Z","title":null,"venue":null,"work_id":"7ada833a-055d-42bc-bd53-35d4ca803e1c","year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.075673Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:31358867258ccb296b90fc1ee29cad60ae186d66a0049f5f257c5760257bf1f3","observation_id":"dfca2a14-6f44-4723-92be-7475724edc22","resolution":{"observed_at":"2026-08-11T04:34:03.622632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.080829Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.080829Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:f78cbdf1e2883ee2c8bfc3ccfeeef298faafe02ce7953c08115dc27f66dc2467","observation_id":"d5f60d4d-aebd-49e7-a3c1-2f604f23040e","resolution":{"observed_at":"2026-08-11T04:34:02.080829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12872","last_updated":"2020-05-28T17:37:23Z","snapshot_observed_at":"2026-08-10T14:01:30.291640Z","submitted_at":"2020-05-26T17:06:38Z","title":"End-to-End Object Detection with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12872","snapshot_observed_at":"2026-08-11T04:34:02.085201Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.085201Z"},"links":{"cited_paper":"/paper/2005.12872","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:39abf180c1072a804a48a4e2f84976af1a591eb31d73484f35978169b847d1f0","observation_id":"3979f508-145e-4e9d-bb31-df8be4b80109","resolution":{"observed_at":"2026-08-11T04:34:02.085201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04579","last_updated":"2024-08-10T11:20:52Z","snapshot_observed_at":"2026-07-06T18:58:30.942582Z","submitted_at":"2024-08-08T16:40:15Z","title":"SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04579","snapshot_observed_at":"2026-08-11T04:34:02.090460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.090460Z"},"links":{"cited_paper":"/paper/2408.04579","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1317eee573c1e8d9870ad91bc736d2e536806e4139304784e54b6bf2acc0ac6f","observation_id":"0a088262-0ecd-4887-b30e-553124069d4f","resolution":{"observed_at":"2026-08-11T04:34:02.090460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09148","last_updated":"2023-05-02T17:06:51Z","snapshot_observed_at":"2026-08-10T16:50:27.948227Z","submitted_at":"2023-04-18T17:38:54Z","title":"SAM Fails to Segment Anything? -- SAM-Adapter: Adapting SAM in Underperformed Scenes: Camouflage, Shadow, Medical Image Segmentation, and More","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09148","snapshot_observed_at":"2026-08-11T04:34:02.095509Z","title":"Li, Lingyun Sun, Papa Mao, and Ying-Dong Zang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.095509Z"},"links":{"cited_paper":"/paper/2304.09148","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:6e8711f52dd70e5870a7663b97e6714402d2207317168b245bdd7a986894e8e8","observation_id":"48f98527-4342-4056-9503-cfcd32e7f617","resolution":{"observed_at":"2026-08-11T04:34:02.095509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.100667Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.100667Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:44e5aa3b3ba868f20b99d96b9a3fc70fd9857007bcd408bbe46877b1304e4936","observation_id":"d920fe8d-ec60-44e5-a3db-d792211ba781","resolution":{"observed_at":"2026-08-11T04:34:02.100667Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T04:34:02.105878Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.105878Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:e2ab47da2d81e6e0b51aba9a461240afa5b407a1e58c7803cc7c30c60c070708","observation_id":"068a3ac1-b34c-4d50-8f9f-8bc81fd6bf04","resolution":{"observed_at":"2026-08-11T04:34:02.105878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10274","last_updated":"2021-06-10T05:36:12Z","snapshot_observed_at":"2026-08-12T13:01:43.399928Z","submitted_at":"2021-02-20T06:49:53Z","title":"Concealed Object Detection","version":2},"cited_work":{"arxiv_id":"2102.10274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.10274","snapshot_observed_at":"2026-08-11T04:34:03.269936Z","title":"Concealed Object Detection","venue":"cs.CV","work_id":"ff21db25-b1d2-409c-a3a4-5b1c4e855904","year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.110714Z"},"links":{"cited_paper":"/paper/2102.10274","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:cff89f9af0344f3d7e6361913e52cfefb3834e1e4afebdabedca1ab278ac65e8","observation_id":"68fb8423-98e0-41b3-813a-0818bcd50c8d","resolution":{"observed_at":"2026-08-11T04:34:03.274848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.115665Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.115665Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:739bf6a7ed9adf87746e6b3bd6c5e6f9ce6f8f02080bc91a888cbb3a626d382d","observation_id":"1a0bf6ae-f741-46b5-8b39-7b5e7eeff726","resolution":{"observed_at":"2026-08-11T04:34:02.115665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.08083","last_updated":"2015-09-27T15:10:14Z","snapshot_observed_at":"2026-08-10T10:04:53.772315Z","submitted_at":"2015-04-30T05:13:08Z","title":"Fast R-CNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.08083","snapshot_observed_at":"2026-08-11T04:34:02.120229Z","title":"Girshick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.120229Z"},"links":{"cited_paper":"/paper/1504.08083","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:098d0a8d33b68e65438c5efa8e53de19311d3949a8daa67dac2935b61472a572","observation_id":"73b23bca-a75f-4879-b3ec-1d13cfe03512","resolution":{"observed_at":"2026-08-11T04:34:02.120229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1311.2524","last_updated":"2014-10-22T17:23:20Z","snapshot_observed_at":"2026-07-06T03:27:53.279398Z","submitted_at":"2013-11-11T18:43:49Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1311.2524","snapshot_observed_at":"2026-08-11T04:34:02.124878Z","title":"Girshick, Jeﬀ Donahue, Trevor Darrell, and Jite ndra Malik","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.124878Z"},"links":{"cited_paper":"/paper/1311.2524","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:98c06f0e0d47f75e59652d35e52ae5b44eeb720d9dfc45b12b221090bb8c6054","observation_id":"f47e55f7-bccf-4bcf-9040-b5bcb3d395d2","resolution":{"observed_at":"2026-08-11T04:34:02.124878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.129567Z","title":"Goldberger, Luis A","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.129567Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:631e762d8a983d109d4edcc2ac508b154abb34d0ae0343cb5d185c9ae9a1551a","observation_id":"105fa00f-3743-44de-af76-3b0dce7e19c5","resolution":{"observed_at":"2026-08-11T04:34:02.129567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06263","last_updated":"2022-06-14T14:05:23Z","snapshot_observed_at":"2026-08-06T19:36:02.215177Z","submitted_at":"2021-07-13T17:47:19Z","title":"CMT: Convolutional Neural Networks Meet Vision Transformers","version":3},"cited_work":{"arxiv_id":"2107.06263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06263","snapshot_observed_at":"2026-08-11T04:34:03.144906Z","title":"CMT: Convolutional Neural Networks Meet Vision Transformers","venue":"cs.CV","work_id":"0b492e55-4457-492b-b6c0-d651da851c01","year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.133793Z"},"links":{"cited_paper":"/paper/2107.06263","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:d5580f3b6c6867321c158f58b9a817d65c19fd192f14c76402bcd57ef103f9cc","observation_id":"7b199c26-bcd3-467d-bd0b-566ff6fd9edb","resolution":{"observed_at":"2026-08-11T04:34:03.149792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.604355Z","title":null,"venue":null,"work_id":"0a8c2730-d797-49c3-ab8f-9be792acc307","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.138382Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:902fbe349950cc0527e5f58ef5ed8b1f1c90fb9d7998d7398b6d626bceaf27d5","observation_id":"4d20afe7-52e0-44dd-9c4f-b818083f4852","resolution":{"observed_at":"2026-08-11T04:34:03.608646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.4729","last_updated":"2015-04-23T07:33:24Z","snapshot_observed_at":"2026-08-07T04:13:47.671495Z","submitted_at":"2014-06-18T14:24:17Z","title":"Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.4729","snapshot_observed_at":"2026-08-11T04:34:02.146803Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.146803Z"},"links":{"cited_paper":"/paper/1406.4729","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:8764d2536382675a723cca19572e42056014f89128d71a7e9c70527670793fe7","observation_id":"3f033212-3b81-420b-b429-cefa7a0520a1","resolution":{"observed_at":"2026-08-11T04:34:02.146803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-11T04:34:02.151323Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.151323Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:c5262c9db460b0ac1b738adabc4e091fa3ad4077bd24c7c2ff366e8f588b638c","observation_id":"4e8854c7-6b64-4e60-a66a-f5fe6cbfe725","resolution":{"observed_at":"2026-08-11T04:34:02.151323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.590669Z","title":null,"venue":null,"work_id":"8a65d319-5dc1-44b6-9ba8-dc6a8c882746","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.156743Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:b655c1c4b6f78766fccff02eb9aa1236967426db37ffe95ec8e6009df2ea0349","observation_id":"18bac6bf-cb98-427e-b1bd-b8855302fea2","resolution":{"observed_at":"2026-08-11T04:34:03.595134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.166020Z","title":"Berg, Wan- Yen Lo, Piotr DollÃąr, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.166020Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:e64a9e2d0b6008bd13f2bf5bbcb0b1acaf1fd40c589e05e3dfb49ebf6d421a4a","observation_id":"5e0380c1-9d67-4cdf-8679-c1428be32ecf","resolution":{"observed_at":"2026-08-11T04:34:02.166020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00414","last_updated":"2019-07-19T14:59:45Z","snapshot_observed_at":"2026-07-06T07:49:47.294073Z","submitted_at":"2019-05-01T17:57:26Z","title":"Similarity of Neural Network Representations Revisited","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00414","snapshot_observed_at":"2026-08-11T04:34:02.170332Z","title":"Hin- ton","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.170332Z"},"links":{"cited_paper":"/paper/1905.00414","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2b0c7fe4c05f40f2f4b950fa47cff4069b34f4b1f5128352ca4e9d04e3a32c40","observation_id":"41fab339-7f56-48a0-9a2f-c9fb48f9f650","resolution":{"observed_at":"2026-08-11T04:34:02.170332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01244","last_updated":"2019-03-18T18:58:40Z","snapshot_observed_at":"2026-08-10T04:07:18.379098Z","submitted_at":"2018-08-03T16:05:55Z","title":"CornerNet: Detecting Objects as Paired Keypoints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01244","snapshot_observed_at":"2026-08-11T04:34:02.174795Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.174795Z"},"links":{"cited_paper":"/paper/1808.01244","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2e52cd0d766c7441a5c49bf5ab1188c73d41ac3c3afd77854856b76374a3da28","observation_id":"0fbd79ba-4e3a-41c8-86c9-8fcbffbf3bae","resolution":{"observed_at":"2026-08-11T04:34:02.174795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20077-9_17","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":null,"venue":"Lecture notes in computer science","work_id":"99cd897f-42f5-4746-aa7b-34b1ff1370d9","year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.178742Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:5828418d74b8f8b120794d75bc12e9d88857fac1e69d7acfdfa4593de6d0376b","observation_id":"2a5c7759-8818-4780-8eff-913e32be5057","resolution":{"observed_at":"2026-08-11T04:34:02.413966Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03144","last_updated":"2017-04-19T22:46:32Z","snapshot_observed_at":"2026-08-06T19:39:18.247413Z","submitted_at":"2016-12-09T19:55:54Z","title":"Feature Pyramid Networks for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03144","snapshot_observed_at":"2026-08-11T04:34:02.182700Z","title":"Girshick, Kaiming H e, Bharath Hariharan, and Serge J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.182700Z"},"links":{"cited_paper":"/paper/1612.03144","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:c841a851263ef1e461fae5b078b900c97ec317ca9adc51b24f1d54cee019df40","observation_id":"1e348a27-9edb-4e0d-91db-1b652d3c0096","resolution":{"observed_at":"2026-08-11T04:34:02.182700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.576405Z","title":"Girshick, Kaiming He , and Piotr Dollár","venue":null,"work_id":"c201772c-ac26-40ce-94af-879145381ccc","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.186774Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:8d32b8b0133d1d44f86e82df33feb92e441fb6ebf00b59ca1252529dca99ceec","observation_id":"25fce831-bc8a-4da2-abaf-37d25035ce0f","resolution":{"observed_at":"2026-08-11T04:34:03.581831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.562949Z","title":null,"venue":null,"work_id":"c29c50e7-bf2b-4a8e-805e-429abfbe523b","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.195040Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:bcd05ecb19e1e21dfd61c73fc15d8173cba0942463d9cf2f18fb19e0f7a29d37","observation_id":"49fa9b09-8bcd-46f6-851d-962f147d5bd9","resolution":{"observed_at":"2026-08-11T04:34:03.567191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02325","last_updated":"2016-12-29T19:05:11Z","snapshot_observed_at":"2026-07-06T04:39:05.325036Z","submitted_at":"2015-12-08T04:46:38Z","title":"SSD: Single Shot MultiBox Detector","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02325","snapshot_observed_at":"2026-08-11T04:34:02.204149Z","title":"Reed, Cheng-Yang Fu, and Alexander C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.204149Z"},"links":{"cited_paper":"/paper/1512.02325","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:2619eb1ccb5a7a9bf6327b895fc79b18c49a253ec2ba71c24a4e4d88887d1f32","observation_id":"c840ed8a-a38c-41c4-8cec-df60ba1f1fd0","resolution":{"observed_at":"2026-08-11T04:34:02.204149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09883","last_updated":"2022-04-11T16:03:17Z","snapshot_observed_at":"2026-08-09T14:31:05.781911Z","submitted_at":"2021-11-18T18:59:33Z","title":"Swin Transformer V2: Scaling Up Capacity and Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09883","snapshot_observed_at":"2026-08-11T04:34:02.208712Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.208712Z"},"links":{"cited_paper":"/paper/2111.09883","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:c93ce92836d18328c50fc07d19a41605858f47237fa4cbe12dd9b982e4cd86f1","observation_id":"e5939e69-769e-4628-bc2f-7753a423bb68","resolution":{"observed_at":"2026-08-11T04:34:02.208712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07784","last_updated":"2022-12-16T09:47:56Z","snapshot_observed_at":"2026-07-06T14:30:55.481690Z","submitted_at":"2022-12-14T18:50:20Z","title":"RTMDet: An Empirical Study of Designing Real-Time Object Detectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07784","snapshot_observed_at":"2026-08-11T04:34:02.217206Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.217206Z"},"links":{"cited_paper":"/paper/2212.07784","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:01ac57c6d6e2cd4d9b64fb8c0a9376bfaa1585f3025b54b67d429793e7d7084f","observation_id":"0d9511f5-4150-4826-96ba-6f00a2c07783","resolution":{"observed_at":"2026-08-11T04:34:02.217206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.535746Z","title":null,"venue":null,"work_id":"d4eca797-1ffc-4f0b-b194-f39fe14bd346","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.221711Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1a5a8e093afea972177f31dcac79538b7c240eca14c30db4ff75fd19bbbd1cfa","observation_id":"c1c495be-6c38-42eb-b4fb-2fd689ef2ef1","resolution":{"observed_at":"2026-08-11T04:34:03.540028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.521401Z","title":null,"venue":null,"work_id":"3111de9c-edb5-4b56-bc57-2d82af6f202e","year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.230494Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:aedf4d6205024d33bab00fce36ec674c6bcb1186ccfccf05c590df0a4f186e26","observation_id":"d6eb5e06-7cb7-4b5f-ac19-fbf15ba2712c","resolution":{"observed_at":"2026-08-11T04:34:03.526104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.234743Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.234743Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1d07dbbb875575606e91716c5fe397674c12238f100408b96551137abcd2c4b2","observation_id":"87c790a6-80dd-4393-9a0f-9a4c6f5a99d6","resolution":{"observed_at":"2026-08-11T04:34:02.234743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.506587Z","title":null,"venue":null,"work_id":"6a2e3446-6916-460c-85da-965e784b78bc","year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.239108Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:4c2caa91862b9792258dc5e831edd87e1db88026779878edaf01a96acb72067d","observation_id":"c6c93072-9be3-4538-a6fb-5a78a6b4ac23","resolution":{"observed_at":"2026-08-11T04:34:03.511260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.491466Z","title":null,"venue":null,"work_id":"2992d1fb-904b-4c73-a1c2-c38077b40678","year":2018},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.243315Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:20e3cf1507648b71bacabee05e1e88767c83f9b157bb4071d701cfbd64ed3ea7","observation_id":"834b2e6d-3e01-47f3-9800-b6ba83bd9411","resolution":{"observed_at":"2026-08-11T04:34:03.495960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-25082-8_1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":"In Computer Vision âĂŞ ECCV 2022 Workshops: Tel A viv, Israel, October 23âĂŞ27, 202 2, Proceedings, Part VII (Tel Aviv, Israel)","venue":"Lecture notes in computer science","work_id":"2b808c4b-e389-4644-be43-00c79fd717f5","year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.226254Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:d7438c36814a55643d1c8e73f225a9bb91cee8f89be133bf579f62e975f82514","observation_id":"aa493100-75dd-4e97-98e5-8a631db8c28d","resolution":{"observed_at":"2026-08-11T04:34:02.399237Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.252092Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.252092Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:7b99f2d6c89d9010ef8a2f2406bae717b084655e43c2c7c07665d91d606c37cb","observation_id":"3608339d-eaf3-479d-b709-927492599dfb","resolution":{"observed_at":"2026-08-11T04:34:02.252092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02640","last_updated":"2016-05-09T22:22:11Z","snapshot_observed_at":"2026-07-06T04:20:15.965140Z","submitted_at":"2015-06-08T19:52:52Z","title":"You Only Look Once: Unified, Real-Time Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02640","snapshot_observed_at":"2026-08-11T04:34:02.256193Z","title":"Girshick , and Ali Farhadi","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.256193Z"},"links":{"cited_paper":"/paper/1506.02640","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1dc51736bb5fefffefa485a1e79d7f117398b9d8748fbd194044ef7f98a762c9","observation_id":"6349ec22-1f98-4cb8-852a-556dc607d144","resolution":{"observed_at":"2026-08-11T04:34:02.256193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-07-06T04:19:53.343717Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-11T04:34:02.260971Z","title":"Girshick, and Jian Sun","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.260971Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:11c61ed003f0e8939dc5e9ede5d716bbd29408eb266f95769a77fc1d293ed596","observation_id":"92ad948b-d174-40e3-a31e-ad24d503f29b","resolution":{"observed_at":"2026-08-11T04:34:02.260971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.265565Z","title":"Wu, Safwan S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.265565Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:a23de2977861b21ab32d95c4b253e79393b1be79729f2295a687cbb14b7d25bd","observation_id":"6e0e3ab7-ea8d-4460-8a77-87b671302cff","resolution":{"observed_at":"2026-08-11T04:34:02.265565Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13678","last_updated":"2020-03-30T17:57:47Z","snapshot_observed_at":"2026-08-12T10:40:16.751027Z","submitted_at":"2020-03-30T17:57:47Z","title":"Designing Network Design Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13678","snapshot_observed_at":"2026-08-11T04:34:02.247765Z","title":"Girsh ick, Kaiming He, and Piotr Dollár","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.247765Z"},"links":{"cited_paper":"/paper/2003.13678","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:5b115840c7994362aa70f4137bf81f85b7ddc98bcfeecfef21b7d134f394a4ce","observation_id":"3c005129-e5c7-4535-b446-c23dfc39da68","resolution":{"observed_at":"2026-08-11T04:34:02.247765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11946","last_updated":"2020-09-11T05:08:01Z","snapshot_observed_at":"2026-08-10T19:44:30.311627Z","submitted_at":"2019-05-28T17:05:32Z","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11946","snapshot_observed_at":"2026-08-11T04:34:02.274332Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.274332Z"},"links":{"cited_paper":"/paper/1905.11946","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:3acf3aa874954ecf224ae488b2e788ec9360cb7e31b701f532252a7285cdb432","observation_id":"ba13177f-9bf0-471e-9195-d98182a76eef","resolution":{"observed_at":"2026-08-11T04:34:02.274332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-11T04:34:02.278900Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.278900Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:238c024969a39f5ed794108f27910fbaced86a12cd02762d31adde23e20dfaa3","observation_id":"16d5f83c-c569-413c-9e76-288417e3fba6","resolution":{"observed_at":"2026-08-11T04:34:02.278900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12122","last_updated":"2021-08-11T12:38:21Z","snapshot_observed_at":"2026-08-12T02:38:40.213189Z","submitted_at":"2021-02-24T08:33:55Z","title":"Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12122","snapshot_observed_at":"2026-08-11T04:34:02.283296Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.283296Z"},"links":{"cited_paper":"/paper/2102.12122","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ea0b72fb2205a1f9385eefa3cf3b220480fd84be544819be49c72ca6a3562fda","observation_id":"777a7d41-9015-43dd-b854-7f2413e41bec","resolution":{"observed_at":"2026-08-11T04:34:02.283296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.287811Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.287811Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ff5bf88330b9abdbbbb05f9afe7bb769b0011570a06de1ba99f25718fff9aed1","observation_id":"3e7a63b4-e830-4d54-8eb5-e6acd6f21135","resolution":{"observed_at":"2026-08-11T04:34:02.287811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-12T14:19:29.389332Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T04:34:02.269929Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.269929Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:9d3cbbb08a3c6f28fa691bdee08b51ea64539d0d3e281538af0b0f689278e06c","observation_id":"7a4333fc-7eb7-43bd-b467-216f5ccae013","resolution":{"observed_at":"2026-08-11T04:34:02.269929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.477726Z","title":null,"venue":null,"work_id":"ac898c8f-9734-4a60-bcd0-224d1471e4d5","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.296177Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:14591d25277a671469af197e73d8df298879646b9b528d8a88fa5a75f8dd8c8f","observation_id":"a5c2843f-2825-4012-a6e8-b5efc510faab","resolution":{"observed_at":"2026-08-11T04:34:03.482056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15808","last_updated":"2021-03-29T17:58:22Z","snapshot_observed_at":"2026-08-07T09:48:34.844893Z","submitted_at":"2021-03-29T17:58:22Z","title":"CvT: Introducing Convolutions to Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15808","snapshot_observed_at":"2026-08-11T04:34:02.303884Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.303884Z"},"links":{"cited_paper":"/paper/2103.15808","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:f9d71a4d09e9f30fb0cd892ef3e55cf49c1b1e8b1ddcae193f8b3981467695a5","observation_id":"c18b2d64-e096-4035-98aa-d7ef4360257b","resolution":{"observed_at":"2026-08-11T04:34:02.303884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00520","last_updated":"2022-05-24T12:52:37Z","snapshot_observed_at":"2026-08-08T14:21:30.392396Z","submitted_at":"2022-01-03T08:29:01Z","title":"Vision Transformer with Deformable Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00520","snapshot_observed_at":"2026-08-11T04:34:02.307775Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.307775Z"},"links":{"cited_paper":"/paper/2201.00520","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:d91c235d0dacf3318e5a01e937636e81709c1d1bf328e84280d0f5f62e6ee405","observation_id":"7e4fd844-f2b2-405a-bf3a-98dd106fe840","resolution":{"observed_at":"2026-08-11T04:34:02.307775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01430","last_updated":"2023-09-04T08:26:47Z","snapshot_observed_at":"2026-08-02T15:35:11.118369Z","submitted_at":"2023-09-04T08:26:47Z","title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01430","snapshot_observed_at":"2026-08-11T04:34:02.312181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.312181Z"},"links":{"cited_paper":"/paper/2309.01430","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:0b91f1177de81334b1bb49ba1288282760b2719bbf3b1e968b3dcd058f19cbe8","observation_id":"0cd8eb6a-d2a0-466b-a740-54b8b849facf","resolution":{"observed_at":"2026-08-11T04:34:02.312181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.292082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.292082Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:728b296fa0f17b5052ace944618b1a4a0deaf626c1b9552f3f3c0fbf967b49ed","observation_id":"111a8269-85dd-4803-87e2-86f69389b322","resolution":{"observed_at":"2026-08-11T04:34:02.292082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.434385Z","title":null,"venue":null,"work_id":"d9f4772b-5b49-4833-a090-2aca53b1e2a0","year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.320053Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:f9b5e1a30e8683b22623b15a28e3fba6da54bd37e4ada9dfb4edce84b42d8e01","observation_id":"02108eb6-d90c-429b-9cdb-33eb7c7c405f","resolution":{"observed_at":"2026-08-11T04:34:03.439246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.463458Z","title":null,"venue":null,"work_id":"71ddbdb9-df08-4dcc-a344-a605172b7dea","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.300079Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:dad3915120368a27ab424b1a4d7eedfb22da659ecbc3883c51de9b81af975805","observation_id":"b92fc2b6-7f21-40f3-bdb9-c60dbe31c84b","resolution":{"observed_at":"2026-08-11T04:34:03.468138Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02605","last_updated":"2022-07-29T06:39:56Z","snapshot_observed_at":"2026-08-08T22:04:49.264358Z","submitted_at":"2022-01-07T18:57:19Z","title":"Detecting Twenty-thousand Classes using Image-level Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02605","snapshot_observed_at":"2026-08-11T04:34:02.329007Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.329007Z"},"links":{"cited_paper":"/paper/2201.02605","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:0785303a24af9d0fee5fca750fa018e43496adc77923f73f1fdfd579b32f5624","observation_id":"e8ab321e-0a2c-4bc5-9805-592a55e3392e","resolution":{"observed_at":"2026-08-11T04:34:02.329007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-11T04:34:02.333517Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.333517Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:307b796d9652b238753b8f734518614cd25f47e5d94ccb0c3f8befac4e79ee07","observation_id":"a20076af-da48-43d9-98a2-2ffe6485f391","resolution":{"observed_at":"2026-08-11T04:34:02.333517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.449402Z","title":null,"venue":null,"work_id":"2dcd0752-295f-4ba1-a29e-b3f83bfe880f","year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.316240Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:79ed56589180198f39c29912868add1e965f86046501291f1fdb0f8f92202091","observation_id":"425a0832-06ff-48f9-aa15-a3124d76c745","resolution":{"observed_at":"2026-08-11T04:34:03.453889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03714","last_updated":"2021-06-07T15:24:54Z","snapshot_observed_at":"2026-08-08T03:52:58.973548Z","submitted_at":"2021-06-07T15:24:54Z","title":"Refiner: Refining Self-attention for Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03714","snapshot_observed_at":"2026-08-11T04:34:02.324295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.324295Z"},"links":{"cited_paper":"/paper/2106.03714","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:1750b4dbb648e23ef3cf7be72a86ea8954d6b8ef2edaac80d446347823657899","observation_id":"2d71f19f-a4f0-471d-915b-09ef6c0ecb1f","resolution":{"observed_at":"2026-08-11T04:34:02.324295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-07-06T05:54:18.908943Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-11T04:34:02.190793Z","title":"CoRR abs/1708.02002 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.190793Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:cf8d1bd4bbea948142878f1dab31f185c664cb29edb3ecadc6ba885e6dbc31a4","observation_id":"8a833448-8f08-4bad-9398-4f50009ee08c","resolution":{"observed_at":"2026-08-11T04:34:02.190793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:03.549639Z","title":"In European Conference on Computer Vision","venue":null,"work_id":"840a3ab2-d4da-4342-9e08-270ba844ba1f","year":null},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.199377Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:353ca84ba1f9a479140ee72a02d6d5db6237f50b5309b0fff9ef4106afcf2342","observation_id":"37315f81-30d0-4d19-b9a3-87a0d21739dc","resolution":{"observed_at":"2026-08-11T04:34:03.553975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:02.142594Z","title":"In 2023 IEEE/CVF Con- ference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.142594Z"},"links":{"citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:ce372fa7c24d8bae713a7804a03669ef3698d5f5f40874dc9989a09eea0ecc16","observation_id":"2abe69fa-245a-45ba-b72f-dc6f285dc221","resolution":{"observed_at":"2026-08-11T04:34:02.142594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06842","last_updated":"2024-10-09T13:02:50Z","snapshot_observed_at":"2026-08-08T16:28:55.553954Z","submitted_at":"2024-10-09T13:02:50Z","title":"SurANet: Surrounding-Aware Network for Concealed Object Detection via Highly-Efficient Interactive Contrastive Learning Strategy","version":1},"cited_work":{"arxiv_id":"2410.06842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06842","snapshot_observed_at":"2026-08-11T04:34:03.021746Z","title":"SurANet: Surrounding-Aware Network for Concealed Object Detection via Highly-Efficient Interactive Contrastive Learning Strategy","venue":"cs.CV","work_id":"5c962865-51bd-4bd8-b271-5e769b05fc78","year":2024},"citing_paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:02.161232Z"},"links":{"cited_paper":"/paper/2410.06842","citing_paper":"/paper/2412.18778"},"observation_digest":"sha256:aebe5f2d7b757adb23d36de641204e92757da056bda40770aaf285a35eb2c33a","observation_id":"c0795a57-27f5-48de-a036-56cbc66feb09","resolution":{"observed_at":"2026-08-11T04:34:03.027113Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18778","last_updated":"2024-12-25T04:53:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T04:26:56.740720Z","submitted_at":"2024-12-25T04:53:19Z","title":"Unified Local and Global Attention Interaction Modeling for Vision Transformers"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":48,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2412.18778."}