{"as_of":"2026-08-18T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b075f2a43f5116d19abc54272dae88220cda750b7a34dd076d17c6db6afbcab","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:06:20.033960Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08173/citation-record","integrity":"/paper/2505.08173/integrity","json":"/paper/2505.08173/citation-record.json","paper":"/paper/2505.08173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.577356Z","title":"Cuda: Curriculum of data augmentation for long-tailed recognition","venue":null,"work_id":"c2782a53-d4fc-43f9-bc94-a41350348aea","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.880763Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:b310a3949c6c7d7f916c7ca3bb6c75582c38b4427bb05401d7ecb9d4bdbc7136","observation_id":"fd43f97c-4712-45e5-afb8-1110878a2b07","resolution":{"observed_at":"2026-08-15T22:06:20.581246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.500057Z","title":"Reslt: Residual learn- ing for long-tailed recognition","venue":null,"work_id":"2d4a6b75-0d4f-4e4d-9beb-f8f167c65d4f","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.911099Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:09f189c62614cf077cabb0ae68f2c66adce4022dbdbdf28434454af71a72ba9e","observation_id":"792afb3f-f5af-430e-adb6-f206062d88bb","resolution":{"observed_at":"2026-08-15T22:06:20.506133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.483336Z","title":"Generalized para- metric contrastive learning","venue":null,"work_id":"3c5b3f10-2696-4ddd-956c-afb0fa2db4e8","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.914948Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:a8472ab9534774e8acbc9516b8d6415798aed4dd0d395d8b09b26d3bf74652c7","observation_id":"6a6a1467-9409-465d-a9d6-73d2b6ee9d05","resolution":{"observed_at":"2026-08-15T22:06:20.488073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.468963Z","title":"Lpt: Long-tailed prompt tuning for image classification","venue":null,"work_id":"7175b430-a3e6-4b92-9f08-e743f0e32026","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.918482Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:85ae2fa3ab39cb7782e8f5fd56bdfa0d3891d89ff05f2ee64c7f7459b3c7fbf7","observation_id":"c5d473d1-9f3b-4844-ac14-8830fe7bd661","resolution":{"observed_at":"2026-08-15T22:06:20.473980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.454380Z","title":"Global and local mix- ture consistency cumulative learning for long-tailed visual recognitions","venue":null,"work_id":"db03b986-cc26-40f9-a8de-4355cb2f2fa0","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.922412Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:ab53dbd384510313b6233cbd294e097a3c0ac766c3da8d7d5fc0b7533be6c76b","observation_id":"0fb76a50-082a-49f9-ba12-2fc9abef9c8a","resolution":{"observed_at":"2026-08-15T22:06:20.458822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:19.926344Z","title":"Deep residual learning for image recog- nition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.926344Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:ef1ae2832bc566654c3cc420e2ec211b874dbda83c1fc9d8634326fc50ff86f1","observation_id":"41df7bf1-d24a-48a8-97ff-c5bcf9f7c6c2","resolution":{"observed_at":"2026-08-15T22:06:19.926344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.430434Z","title":"Disentangling label distribution for long- tailed visual recognition","venue":null,"work_id":"58887bb4-f443-46c1-b96b-f85bc96e3a4b","year":2021},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.929509Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:57cc7bae5d7c7e2a191d730b85ba71091c686a104374ea0c985653cb7536da27","observation_id":"5e2244d8-63b8-41fe-b8d8-6ad7ca80f064","resolution":{"observed_at":"2026-08-15T22:06:20.434804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.402121Z","title":"Decoupling representation and classi- fier for long-tailed recognition","venue":null,"work_id":"e3f7462c-af41-4652-a374-edf008542e8b","year":2019},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.936304Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:96f2f818cd87271205d7faf2e84eea79065118d9f053a4b95bfe8af5dc9c6374","observation_id":"27f806e1-fdf9-4098-b4a8-6a32f1117414","resolution":{"observed_at":"2026-08-15T22:06:20.406790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21042","last_updated":"2024-10-28T13:58:17Z","snapshot_observed_at":"2026-08-16T13:05:23.175451Z","submitted_at":"2024-10-28T13:58:17Z","title":"Improving Visual Prompt Tuning by Gaussian Neighborhood Minimization for Long-Tailed Visual Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21042","snapshot_observed_at":"2026-08-15T22:06:19.939756Z","title":"Improving vi- sual prompt tuning by gaussian neighborhood minimiza- tion for long-tailed visual recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.939756Z"},"links":{"cited_paper":"/paper/2410.21042","citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:34196e553c58c844f21d59bc66b97d4145083474c4762dbf94a5da7507d6d7dc","observation_id":"d2fac851-8782-4e5f-8eac-73799d958c54","resolution":{"observed_at":"2026-08-15T22:06:19.939756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.374528Z","title":"Cross-modal causal relational reasoning for event-level vi- sual question answering","venue":null,"work_id":"11267512-ceca-4cbb-8e93-3354d20127fd","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.947030Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:c0732abb1e3e6f763ba8b14f687dfffa2866ab9128b72f5d1f47c50ac5ef565a","observation_id":"97be1b2d-79d9-40ea-ae40-073d7c55baf1","resolution":{"observed_at":"2026-08-15T22:06:20.379051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.361157Z","title":"Causality-inspired invariant representation learning for text-based person retrieval","venue":null,"work_id":"f378c8d8-70d1-4413-9d71-69631d772bdf","year":2024},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.950322Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:b71baa7e97c9aa72f519eb02b0b3e03e67eeb0f32fb17116442cb78caf223aea","observation_id":"0e1c1fda-eab3-46fc-b1d2-369ae39d16ff","resolution":{"observed_at":"2026-08-15T22:06:20.365581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.338695Z","title":"Causality inspired representation learning for domain generalization","venue":null,"work_id":"66e0e41c-5495-4655-a744-f25a82863f81","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.953936Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:60a641204ce3eeb1002308473fc58b523e2782dc345f9cf0a6d19cb9e1390806","observation_id":"3b14f42d-253b-4f73-9639-1d8c426e3bd4","resolution":{"observed_at":"2026-08-15T22:06:20.351769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.314604Z","title":"Ex- ploring the limits of weakly supervised pretraining","venue":null,"work_id":"71fc995a-9c27-4f66-97f6-eaaba8eadcc6","year":2018},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.957358Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:a5a7b5e1df2e1cd2fa708b08373cd72901275a5e1e98e9c817f37b46aa2ca940","observation_id":"63b29e32-ea16-47fd-943a-3d21eab498a5","resolution":{"observed_at":"2026-08-15T22:06:20.318778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.290767Z","title":"Cadet: a causal disentan- glement approach for robust trajectory prediction in au- tonomous driving","venue":null,"work_id":"7ac0e035-72ed-4c82-aba8-7895326a9284","year":2024},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.964010Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:afb017770fdc843262fb7b6495ab4fdd7811534bb166aa3d642bc941b4738857","observation_id":"4645aba3-fe6c-4101-be54-de434ca848fe","resolution":{"observed_at":"2026-08-15T22:06:20.294617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.279566Z","title":"Deit-lt: Distillation strikes back for vi- sion transformer training on long-tailed datasets","venue":null,"work_id":"6dc74031-75f4-466c-aa85-1e5d0c3ad789","year":2024},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.967398Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:8671e2af2cbbf5975494a6384468b2788b163e5a89e3f5045f62da790aa626f5","observation_id":"f7684c61-8534-400b-8a79-2a3900576d41","resolution":{"observed_at":"2026-08-15T22:06:20.283608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.268941Z","title":"Balanced meta-softmax for long- tailed visual recognition","venue":null,"work_id":"4d22b16d-bc15-494f-82ad-d818b4be686e","year":2020},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.970893Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:c08a0c38bcb26443b9cc5ac4bc3e10e82293f9b37e6fbe54566fbc58723fc770","observation_id":"4f30df96-56d3-49c2-8c9d-6408a2eb160a","resolution":{"observed_at":"2026-08-15T22:06:20.272416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.258339Z","title":"Grad-cam: visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"ec238d78-c298-4831-b754-23e333221103","year":2020},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.974209Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:ce40c3047700f75e356df439cf538f5dbc1d76ad6ca1bac170a7b52d144cff99","observation_id":"bf6ce192-13c8-42a8-9702-6f2775e9422a","resolution":{"observed_at":"2026-08-15T22:06:20.261953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10019","last_updated":"2024-06-01T09:59:01Z","snapshot_observed_at":"2026-08-18T04:16:32.684662Z","submitted_at":"2023-09-18T17:50:56Z","title":"Long-Tail Learning with Foundation Model: Heavy Fine-Tuning Hurts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10019","snapshot_observed_at":"2026-08-15T22:06:19.977641Z","title":"Parameter- efficient long-tailed recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.977641Z"},"links":{"cited_paper":"/paper/2309.10019","citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:7c192b726c40cff6d7da7d12fea058abc29ab908a54717c0255f927092d885cc","observation_id":"ed9f6293-301d-4a7f-9129-75a46a4e73b0","resolution":{"observed_at":"2026-08-15T22:06:19.977641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.247922Z","title":"Unbiased scene graph genera- tion via two-stage causal modeling","venue":null,"work_id":"96a077b8-0c0e-4427-a717-a4b702d5db31","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.981439Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:9233128f4003ff8aa781d353e2f4056bfd8935c3a37f3b56f611f9a67b11ca24","observation_id":"8969beeb-8c6d-404b-9286-24879763e2ca","resolution":{"observed_at":"2026-08-15T22:06:20.251405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.236524Z","title":"Long-tailed classification by keeping the good and removing the bad momentum causal ef- fect","venue":null,"work_id":"b7514a26-eca6-4715-9f98-c79fdf573a94","year":2020},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.984921Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:4fa90e1039955b00fb49e4f63ae5cd3a397ec2d531980214c886d36cafac7a34","observation_id":"b29312fb-6a30-4df4-a35b-183d2b943135","resolution":{"observed_at":"2026-08-15T22:06:20.240477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.225117Z","title":"Vl-ltr: Learning class- wise visual-linguistic representation for long-tailed visual recognition","venue":null,"work_id":"7fc6349f-077d-4de7-a5a5-a80fb38a3b45","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.988607Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:c019db56555071aeef7b172809ea8be8c956e73d01e4ca315f5f3f702e7daaf8","observation_id":"e1c654e1-081f-45ae-8f8d-330aec0a2851","resolution":{"observed_at":"2026-08-15T22:06:20.228756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.213176Z","title":"Learning imbalanced data with vision transformers","venue":null,"work_id":"c69bd14d-8f45-4481-adbb-f2795bf3df0a","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.992140Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:c512becd8f1f3a19eb6d074e2838ec8605b6fc19a2684a40219dcdded6c98b41","observation_id":"bfd99f09-77db-49b4-ac96-8320488f5420","resolution":{"observed_at":"2026-08-15T22:06:20.217178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03044","last_updated":"2016-04-19T16:43:09Z","snapshot_observed_at":"2026-08-14T23:00:34.588086Z","submitted_at":"2015-02-10T19:18:29Z","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03044","snapshot_observed_at":"2026-08-15T22:06:19.995731Z","title":"Show, attend and tell: Neural image caption generation with visual attention","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.995731Z"},"links":{"cited_paper":"/paper/1502.03044","citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:a301c228f2a6ce544a6d3473b7dfe9d97429c7f69851af8df3bd8b714c794918","observation_id":"6ef6307b-4a83-4d5a-92a3-e6227ae0ea3a","resolution":{"observed_at":"2026-08-15T22:06:19.995731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.190478Z","title":"Context de- confounded emotion recognition","venue":null,"work_id":"204dfa3c-1e46-4424-a5f6-096a99f8ba7f","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.008519Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:7b8dba651bc6605c4e73d04c3a4bbca5f02efaded6f35d0c9953e2b1127a731c","observation_id":"6da84859-f59f-4006-b274-c1d8ce38010e","resolution":{"observed_at":"2026-08-15T22:06:20.194416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.178255Z","title":"Deep long-tailed learn- ing: A survey","venue":null,"work_id":"5141cbc0-cabe-4c8c-8a69-76499a035653","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.012774Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:de50ee170386d364eedd8b3d49affb7068086fd3e30b2d4ce8f70c1ea1be81a9","observation_id":"e34268be-7459-410e-a1f1-9be4bd3b4843","resolution":{"observed_at":"2026-08-15T22:06:20.182490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.165788Z","title":"Bi-causal: Group activ- ity recognition via bidirectional causality","venue":null,"work_id":"e62650be-9824-48b8-b9b8-f9b04e252d29","year":2024},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.016786Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:1b4f4301a723fc42a8d2e163d8f6a63c1e873607647af50779d3e6aa1d5ab738","observation_id":"0d7190c1-7540-46cc-80d2-e40b19d8c0dc","resolution":{"observed_at":"2026-08-15T22:06:20.170098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.154767Z","title":"Bbn: Bilateral-branch network with cumulative learning for long-tailed visual recognition","venue":null,"work_id":"dff6e86a-8634-4623-81c6-3b1500a8509e","year":2020},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.020368Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:3a8b90448308b4c6c1bf748047021ec0361d305bb1980feaf7ae924ba5d7d52a","observation_id":"91d86560-ec80-44ec-b932-5bfb8c2d3ae7","resolution":{"observed_at":"2026-08-15T22:06:20.158392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.143079Z","title":"Pareto deep long-tailed recognition: A conflict- averse solution","venue":null,"work_id":"08d4e79c-71d7-4b21-8beb-fddf32212ae1","year":2024},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.026009Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:b477a124ef6079f350391dac93cb8b1ec4589fc251b8f231e289f59a5a6bef36","observation_id":"946d5c7a-8794-4e95-8396-998edf4e2def","resolution":{"observed_at":"2026-08-15T22:06:20.146977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.129693Z","title":"Cross-domain empirical risk min- imization for unbiased long-tailed classification","venue":null,"work_id":"a41e802d-c822-496c-99c2-8a03c69beec2","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.030162Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:3f2c010b4b14b905f54c7d1a2a52a6f811bfb10049078119ebeef5a20b236cc5","observation_id":"b8fdc0c1-3f08-413d-a97a-4f42be13fb61","resolution":{"observed_at":"2026-08-15T22:06:20.134656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.115015Z","title":"Generalized logit adjustment: Calibrat- ing fine-tuned models by removing label bias in founda- tion models","venue":null,"work_id":"42c55663-afd4-40cd-80b9-de649eaa1d90","year":2024},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:20.033960Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:bfd979bcc037b76321d13875b3f6443f6c3bfbd2ddb90b21a130a2293b0e6090","observation_id":"fd39e010-0ffc-448c-b6ff-8117bbc44a73","resolution":{"observed_at":"2026-08-15T22:06:20.121908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.565624Z","title":"Learning imbalanced datasets with label-distribution-aware margin loss","venue":null,"work_id":"e0db67a0-31d1-4a41-9af3-f812be07b124","year":2019},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.894336Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:49244cf770a8f264988fa232797e8efd3cec4a2a09e13b322c32a201ea247ad6","observation_id":"045f5734-77fb-4b40-9e08-92f46e28ead3","resolution":{"observed_at":"2026-08-15T22:06:20.569594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.201455Z","title":"Causal attention for vision-language tasks","venue":null,"work_id":"ec120156-9a2b-4e86-877f-8e18611a4ada","year":2021},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.999844Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:d1afd1d89512ef1fe6e57042967ee2cc29595400000d42a9b655c97be3deb9b8","observation_id":"30a96769-e4fe-4e4d-b6c2-e346339fee87","resolution":{"observed_at":"2026-08-15T22:06:20.205390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.541442Z","title":"Transfer knowledge from head to tail: Uncertainty calibration under long-tailed distribution","venue":null,"work_id":"05c16a8d-d817-4bbc-a553-bbc81450290c","year":2023},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.902770Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:16887b8151db8d13ece285bac4157dbb240b36aad3f7302d8c0f7919111b5c21","observation_id":"692c28b5-3bb9-4a9e-a787-aa55b145c773","resolution":{"observed_at":"2026-08-15T22:06:20.546750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.302219Z","title":"Causal transportability for visual recognition","venue":null,"work_id":"af9108b6-5528-4212-85ee-361d8fec80f0","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.960589Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:894615b3ff85cd7035e01458292166116deebbf39cc73059b61002a1f031e478","observation_id":"1dfddab4-ff8c-4eb3-8373-ccb263c0d5a9","resolution":{"observed_at":"2026-08-15T22:06:20.306424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.555196Z","title":"Deep-based ingredient recognition for cooking recipe re- trieval","venue":null,"work_id":"2d2c2ab0-4d87-4e9a-b1ed-3649d2fb92d4","year":2016},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.898390Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:0265453961f178ec116f51bd5affb86c9a7691a2870e8a1f5a45beec1cefae54","observation_id":"e6a4bee6-a174-46d7-8fe3-6b8ea673fd87","resolution":{"observed_at":"2026-08-15T22:06:20.558720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1203.6402","last_updated":"2012-03-29T00:06:07Z","snapshot_observed_at":"2026-08-15T04:14:40.976149Z","submitted_at":"2012-03-29T00:06:07Z","title":"Scalable K-Means++","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1203.6402","snapshot_observed_at":"2026-08-15T22:06:19.889905Z","title":"Scalable k-means++","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.889905Z"},"links":{"cited_paper":"/paper/1203.6402","citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:c2cbf1b76453ddd02ffeca0c7ba203aa17e79124cb784ec2bfab7a78361c95d1","observation_id":"ad836b6c-dfb5-4d2f-83c1-602e8401a847","resolution":{"observed_at":"2026-08-15T22:06:19.889905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.415994Z","title":"Visual prompt tuning","venue":null,"work_id":"38ea4dca-9fb3-49ea-93e3-5948df09aec9","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.932972Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:ab2d8a704cc0b9b6c3f37b3e8de0ee80cd7b36dccbf29c2312d25c9a06a7c393","observation_id":"e8ed2769-0527-4af6-b7a6-e3ff938fc3af","resolution":{"observed_at":"2026-08-15T22:06:20.422090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T22:06:19.885655Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.885655Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:2a175947487a1a1b2da49135e087e0a302606f613c5763ca8ac53830740905d5","observation_id":"a7aa85f1-c5aa-4a25-857c-6953a5246e8a","resolution":{"observed_at":"2026-08-15T22:06:19.885655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.517837Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":"60b07a09-7e10-4311-a2ea-c892e1d7e6bd","year":2019},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.907683Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:5e05d33a044fceece305137419e7157fb5df508c7ed1dc907769adbdbbcc9ba4","observation_id":"3b5bd174-9ec2-4abe-95b4-41bfde57447b","resolution":{"observed_at":"2026-08-15T22:06:20.529384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:06:20.388525Z","title":"Contextual debiasing for vi- sual recognition with causal mechanisms","venue":null,"work_id":"880c9c24-2dc1-4f72-af81-047e30b69e6a","year":2022},"citing_paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:19.943707Z"},"links":{"citing_paper":"/paper/2505.08173"},"observation_digest":"sha256:dab0a3593ba6bc6f75fdc9d69598945be26c4f9d9235c331ffa9df18a14588cb","observation_id":"98540031-c0f3-4f98-b924-6bc0af3cef7c","resolution":{"observed_at":"2026-08-15T22:06:20.393010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08173","last_updated":"2025-05-13T02:23:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:46:21.688523Z","submitted_at":"2025-05-13T02:23:55Z","title":"Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.08173."}