{"as_of":"2026-07-23T17:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd08cb5ece34c366f7fbdb3e8287c026a92d78a4498aea37eddae8bc3626ad95","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T19:58:05.484186Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:57.476599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2504.05902","last_updated":"2026-04-13T15:36:03Z","snapshot_observed_at":"2026-07-06T21:06:03.653624Z","submitted_at":"2025-04-08T11:01:07Z","title":"Defending against Backdoor Attacks via Module Switching","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T20:28:24.169272Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2504.05902"},"observation_digest":"sha256:964091082258d0aa758de263f7a5ce5103c7a87b6b6f868e6d45149e8b89a09d","observation_id":"6577d602-f489-4662-b633-ea4472b74b5f","resolution":{"observed_at":"2026-05-22T20:32:04.763637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2602.23061","last_updated":"2026-04-14T04:49:27Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:48:49Z","title":"MoDora: Tree-Based Semi-Structured Document Analysis System","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T19:09:41.482713Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2602.23061"},"observation_digest":"sha256:28be2237c2d30fef5793259fa221ba6a572fefe224917ac2bbd9b4e647d6ad9b","observation_id":"a3c569f9-f741-41f5-ad29-97d634cdb446","resolution":{"observed_at":"2026-05-15T19:10:15.528788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2604.20276","last_updated":"2026-04-22T07:24:53Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T07:24:53Z","title":"Rethinking Intrinsic Dimension Estimation in Neural Representations","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-10T00:50:49.134622Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2604.20276"},"observation_digest":"sha256:f6dc5ac626e6b18637cf8cfff8ddd14b35b59963fa2dd473ddf01fbbea7effcb","observation_id":"3c2b3914-1d60-4f3e-98bc-aa448f7b5a53","resolution":{"observed_at":"2026-05-10T00:54:48.758900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.00764","last_updated":"2026-05-01T16:25:13Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T16:25:13Z","title":"Modeling Subjective Urban Perception with Human Gaze","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-09T19:12:54.038217Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.00764"},"observation_digest":"sha256:9c3cf473a06c7a878318e382c4dcafaed1425d5522e7010ae793e3d15d941deb","observation_id":"5dfddba1-9fa1-4cb7-9865-0301af09c7ba","resolution":{"observed_at":"2026-05-11T15:47:15.929843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.02707","last_updated":"2026-05-04T15:13:47Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:13:47Z","title":"SAIL: Structure-Aware Interpretable Learning for Anatomy-Aligned Post-hoc Explanations in OCT","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:35.927272Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.02707"},"observation_digest":"sha256:749a43b7fb3305559610ecb929e2e008d2b70b231fa3bc9090a964f06faefd47","observation_id":"3ae6afd6-d479-48c3-9d89-a954915cdb15","resolution":{"observed_at":"2026-05-09T06:35:41.076077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.12570","last_updated":"2026-05-12T10:16:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T10:16:41Z","title":"M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:57.769186Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.12570"},"observation_digest":"sha256:5ecc9fa71d4f4fd635eedb839b346c130b381c16288df14485e43be8e9173f37","observation_id":"fb19430e-446d-4162-a391-142c9a35af9e","resolution":{"observed_at":"2026-05-14T20:59:27.369856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.18466","last_updated":"2026-05-18T14:26:17Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:26:17Z","title":"Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:40:19.027987Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.18466"},"observation_digest":"sha256:76e0b4ae08f521f7251082f46b713f16de7aefd271fa20e47fa2dedb62e149ab","observation_id":"aac02284-2aa9-466d-8eb3-fea5bf884b38","resolution":{"observed_at":"2026-05-20T11:43:15.188039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2605.20732","last_updated":"2026-05-20T05:35:45Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:35:45Z","title":"Deep Attention Reweighting: Post-Hoc Attention-Based Feature Aggregation in CNNs for Disentangling Core and Spurious Features under Spurious Correlations","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T05:04:59.177437Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2605.20732"},"observation_digest":"sha256:fda9603562430964a850bb8f76cfe739c3a7bb8ea395c98c159e6bd0e8256518","observation_id":"608cde3a-c82e-4b76-bedb-069ef682970b","resolution":{"observed_at":"2026-05-21T05:09:38.768756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2606.18554","last_updated":"2026-06-17T00:08:35Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-17T00:08:35Z","title":"Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:27.296146Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2606.18554"},"observation_digest":"sha256:3ee05d2a81c2a1047c84cb1588e4ec216088dbe8bab3183147805e37003383b7","observation_id":"098a2994-ae5d-49be-9b8e-8abbe2e85b91","resolution":{"observed_at":"2026-07-03T23:59:07.327251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":"2006.03677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-04T16:09:57.476599Z","title":"arXiv preprint arXiv:2006.03677 (2020) Multimodal Learning for Vocal Tract Segmentation 11","venue":null,"work_id":"f058a881-df6e-4160-8d65-f680557c71e2","year":2006},"citing_paper":{"arxiv_id":"2606.24192","last_updated":"2026-06-23T06:22:00Z","snapshot_observed_at":"2026-07-06T23:58:49.574536Z","submitted_at":"2026-06-23T06:22:00Z","title":"Co-occurring associated retained concepts in Diffusion Unlearning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T00:50:58.689718Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2606.24192"},"observation_digest":"sha256:e112fb7eb84639ba59e8fe4f3bfdf83451b6fbfb7564f28fab8c4dfdaf77fcc7","observation_id":"e82670d2-c508-4a32-b824-a848a5d8f388","resolution":{"observed_at":"2026-07-04T16:09:57.478300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03677","snapshot_observed_at":"2026-07-11T19:58:05.484186Z","title":"Visual transformers: Token-based image representation and processing for computer vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.04339","last_updated":"2026-07-05T14:45:29Z","snapshot_observed_at":"2026-07-11T19:58:04.775698Z","submitted_at":"2026-07-05T14:45:29Z","title":"One Framework for All: Cross-Modal Membership Inference for Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T19:58:05.484186Z"},"links":{"cited_paper":"/paper/2006.03677","citing_paper":"/paper/2607.04339"},"observation_digest":"sha256:fa276a30e79d120bcbed56b2466b7504a1b561d48ffedee8d9bae191d06914cf","observation_id":"32837a37-b408-4ae6-9442-6e54b233b313","resolution":{"observed_at":"2026-07-11T19:58:05.484186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.03677/citation-record","integrity":"/paper/2006.03677/integrity","json":"/paper/2006.03677/citation-record.json","paper":"/paper/2006.03677"},"outbound":[],"paper":{"arxiv_id":"2006.03677","last_updated":"2020-11-20T00:10:51Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:49:49Z","title":"Visual Transformers: Token-based Image Representation and Processing for Computer Vision"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2006.03677."}