{"as_of":"2026-08-23T01:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05ca3ce2dea99afba4f155d3da682f0a6706093ff82f6e3b4cdf8f2db85299ab","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T15:09:25.818449Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:57:48.018700Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21531","snapshot_observed_at":"2026-08-03T02:57:48.018700Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.09431","last_updated":"2026-05-24T12:21:22Z","snapshot_observed_at":"2026-08-18T20:31:12.788871Z","submitted_at":"2026-02-10T05:51:02Z","title":"Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T02:57:48.018700Z"},"links":{"cited_paper":"/paper/2601.21531","citing_paper":"/paper/2602.09431"},"observation_digest":"sha256:12a39ba47390ba54e2603b88fc429123ce897f910118562e1a5a55268a4ce89d","observation_id":"59e09af0-3610-4134-94b5-221551f39e13","resolution":{"observed_at":"2026-08-03T02:57:48.018700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21531","snapshot_observed_at":"2026-08-01T13:10:37.695997Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-18T20:14:34.753850Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.695997Z"},"links":{"cited_paper":"/paper/2601.21531","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:23e846cc3164b7e807a2cab95473ed8a5de85ddf4aad527958525d7231831dbc","observation_id":"27a920ce-8ccf-4bf7-aab9-20ad969a8772","resolution":{"observed_at":"2026-08-01T13:10:37.695997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.21531/citation-record","integrity":"/paper/2601.21531/integrity","json":"/paper/2601.21531/citation-record.json","paper":"/paper/2601.21531"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:39ff7f4dc7e5ca9de48ed755605baa3945d05918f4dd8a5c40e739d80b5cb194","observation_id":"1ab3c746-1fe9-4f79-9ad6-5ffedd4bbbb0","resolution":{"observed_at":"2026-05-21T15:10:16.503841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-20T12:23:13.963013Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:83677022ccfe755b69c1d7348d4b325aa7a9de0ebb95f473cdd1a12b49900491","observation_id":"fa6fc2fc-95c7-4f4f-a501-fdb244ebeeb3","resolution":{"observed_at":"2026-05-21T15:10:16.499228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08505","last_updated":"2025-07-14T08:25:14Z","snapshot_observed_at":"2026-08-18T08:58:00.445501Z","submitted_at":"2025-07-11T11:30:57Z","title":"Efficient Deployment of Vision-Language Models on Mobile Devices: A Case Study on OnePlus 13R","version":2},"cited_work":{"arxiv_id":"2507.08505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pan, Y ., and Kashyap, S","venue":null,"work_id":"9d8d0bc4-74ac-4188-82b1-fe13246d72f1","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2507.08505","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:df6282ccb2f3b54f2f3f7a156a28a5c77878098b9e1a6dfa33c0ff0577bd162c","observation_id":"e49eea97-df3d-4f89-bd72-36e15061fbb6","resolution":{"observed_at":"2026-05-21T15:10:16.531308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention score is not all you need for token importance indicator in KV cache reduction: Value also matters","venue":null,"work_id":"424b3367-5d19-460f-8b53-0738867bf83a","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:38fe50c13979470dcdcbcea0ffa125150930412b7746a02566a6b01702fb6a6e","observation_id":"e58a8779-ded4-4e44-bd60-a10d6cf7858d","resolution":{"observed_at":"2026-05-21T15:10:16.871354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:46:40.293866Z","title":"Vision-language-action models for autonomous driving: Past, present, and future","venue":null,"work_id":"3ed0d403-c946-4357-b4f8-c33ead499359","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:a1dce3b579ef7d37a311b5588c6826f12186e93431a6fcd7fbe4d5021356df3d","observation_id":"6b7f4381-3e20-4537-91f1-a7c5dd1323ac","resolution":{"observed_at":"2026-05-21T15:10:16.526862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-18T09:00:36.136914Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:e4c9c97bf73e81384a5c9ca0bd93d1821b0ca6ea494550b696fbccfc5f3cf3c2","observation_id":"dcff0bad-9c40-47ae-9458-c26b0d523365","resolution":{"observed_at":"2026-05-21T15:10:16.490773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veattack: Downstream-agnostic vision encoder attack against large vision language models.arXiv preprint arXiv:2505.17440","venue":null,"work_id":"c862cd7a-1d59-493f-b275-091928546a29","year":null},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:2ded4f9e569f920f9c367d81a3e62a0c60146288a9c7cb5fd605ec08ad33f9f9","observation_id":"3257afd3-1b64-4f74-9467-fd0074446b5d","resolution":{"observed_at":"2026-05-21T15:10:16.535977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:175ab24dd06c82e65a7b5d979717c2394ee525812ffad1058dcd4016c71c9985","observation_id":"7a2c1145-ecb1-4827-a1f7-4cc35667a8b4","resolution":{"observed_at":"2026-05-21T15:10:16.512926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:c300a1949eaa66a370fa33b9260976637613067c1145b8bec9b9127ed74c0525","observation_id":"a29f7e4e-2710-4979-b29a-f9bdd6c7b702","resolution":{"observed_at":"2026-05-21T15:10:16.494936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01886","last_updated":"2024-06-26T03:29:50Z","snapshot_observed_at":"2026-08-18T08:57:47.547079Z","submitted_at":"2023-12-04T13:40:05Z","title":"InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2312.01886","doi":"10.48550/arxiv.2312.01886","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instructta: Instruction- tuned targeted attack for large vision-language models","venue":"arXiv (Cornell University)","work_id":"30cecbfa-2bbc-4159-8f4f-80f312b74ac4","year":2023},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2312.01886","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:f7926ed5bef4435cd579cba83b1012f4c87dfba2aafe94469af1eab87b9f96e7","observation_id":"d8727c11-feb6-4cbd-bec3-549c82636662","resolution":{"observed_at":"2026-05-21T15:10:16.508674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15144","last_updated":"2025-09-01T05:38:34Z","snapshot_observed_at":"2026-08-17T00:33:55.206082Z","submitted_at":"2025-08-21T00:39:12Z","title":"Mobile-Agent-v3: Fundamental Agents for GUI Automation","version":2},"cited_work":{"arxiv_id":"2508.15144","doi":"10.48550/arxiv.2508.15144","metadata_source":"pith","pith_arxiv_id":"2508.15144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent-v3: Fundamental Agents for GUI Automation","venue":"cs.AI","work_id":"f8bf23c5-08e8-4ede-9e97-9d738493c422","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2508.15144","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:a8db0c5be2203f4486ef9418d5016be075ba516d81a847b7126948e3b3a47d11","observation_id":"ad7e7783-28dd-46a0-9d18-a5d965129a95","resolution":{"observed_at":"2026-05-21T15:10:16.521668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:16:26.675933Z","title":"DART: Dif- ferentiable dynamic adaptive region tokenizer for vision foundation models.arXiv preprint arXiv:2506.10390","venue":null,"work_id":"1eb0f861-fe52-4fb0-81b0-be241ac12e15","year":null},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:534fe53c6c4581315d6f4c1bb35a7e2182c9ae8f551b94b576cc152023ae099b","observation_id":"0a5eb920-a160-47af-978a-633c1499df6c","resolution":{"observed_at":"2026-05-21T15:10:16.517475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AppAgent: Multimodal agents as smartphone users","venue":null,"work_id":"cd20d086-2e98-4790-a948-e9e6d4f5e922","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:9b9fb5ab3478cd3368c0906b51dfee26e4eddc47b1ac95e2dd5d25598703b16a","observation_id":"a313bdb6-e182-4d5b-adfa-07998bc26ea6","resolution":{"observed_at":"2026-05-21T15:10:16.887535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"② Outer-LLMapproaches perform token selection or aggregationbeforethe main language model computation, treating the LLM as a black box","venue":null,"work_id":"705c6f7d-0c2d-4871-9dab-345bc722c9bf","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:d4c8abdd5e27cf2dc0e564f82812674f0a787808f82e4eccf3908abc5bd74825","observation_id":"c11f1702-528a-48fd-a5f8-07f9f5dc434e","resolution":{"observed_at":"2026-05-21T15:10:16.868416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A” and “S","venue":null,"work_id":"5a1323c4-5dcf-48ae-9860-0e924ba0fbf3","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:7feca883f603d0dbc04116c1c35709e6e05b9dff8a3034a30faa7ea3c2675379","observation_id":"d83d6d59-0837-4feb-bb19-383c93bb349a","resolution":{"observed_at":"2026-05-21T15:10:16.882328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7df26397-1ebf-4a32-a09f-d140818535e4","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:c85a3efb198151e72d81a6672de1b20816a1f4e357839cf459d96eefe61af2d4","observation_id":"2be79474-60ac-4954-b1dc-af9c94a63f6c","resolution":{"observed_at":"2026-05-21T15:10:16.879070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d4a72c62-af7a-4033-b59a-bc1d36290256","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:b7c3cc86ebf5de9a475f92802a8e92e4f7687c86eb7176d4126b5ef656a03fd2","observation_id":"350ca5d7-013f-4d99-b260-7c4f82e622f4","resolution":{"observed_at":"2026-05-21T15:10:16.890142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"243c0ba9-89cc-4a38-bfae-229c036c0514","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:7f95115fa5ae5375c8286977c2db70fdc6e5a82e6a6db96359ab68f97d107765","observation_id":"cd59b761-8129-4356-b5bb-b749c6ac37a7","resolution":{"observed_at":"2026-05-21T15:10:16.884875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e905175-1793-48c9-b57d-c852c1e262ea","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:27561dc2b032e3d60d5e63902316e449d6cab10eecb825acca82666cb83c3734","observation_id":"d178112d-52c2-4e50-91f7-d5aff6161765","resolution":{"observed_at":"2026-05-21T15:10:16.865543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c569d815-e902-40a8-9b24-aeff2b99d63f","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:4a0eb1fcef34c3ecc6b63bd5c13d1e68792dfcfa19b1dcb7f57911fe42128e22","observation_id":"33eeca9c-fc58-40e3-91dc-b32edb71a9a2","resolution":{"observed_at":"2026-05-21T15:10:16.892636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"94f9838b-8843-441a-b443-1bcbc6e7aa62","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:ba95bd1e4ef97116591dab3cd43642bd2cf3ddeb34908b4dc9f454fd9f266b04","observation_id":"c37b96d3-f8e9-498e-8816-9f35a383bbd4","resolution":{"observed_at":"2026-05-21T15:10:16.900935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For prompt-diverse tasks such as VQA, VEAttack (Mei et al","venue":null,"work_id":"69a2a778-0112-4673-8f72-e2dd83ec1b84","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:c03263fcd9f459f25b4e4b5ee346efba2232f2678481c0e4e86256e76ec5e462","observation_id":"e5f01081-b786-494d-b3ea-d9cd256148e0","resolution":{"observed_at":"2026-05-21T15:10:16.895308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compared to open-ended VQA, GQA emphasizes systematic generalization and relational grounding","venue":null,"work_id":"396b7a7d-dcaf-4020-a500-fbc9633498c5","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:096deb5e1ebcf96ba2dadfc28bae9869ce300ea430349f0d25dde6c7c0e8ae6e","observation_id":"7e5a2e41-f3fd-4873-8cbf-f2704946f340","resolution":{"observed_at":"2026-05-21T15:10:16.898296Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It utilizes vision-encoder attention maps to estimate token importance, identifying and retaining a compact subset of highly informative tokens","venue":null,"work_id":"b2044b72-0d23-46df-a28c-f516dcec0efe","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:422c56fc223054210adcf39152543232cfb253431f7b8a87e102bb090be5c3f8","observation_id":"9376ec39-d2e4-4335-b692-55e060fe9cb8","resolution":{"observed_at":"2026-05-21T15:10:16.903881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Importantly, most non-zero λ settings are comparable to or better thanλ=0, indicating that incorporating RDA is generally beneficial even without delicate tuning","venue":null,"work_id":"91669e54-a10a-452c-b888-81fc399714bc","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:a12f800cb7c25936e821a4dbdd414220e90912800605efcd06d52685687653ca","observation_id":"5aec3930-533a-488f-8b85-9a764d368930","resolution":{"observed_at":"2026-05-21T15:10:16.873954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"peakiness","venue":null,"work_id":"b77916a0-b077-4b8a-812e-170cec6b109f","year":2025},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:1a06dc9bab62772b7ef9ddbfc66a0327292470f99a662a278c79ff25f1deef3d","observation_id":"a1b9f1fe-a914-4f29-ad06-ba85004cd42c","resolution":{"observed_at":"2026-05-21T15:10:16.906565Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fab03dcb-6aa0-4576-8ff4-c50c25bd9851","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:236304565b3c694657ec86431786b682c58b9ef3a712b261b49ab914d1069a11","observation_id":"c8cab823-9227-4959-8360-1aaadf0b426d","resolution":{"observed_at":"2026-05-21T15:10:16.876443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-16T23:19:43.424718Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":7,"verified_exact":9,"verified_fuzzy":7},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 2 inbound Pith citation observations for arXiv:2601.21531."}