{"as_of":"2026-08-09T00:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7f0b785e9b470e14d66c139b8f55680f1d64c905a9fb97693194fc8d1863d9e","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:40:57.522269Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07709/citation-record","integrity":"/paper/2507.07709/integrity","json":"/paper/2507.07709/citation-record.json","paper":"/paper/2507.07709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.00236","last_updated":"2024-09-17T19:56:09Z","snapshot_observed_at":"2026-08-06T06:17:45.496933Z","submitted_at":"2023-09-01T03:53:40Z","title":"Image Hijacks: Adversarial Images can Control Generative Models at Runtime","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00236","snapshot_observed_at":"2026-08-06T18:40:52.561526Z","title":"Image hijacks: Adversarial images can control generative models at runtime","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:52.561526Z"},"links":{"cited_paper":"/paper/2309.00236","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:95c1ee9a2677dc5e04f3e07e1418280d04417c97457926f4cf84bdd93692c8f3","observation_id":"2f8da359-dda7-4ee8-beac-ffae3b37f341","resolution":{"observed_at":"2026-08-06T18:40:52.561526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.538056Z","title":"Context-aware transfer attacks for ob- ject detection","venue":null,"work_id":"60b98a71-b4ce-4a8e-bfda-4288b1bb46b7","year":2022},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:52.647094Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:964ecc33bb5d61be456fd1199f54962447cc322ea5fd3939ab47e984f51327e8","observation_id":"3db6e712-840e-4f4f-9369-dfb8f3bb4cc8","resolution":{"observed_at":"2026-08-06T18:41:04.582831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.333816Z","title":"Attentional feature erase: Towards task-wise transferable ad- versarial attack on cloud vision apis","venue":null,"work_id":"fbf8ba80-b38c-4e47-9f57-885705e8a304","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:52.733541Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:8f5ac5cdade34e8fb5533af6f626aa890704150a04bd43d05c7b8bbdf854e7a7","observation_id":"cb3ca466-26d7-4f9c-800f-e24313583aaa","resolution":{"observed_at":"2026-08-06T18:41:04.442856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:04.197711Z","title":"Unihcp: A unified model for human-centric perceptions","venue":null,"work_id":"36a73aba-b2eb-4126-aebd-9227fea332fe","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:52.813620Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:15639d0526d4139a60b47a388cecd9e59656d12c2ac0eefc7f02bea22320055d","observation_id":"c3a0dd3f-ed1f-4e0c-995f-67ef7435c8ac","resolution":{"observed_at":"2026-08-06T18:41:04.319792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:03.485513Z","title":"On the robustness of large multimodal mod- els against image adversarial attacks","venue":null,"work_id":"7bea7cb0-f47c-4e98-b108-ad71e1d83be8","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:52.918205Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:b849e41cb790f7799b93723c92923499e6d93aa54f46b56671938e50ec76371a","observation_id":"30441227-0aae-4551-b6c4-15b183795279","resolution":{"observed_at":"2026-08-06T18:41:03.750825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-02T21:47:41.540245Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-06T18:40:52.995040Z","title":"How robust is google’s bard to adversarial image at- tacks? arXiv preprint arXiv:2309.11751, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:52.995040Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:fd304ac1e0d553cb59c46b07cca3d3d315b90e70ff870a5d9377aeaefc116cad","observation_id":"37777eec-ccad-48b1-bd52-14a4fd214294","resolution":{"observed_at":"2026-08-06T18:40:52.995040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:03.225207Z","title":"Enhancing cross-task transferability of adversarial examples via spatial and channel attention","venue":null,"work_id":"3ba808df-daac-4fba-94d1-b880c2513e5f","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.086079Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:50b646b49d0b92f004eb41e77ccfbb4ec0c0934e5a9381bd1ad12b9715a372f4","observation_id":"ff96f19c-ec7e-4948-a64a-82344e57d4e7","resolution":{"observed_at":"2026-08-06T18:41:03.304111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:03.076805Z","title":"Similarity distribution based member- ship inference attack on person re-identification","venue":null,"work_id":"ded734a7-d15f-4bce-9c15-764eabea6c54","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.193667Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:95d8a319a743a98c0fb413a1d1f8e2d528bd25b8e6e3f39a3689480239966577","observation_id":"091de147-a505-4436-a2d7-11f0cfe5edfa","resolution":{"observed_at":"2026-08-06T18:41:03.132963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01414","last_updated":"2025-02-23T13:45:34Z","snapshot_observed_at":"2026-08-06T05:30:05.390704Z","submitted_at":"2024-07-01T16:05:18Z","title":"StyleShot: A Snapshot on Any Style","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01414","snapshot_observed_at":"2026-08-06T18:40:53.311135Z","title":"Styleshot: A snap- shot on any style","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.311135Z"},"links":{"cited_paper":"/paper/2407.01414","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:fe942bbbb2c0cc8014380cbd17d1edfb5ab01a41b3ed701bfac537ac7902d9e4","observation_id":"fefae3bc-8a0e-4453-9ca0-e62891356bb3","resolution":{"observed_at":"2026-08-06T18:40:53.311135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00740","last_updated":"2025-03-02T05:35:57Z","snapshot_observed_at":"2026-08-07T17:36:25.487837Z","submitted_at":"2025-03-02T05:35:57Z","title":"FaceShot: Bring Any Character into Life","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00740","snapshot_observed_at":"2026-08-06T18:40:53.394152Z","title":"Faceshot: Bring any character into life","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.394152Z"},"links":{"cited_paper":"/paper/2503.00740","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:1f336b442a1ef14968ecbdc1613615440aa2a5fd2128b7ad8d9ea6e228665226","observation_id":"e3188f16-bc79-4f29-aabe-9843ffcda28f","resolution":{"observed_at":"2026-08-06T18:40:53.394152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04403","last_updated":"2023-12-07T16:16:50Z","snapshot_observed_at":"2026-08-02T17:13:23.195883Z","submitted_at":"2023-12-07T16:16:50Z","title":"OT-Attack: Enhancing Adversarial Transferability of Vision-Language Models via Optimal Transport Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04403","snapshot_observed_at":"2026-08-06T18:40:53.470204Z","title":"Ot-attack: Enhancing adversarial transferability of vision-language models via optimal trans- port optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.470204Z"},"links":{"cited_paper":"/paper/2312.04403","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:8acd9b8996b492118fb91f10da8382703ec351a3b5f79be2144eba8d9cf8901d","observation_id":"b983c199-f9c3-4990-a2f9-4c7706473495","resolution":{"observed_at":"2026-08-06T18:40:53.470204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.807253Z","title":"Instruct-reid: A multi-purpose person re-identification task with instructions","venue":null,"work_id":"16d0cfe9-58fd-4d8e-b4fe-3891330fcd05","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.556653Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:2ccca8223800202e51910419601f0700eaa8d0bb7ff69189f4a93b3e64bd3e3f","observation_id":"fd5eb1e8-d046-4977-91f4-fd5532a5a8fe","resolution":{"observed_at":"2026-08-06T18:41:02.955618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12693","last_updated":"2024-03-19T12:51:39Z","snapshot_observed_at":"2026-08-06T11:14:06.049414Z","submitted_at":"2024-03-19T12:51:39Z","title":"As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12693","snapshot_observed_at":"2026-08-06T18:40:53.632624Z","title":"As firm as their foundations: Can open-sourced foundation models be used to create adver- sarial examples for downstream tasks? arXiv preprint arXiv:2403.12693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.632624Z"},"links":{"cited_paper":"/paper/2403.12693","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:55820a919c0fa029f3257fb7a6cee58faba8bcf0da5475ba86d561af7513985d","observation_id":"baaba23d-1ee4-4601-b239-46fea2c9df48","resolution":{"observed_at":"2026-08-06T18:40:53.632624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15544","last_updated":"2024-12-20T04:08:11Z","snapshot_observed_at":"2026-08-06T17:28:05.501969Z","submitted_at":"2024-12-20T04:08:11Z","title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15544","snapshot_observed_at":"2026-08-06T18:40:53.704274Z","title":"Vlm-rl: A unified vision language models and reinforcement learning framework for safe autonomous driv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.704274Z"},"links":{"cited_paper":"/paper/2412.15544","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:d10ccd143324aa41050050bfba62a8987a72b9ee4eb4bd8a15fe96acb9eacb78","observation_id":"eb5915ce-7eb7-47b9-893a-10c4cb984cb7","resolution":{"observed_at":"2026-08-06T18:40:53.704274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.613338Z","title":"You only learn one query: learning unified human query for single-stage multi-person multi-task human-centric perception","venue":null,"work_id":"23aa49ae-a113-44cd-957d-d5b684540cdb","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.776057Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:8ca29af48b511d6831f6ce3076ea81e5f3ccaf3a0e5997532be034f806026b0c","observation_id":"bfcfadd7-574e-45d0-a21b-af7f46ff028e","resolution":{"observed_at":"2026-08-06T18:41:02.740204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.447270Z","title":"Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":"c4768227-cd92-4037-9fee-2e4687eb7ce9","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.878374Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:51614d323881c5a981d301bc77f7dbe8f42eba9a6add0fd07335ade2c8116460","observation_id":"e1c1d7c0-ed12-495c-8cb9-19780b58d9e0","resolution":{"observed_at":"2026-08-06T18:41:02.509060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:53.988758Z","title":"Lawrence Zitnick, and Piotr Doll ´ar","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:53.988758Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:a4589c53f903472b54e44f77eb951670cfbae626cdb698be71a55bc26e77c3c1","observation_id":"12d9eb59-564e-43c8-88cb-21505bd9f301","resolution":{"observed_at":"2026-08-06T18:40:53.988758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07403","last_updated":"2024-07-12T03:58:05Z","snapshot_observed_at":"2026-08-07T09:29:22.417640Z","submitted_at":"2024-07-10T06:57:58Z","title":"A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07403","snapshot_observed_at":"2026-08-06T18:40:54.067388Z","title":"A survey of attacks on large vision- language models: Resources, advances, and future trends","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.067388Z"},"links":{"cited_paper":"/paper/2407.07403","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:6bc9c1e381757b0c0132e36c6fbd31d2ee41d5975dd602a95d0f07615bffd216","observation_id":"ed8edf02-b147-4fc6-ac77-8a5a5de05570","resolution":{"observed_at":"2026-08-06T18:40:54.067388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:54.203313Z","title":"Set-level guidance at- tack: Boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.203313Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:3cc2238804c1ac8ec0133fe326777cd661075842942907f99135352e58fea675","observation_id":"cc66f181-7a58-465f-bf25-f3f01a85b8d3","resolution":{"observed_at":"2026-08-06T18:40:54.203313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.189811Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":"01f5d64f-46bd-4ea9-83f7-83a9b8474efd","year":2022},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.308813Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:0b2d2416763c120c94982b5f137e3baeb4b254633916755a5c2c4d24ffc7390c","observation_id":"cdffc7f7-40e6-4887-8555-98cfcf71faa1","resolution":{"observed_at":"2026-08-06T18:41:02.280919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:02.002273Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"f010b7ac-a38b-400d-beca-9582dfa6e553","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.390615Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:fde48471b30ddebe7b2ccea19c9bbc48acc2d7ca51830931d028528f6b577de3","observation_id":"36eb2baa-6703-4f23-9aaf-38290c0bc1c8","resolution":{"observed_at":"2026-08-06T18:41:02.078187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.803833Z","title":"Time-aware and task-transferable adversarial attack for perception of autonomous vehicles.Pattern Recog- nition Letters, 178:145–152, 2024","venue":null,"work_id":"f6766f88-c248-4e0f-b936-f71330b6c734","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.511151Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:6a22f479adcc4c7e00796e25564574cf0efaf4bea50bb69dd6e436f68642db9e","observation_id":"cb1146a3-bd8d-4fcf-ac0c-9d57208023e3","resolution":{"observed_at":"2026-08-06T18:41:01.886473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09766","last_updated":"2024-03-14T17:59:35Z","snapshot_observed_at":"2026-08-06T02:47:52.285574Z","submitted_at":"2024-03-14T17:59:35Z","title":"An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09766","snapshot_observed_at":"2026-08-06T18:40:54.618030Z","title":"An image is worth 1000 lies: Adversarial transferability across prompts on vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.618030Z"},"links":{"cited_paper":"/paper/2403.09766","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:070bcaf057de81928cdf7b534ae51cd02fa4fa5bbb9a0e329d1bfd11953a46e7","observation_id":"37e12be3-0ec8-48d6-967f-f8e319d40979","resolution":{"observed_at":"2026-08-06T18:40:54.618030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14265","last_updated":"2023-11-05T14:07:04Z","snapshot_observed_at":"2026-07-06T16:36:43.251096Z","submitted_at":"2023-10-22T11:00:04Z","title":"CT-GAT: Cross-Task Generative Adversarial Attack based on Transferability","version":2},"cited_work":{"arxiv_id":"2310.14265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14265","snapshot_observed_at":"2026-08-06T18:40:58.120744Z","title":"CT-GAT: Cross-Task Generative Adversarial Attack based on Transferability","venue":"cs.CL","work_id":"445039ae-9fe7-40ab-8f0e-067b77818c42","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.699299Z"},"links":{"cited_paper":"/paper/2310.14265","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:c31aa0af3acd2acaedc1d3b608ab2de2e23d0d5d67f1e638f85f352139106856","observation_id":"cf0976d6-02f5-44b1-b7f0-12e3af5c7c5f","resolution":{"observed_at":"2026-08-06T18:40:58.228144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05402","last_updated":"2023-04-11T11:43:57Z","snapshot_observed_at":"2026-07-06T15:14:32.823996Z","submitted_at":"2023-04-11T11:43:57Z","title":"Boosting Cross-task Transferability of Adversarial Patches with Visual Relations","version":1},"cited_work":{"arxiv_id":"2304.05402","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.05402","snapshot_observed_at":"2026-08-06T18:40:57.942987Z","title":"Boosting Cross-task Transferability of Adversarial Patches with Visual Relations","venue":"cs.CV","work_id":"db06e641-a060-4342-b146-a59fab3e26e0","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.786962Z"},"links":{"cited_paper":"/paper/2304.05402","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:4507560df1b5f033a80cb3fcbfcdd11864d3e941fcd814ce3e4008a04f827c79","observation_id":"ba9e5470-1587-4edc-8dd0-e37d450d6e72","resolution":{"observed_at":"2026-08-06T18:40:58.008920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-06T18:40:54.870153Z","title":"Towards deep learn- ing models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.870153Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:c7595d50af9d5fb850297045f5890c18fef514a4ad474d4db21f3e0a4c107029","observation_id":"7cf09c22-42a0-4e37-a66f-1df952a4045c","resolution":{"observed_at":"2026-08-06T18:40:54.870153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.463644Z","title":"Pick-object-attack: Type-specific adver- sarial attack for object detection","venue":null,"work_id":"8aca882c-1938-419f-9322-427d419b837b","year":2021},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:54.940972Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:da27590c2d56c26f4ed15dfad5e751f3d224c24fb2938a76049d28ea9422279e","observation_id":"e52c3ca0-5ef8-4b6e-9c1a-7882d9d7e190","resolution":{"observed_at":"2026-08-06T18:41:01.680509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:55.065487Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.065487Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:5ddf8ff914b33054fa83bcc6016b45b6897199269e34db652de1e856639c36f4","observation_id":"6210a3bf-b9ab-474a-afd8-9f081f7babf3","resolution":{"observed_at":"2026-08-06T18:40:55.065487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.316583Z","title":"On the adversarial robustness of multi-modal foundation models","venue":null,"work_id":"133338f4-2d92-4481-947c-6a09d0e298df","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.148813Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:b1032cd79156cb7311b36fc690e3cad9ff855fc9c0c75fe630a22e7ed70090c4","observation_id":"690ee877-f126-4ae8-a2e4-30c805c78141","resolution":{"observed_at":"2026-08-06T18:41:01.372958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:01.180424Z","title":"Unival: Unified model for image, video, au- dio and language tasks","venue":null,"work_id":"3018b7d9-933c-4b64-8442-68d4a1b49379","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.209927Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:b861d51431744fec18591342113c1c2273499ce5f6e44c118f75cf131102e786","observation_id":"3d7d6066-fd24-45ac-8c83-4a4e5f8b3755","resolution":{"observed_at":"2026-08-06T18:41:01.242798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16101","last_updated":"2023-11-27T18:59:42Z","snapshot_observed_at":"2026-08-08T00:07:32.122707Z","submitted_at":"2023-11-27T18:59:42Z","title":"How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16101","snapshot_observed_at":"2026-08-06T18:40:55.324196Z","title":"How many unicorns are in this im- age? a safety evaluation benchmark for vision llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.324196Z"},"links":{"cited_paper":"/paper/2311.16101","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:89d532bdc6a02246839a8771e204651807a9f21c4f80d4c4b7b49887f624f68a","observation_id":"ed55307c-ca35-43ce-8faf-54be1420f9b4","resolution":{"observed_at":"2026-08-06T18:40:55.324196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10499","last_updated":"2024-03-15T17:33:49Z","snapshot_observed_at":"2026-07-06T17:45:23.748539Z","submitted_at":"2024-03-15T17:33:49Z","title":"Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study","version":1},"cited_work":{"arxiv_id":"2403.10499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.10499","snapshot_observed_at":"2026-08-06T18:40:57.733557Z","title":"Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study","venue":"cs.LG","work_id":"897c7449-0f4a-497c-bed1-5990e774cc8d","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.433668Z"},"links":{"cited_paper":"/paper/2403.10499","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:ce8bc3aea21cc7e5158007f3582ba8d4b47ae24c75c9f2cf328f517d162df9df","observation_id":"66b395ff-f43f-4caf-9df5-2b2d593ffe5a","resolution":{"observed_at":"2026-08-06T18:40:57.847447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.899499Z","title":"Trans- ferable multimodal attack on vision-language pre-training models","venue":null,"work_id":"b33171e4-37b5-4a37-9f60-3f00b522452a","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.534894Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:df5036f56dbb4148b56cc9c1b5019daaecd7399d12d2540ce671d8e48d4399f9","observation_id":"975aab70-7a35-4614-acaa-9826b4a493fb","resolution":{"observed_at":"2026-08-06T18:41:01.051120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.643736Z","title":"Psat-gan: Efficient adversarial attacks against holistic scene understanding","venue":null,"work_id":"b1c70519-3b63-42af-bf05-3d093ead1fce","year":2021},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.656008Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:dc94c0341ec0af73699f71ba62b7f5bbf0684f1f79358645ffcf25fad632d3ba","observation_id":"62d80cd7-bb56-45f7-91ea-ec1acf13d2b4","resolution":{"observed_at":"2026-08-06T18:41:00.765996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.393847Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"d7621688-5eee-46a9-a8bb-9b94193e9588","year":2022},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.760958Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:2cee44e95dadbaaff2b4d11e30459c6b173989e4c4945a11b5ee55a05bbdbac0","observation_id":"333a1558-1b7f-4999-a79b-0d5bc920c63d","resolution":{"observed_at":"2026-08-06T18:41:00.517543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.139643Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"cb878455-cb8d-4a1e-b775-38220b8a89fc","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:55.899615Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:d0506d0db94ec76ec6e18ad481ae359b721c25a7fcf97ce20d81b638bfc8ee2b","observation_id":"6d531dda-82d0-47a8-8c3f-e904bbc6a45a","resolution":{"observed_at":"2026-08-06T18:41:00.237652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:41:00.006133Z","title":"Highly transferable diffusion- based unrestricted adversarial attack on pre-trained vision- language models","venue":null,"work_id":"16b4b895-625b-46d7-95df-cd30950d5292","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.012068Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:ca814c63049fef74bc08fb46145d6feb7ba33ec8420721bbb266f1550f0cb3b7","observation_id":"f2cb06d3-c0d4-4321-a064-1f723a32706b","resolution":{"observed_at":"2026-08-06T18:41:00.055108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.905693Z","title":"Cross-task attack: A self-supervision generative framework based on attention shift","venue":null,"work_id":"b74d8458-357c-409b-b0b1-a369890fe83e","year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.142027Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:2cff69f3bdf01984ba083c0103e96e5b9fbe5a818c171b0b2f7ed673092943cb","observation_id":"84623cfd-f757-4cda-96d5-36829323f5cc","resolution":{"observed_at":"2026-08-06T18:40:59.957900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.759857Z","title":"X 2-vlm: All-in-one pre- trained model for vision-language tasks","venue":null,"work_id":"4c7820f6-821f-4dca-a6f9-7231f9f82c60","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.263245Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:8abc523eb4d541b3c10f35e1750bd5653f69370789da780200c050655527aeca","observation_id":"5429ed14-2dde-4b16-a62b-7f8d50e38193","resolution":{"observed_at":"2026-08-06T18:40:59.832721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05346","last_updated":"2025-03-28T02:55:23Z","snapshot_observed_at":"2026-08-02T11:44:11.377758Z","submitted_at":"2024-10-07T09:45:18Z","title":"AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05346","snapshot_observed_at":"2026-08-06T18:40:56.361825Z","title":"Anyattack: Towards large-scale self-supervised generation of targeted adversar- ial examples for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.361825Z"},"links":{"cited_paper":"/paper/2410.05346","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:b3fa00163641840b0b1064205eb2f2036c9ef49767caa415619d110e0354abed","observation_id":"8a8dffec-ce67-4e58-a44e-82eece6136dc","resolution":{"observed_at":"2026-08-06T18:40:56.361825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.623328Z","title":"Boosting cross-task ad- versarial attack with random blur","venue":null,"work_id":"944b4cad-41e0-4d50-9392-12f6c97c83d5","year":2022},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.508031Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:f6528d1eb32af6576b8257ee448d55074a3abb27c82226f01d4cb137f9321603","observation_id":"b780a49f-a376-415a-8917-7617f7da2731","resolution":{"observed_at":"2026-08-06T18:40:59.685449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07057","last_updated":"2024-12-06T14:21:06Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T08:38:13Z","title":"MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07057","snapshot_observed_at":"2026-08-06T18:40:56.640539Z","title":"Benchmarking trustworthiness of multi- modal large language models: A comprehensive study.arXiv preprint arXiv:2406.07057, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.640539Z"},"links":{"cited_paper":"/paper/2406.07057","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:c958216a566fb8d895465cbb4feddbe275f8e6c2b9a20046f41e10b426a63277","observation_id":"725e31c0-b536-4742-97ad-0493024588b4","resolution":{"observed_at":"2026-08-06T18:40:56.640539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.474875Z","title":"On evalu- ating adversarial robustness of large vision-language mod- els","venue":null,"work_id":"1cd2228e-c966-4bd8-a644-869751ba837d","year":2023},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.749887Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:c3ef041f6c0a4b9046038cc776784d1fda0a1456f4ce71e85940c2b56f509bae","observation_id":"ae77c430-515f-4bf9-91e3-5f0fe51a8cea","resolution":{"observed_at":"2026-08-06T18:40:59.526994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15244","last_updated":"2024-05-28T00:33:16Z","snapshot_observed_at":"2026-07-06T18:19:08.871953Z","submitted_at":"2024-05-24T06:11:30Z","title":"Adversarial Attacks on Hidden Tasks in Multi-Task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15244","snapshot_observed_at":"2026-08-06T18:40:56.852843Z","title":"Adversarial attacks on hidden tasks in multi- task learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.852843Z"},"links":{"cited_paper":"/paper/2405.15244","citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:c220a538eee3128aaf177eeb1e746e0944f6dd787db86fd90c2ed2dfbd0ac968","observation_id":"753e6600-fc65-4ec5-9215-345b6ed9fb67","resolution":{"observed_at":"2026-08-06T18:40:56.852843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.358315Z","title":"[SOURCE_CATEGORY]","venue":null,"work_id":"359bad3f-e246-404c-96ce-2b3b82c5702f","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:56.975872Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:957948229e352cbab1690f24eb0dfc849e3ce287e525743b6e2f14cb33b3d576","observation_id":"882c643c-6fa5-4204-aad1-d9350f8dea7a","resolution":{"observed_at":"2026-08-06T18:40:59.397624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.205021Z","title":"[SOURCE_CATEGORY]","venue":null,"work_id":"43116b71-147c-4ac1-8708-07ddaeb2e13d","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.093661Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:ac9581a7746e5ae57f858b292174b71cbe718436c4d8e34b7bf5da7f83f590fb","observation_id":"95d8fee4-d11c-46c8-8f4a-d1fd636aa1fe","resolution":{"observed_at":"2026-08-06T18:40:59.265668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:59.025801Z","title":"The procedure begins by initializing the adversar- ial example and locating the token indices corresponding to the source object region","venue":null,"work_id":"84fd23a0-5918-4ace-83b3-1f80120b66a4","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.193508Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:21b089d1a7764f1168799bc838c3b83b683572b768cd1cd6a7aa9c48c2d3dbbe","observation_id":"d581e584-df30-462d-9b0a-871592095111","resolution":{"observed_at":"2026-08-06T18:40:59.135566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:58.826819Z","title":"Implementation Details of Compared Methods We provide detailed implementation information for all compared methods to ensure reproducibility and fair com- parison","venue":null,"work_id":"229560a8-2fe5-4383-a812-8cb93e84ff04","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.300862Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:035d60bf7b01e97b98087c8f6860f3b79f1388129896bced669a71a7961ad490","observation_id":"a5b59517-f6a5-401b-933d-d79d79e7f70b","resolution":{"observed_at":"2026-08-06T18:40:58.931303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:58.640307Z","title":null,"venue":null,"work_id":"3d413d5f-5523-40af-8fbe-c066084c5fb2","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.388236Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:c002c93064d16f1c81d7774f3f35d62b394d0c2a1c223f8f56ff02a790a0cc78","observation_id":"cbac4c34-80d3-46fc-b9fd-8365fcdcd007","resolution":{"observed_at":"2026-08-06T18:40:58.728434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:40:58.475333Z","title":"Comparison with object detection attack baselines on Florence-2","venue":null,"work_id":"6e9dfc53-84df-40b7-9b3d-77adfbb1590a","year":null},"citing_paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:57.522269Z"},"links":{"citing_paper":"/paper/2507.07709"},"observation_digest":"sha256:b87b03d92391ca8f7340fe611c79a6ca334c9c5e72e1bac188eb1e466515c6e2","observation_id":"139d7a7e-d3f2-43d7-b244-930bae5cba33","resolution":{"observed_at":"2026-08-06T18:40:58.530056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07709","last_updated":"2025-07-10T12:40:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:07:42.743533Z","submitted_at":"2025-07-10T12:40:34Z","title":"One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":29},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2507.07709."}