{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0feeadd6d01c996596a86784dc80356a33d55ca10356c6d0d4b6669a59d595d1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:45:18.216185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:45:49.583188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T19:45:18.216185Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:18.216185Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:18638ccf897ad98618c2ebc3dab3286af1643482c891aeb73868361982eba0f0","observation_id":"a3729146-d713-4eb7-8004-9220fe90bc84","resolution":{"observed_at":"2026-08-07T19:45:18.216185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T13:22:00.577809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.577809Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:fdf4479501c9998d822c1d62a9acc072ec0d37baf46737a1ff90cc5b929d4b4d","observation_id":"71c06227-c851-4b21-a88d-dc330c50fe68","resolution":{"observed_at":"2026-08-07T13:22:00.577809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T12:37:20.634917Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time.arXiv preprint arXiv:2410.06625,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-08T01:25:52.362186Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.634917Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:ccfcc669e4a96594656c05497120ed8a9118ca54e37c3d3c39c362281e240071","observation_id":"10490e61-fe9e-4378-8a94-1dcea2e4c117","resolution":{"observed_at":"2026-08-07T12:37:20.634917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T12:35:26.553538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24519","last_updated":"2025-05-30T12:30:50Z","snapshot_observed_at":"2026-08-07T12:17:21.702915Z","submitted_at":"2025-05-30T12:30:50Z","title":"AMIA: Automatic Masking and Joint Intention Analysis Makes LVLMs Robust Jailbreak Defenders","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:26.553538Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2505.24519"},"observation_digest":"sha256:f7d511d7163f813dc39f9ec46d3efb28e5b55da87df3705c195cc2e645a11359","observation_id":"71bdcb01-8904-4e8f-96c7-830263e41da1","resolution":{"observed_at":"2026-08-07T12:35:26.553538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T05:53:58.538546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06729","last_updated":"2025-06-07T09:27:26Z","snapshot_observed_at":"2026-08-07T05:48:30.660932Z","submitted_at":"2025-06-07T09:27:26Z","title":"Mitigating Object Hallucination via Robust Local Perception Search","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:53:58.538546Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2506.06729"},"observation_digest":"sha256:0dc333c16b94e14fd0efa328b670d044df847484a74f819b2cceca0659aa02f9","observation_id":"d39f1b4b-062a-4184-b81e-7ed8a721595d","resolution":{"observed_at":"2026-08-07T05:53:58.538546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-06T17:21:35.186888Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-06T17:12:51.246126Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.186888Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:e8bc93b38fe34e677664b06e46891f1ad4d0f2186ba0cf7e1b2d64243329aeeb","observation_id":"46b7d000-77e8-41a7-a883-caccc8755ba0","resolution":{"observed_at":"2026-08-06T17:21:35.186888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-05T21:18:39.389808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09016","last_updated":"2025-09-10T05:08:47Z","snapshot_observed_at":"2026-08-05T21:18:35.909741Z","submitted_at":"2025-08-12T15:30:44Z","title":"A Survey on Training-free Alignment of Large Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:18:39.389808Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2508.09016"},"observation_digest":"sha256:01c6039e15c57674f6f133a5cda8d34d256eb6ce4ed5dbaf8b3e1c575971e03e","observation_id":"101c3ec7-e871-4ef9-a72e-30496f0e8a9b","resolution":{"observed_at":"2026-08-05T21:18:39.389808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-05T20:29:07.659178Z","title":"Ding et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-07T18:23:08.889281Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:07.659178Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:fc65ed317d69fe456e2bdbdfec9060bf204ad1e741b2ce83de33d3b61c3b954a","observation_id":"9044901f-3b95-4c4e-9c8d-d5160c9003fa","resolution":{"observed_at":"2026-08-05T20:29:07.659178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-04T09:47:23.180246Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time.arXiv preprint arXiv:2410.06625,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.13698","last_updated":"2026-07-14T06:18:50Z","snapshot_observed_at":"2026-08-07T12:08:13.873562Z","submitted_at":"2025-10-15T15:57:17Z","title":"Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment","version":4},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-04T09:47:23.180246Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2510.13698"},"observation_digest":"sha256:8799a26d76d538f51a3f961d6db3858cdedea8ca1ad2d3134c4996e38f46b43f","observation_id":"34f8e112-816e-4c98-81cb-ba0ce7dd8714","resolution":{"observed_at":"2026-08-04T09:47:23.180246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":"2410.06625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-07-01T14:45:49.583188Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time.arXiv preprint arXiv:2410.06625, 2024","venue":null,"work_id":"de5aa873-6232-481c-b939-4d74eed64a31","year":2024},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:34.909229Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:f98e5a1781057830d4b551488a5619b5676d1c2851de0125c7859404990ce557","observation_id":"cbfed91c-c0b4-4291-8d23-bcd3a87acbb2","resolution":{"observed_at":"2026-05-11T05:20:57.958576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-02T16:34:02.952337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T16:34:02.952337Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:1308cba9203282bcf483b28023090fb77bd6c514e0bc914997b566917763a414","observation_id":"fca7e6c5-d50e-4c32-8ea1-84d9756bbc11","resolution":{"observed_at":"2026-08-02T16:34:02.952337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":"2410.06625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-07-01T14:45:49.583188Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time.arXiv preprint arXiv:2410.06625, 2024","venue":null,"work_id":"de5aa873-6232-481c-b939-4d74eed64a31","year":2024},"citing_paper":{"arxiv_id":"2605.15030","last_updated":"2026-05-14T16:26:27Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:26:27Z","title":"WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T20:16:13.413064Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2605.15030"},"observation_digest":"sha256:38fbfbd4ed6c4b63086eadf343c07d0a11c8f44e1831fd3f58bfe161ee31187d","observation_id":"64bfa40e-666f-40c4-b59f-b8a0e6938496","resolution":{"observed_at":"2026-07-01T14:45:49.584717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-01T13:10:37.290149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.290149Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:e49600749d02054012a7ca18d2abb13764fe59e9408328c3a0c20727c60a6bc4","observation_id":"55077588-5b9a-4486-83d6-82cb93ab2013","resolution":{"observed_at":"2026-08-01T13:10:37.290149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-07-31T23:07:40.056533Z","title":"arXiv preprint arXiv:2410.06625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27917","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-07T15:15:58.184585Z","submitted_at":"2026-07-30T09:30:03Z","title":"One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T23:07:40.056533Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2607.27917"},"observation_digest":"sha256:44f596fbc64c578180590a31f3fd9ba64ebafc654c44f98f488eeac99c7471db","observation_id":"27035e5d-4456-46c9-8155-230aefb14533","resolution":{"observed_at":"2026-07-31T23:07:40.056533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.06625/citation-record","integrity":"/paper/2410.06625/integrity","json":"/paper/2410.06625/citation-record.json","paper":"/paper/2410.06625"},"outbound":[],"paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2410.06625."}