{"as_of":"2026-08-09T08:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa9ce2b80239f9762a9252ff8431669e4ef926f41c1bf99b18099fa6e061a983","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:06:39.050277Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04643/citation-record","integrity":"/paper/2502.04643/integrity","json":"/paper/2502.04643/citation-record.json","paper":"/paper/2502.04643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.786466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.786466Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:76dbcf96faa6c6c6dcb107716a2d574c15add7d9f1658e861fbe74115b14edad","observation_id":"b06ff1ef-cc73-47e3-bf4c-128628083815","resolution":{"observed_at":"2026-08-08T22:06:38.786466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.876117Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Pang Wei W Koh, Daphne Ippolito, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":"592401ac-6b4d-4e30-be68-2e9ad914bd34","year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.790888Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:32df7830a20030ecca85d47a384d3d901b11a8ae2a7ec00e5a83e80b651c1f76","observation_id":"9d78a881-b929-4b82-b8f6-6469f15a48ef","resolution":{"observed_at":"2026-08-08T22:07:24.879718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-07-06T06:30:55.970076Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-08T22:06:38.795141Z","title":"Universal sentence encoder","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.795141Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:e4e11553c4c07b1168970cbc7a2e35b549ade9893515e07bda4602b333bf2e2d","observation_id":"13509d42-e3dc-46ba-a3a4-e80328a353ef","resolution":{"observed_at":"2026-08-08T22:06:38.795141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.799248Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.799248Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:0bcecd131511f333b425ad7b5afb1e8e4e67f1da4ba9cf6c6b36ca9d7fdb295b","observation_id":"6f5518d8-9e12-4b3c-ab47-27144f0e0c99","resolution":{"observed_at":"2026-08-08T22:06:38.799248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12180","last_updated":"2024-09-18T17:52:53Z","snapshot_observed_at":"2026-07-06T19:17:46.809272Z","submitted_at":"2024-09-18T17:52:53Z","title":"Finetuning Language Models to Emit Linguistic Expressions of Uncertainty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12180","snapshot_observed_at":"2026-08-08T22:06:38.802830Z","title":"Finetuning language models to emit linguistic expressions of uncertainty, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.802830Z"},"links":{"cited_paper":"/paper/2409.12180","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:eb076e6ed5afdd9854032fed081bc386865bb1506b2ceca076b6683febc25e8f","observation_id":"698754f5-71db-40fe-9147-92c75dbee5aa","resolution":{"observed_at":"2026-08-08T22:06:38.802830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.806757Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.806757Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:be3227e247236c92b11960a3ef6de0bbb3b1bf61bb49fd7f8df67df91e04cc99","observation_id":"f747824e-f6cf-402f-841d-310002afad40","resolution":{"observed_at":"2026-08-08T22:06:38.806757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.857729Z","title":"Towards robustness against natural language word substitutions","venue":null,"work_id":"b186cc11-baff-43c7-aad2-424e96b4fc20","year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.810657Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:771918b61437e180d4db6b453546865b185358ef0afe52e179a1244cedf869e3","observation_id":"0105b3d3-142b-445d-940d-862a4c6102c8","resolution":{"observed_at":"2026-08-08T22:07:24.861734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13541","last_updated":"2021-07-28T17:55:08Z","snapshot_observed_at":"2026-07-06T11:33:25.933445Z","submitted_at":"2021-07-28T17:55:08Z","title":"Towards Robustness Against Natural Language Word Substitutions","version":1},"cited_work":{"arxiv_id":"2107.13541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.13541","snapshot_observed_at":"2026-08-08T22:07:24.570867Z","title":"Towards Robustness Against Natural Language Word Substitutions","venue":"cs.CL","work_id":"f122cd91-7e9b-4c8c-8ed1-4fc8c1198d6a","year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.814057Z"},"links":{"cited_paper":"/paper/2107.13541","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4d67399a468c1ee4fade8554a6c6730765e4e6c61f403166358b68c69a283bf9","observation_id":"ff964c0e-4dec-4fd9-8d9e-96eef66c61f7","resolution":{"observed_at":"2026-08-08T22:07:24.575044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.817712Z","title":"H ot F lip: White-box adversarial examples for text classification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.817712Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:8aae67ac1bfebeb48f5b182e7ca35e65f36477844d3c07e31d2e7d31e627f506","observation_id":"557450ae-0a2c-4b93-b625-7500fe980c65","resolution":{"observed_at":"2026-08-08T22:06:38.817712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.847249Z","title":"o zde G \\","venue":null,"work_id":"aa0a24a8-699d-4fdf-9898-1e7103f98f67","year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.821288Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ebc7b172d9c62566436f216591cf079dafb3f7d9c8b3231617e5aa9423761144","observation_id":"1878716a-2ee4-41ab-85b1-e5a46d1f514b","resolution":{"observed_at":"2026-08-08T22:07:24.850770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.824941Z","title":"Special symbol attacks on nlp systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.824941Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7e02c07c4d85888b9825861b10d15c4ca51a19e089cfb23b18d9d080b5152da9","observation_id":"faaf7918-2760-45d2-875d-41120c98f2c1","resolution":{"observed_at":"2026-08-08T22:06:38.824941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-eacl.1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.239830Z","title":"Using punctuation as an adversarial attack on deep learning-based NLP systems: An empirical study","venue":null,"work_id":"88be5f3a-19a6-41b3-93b8-c539db485c30","year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.828361Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:bd499d35829dc74674e9cddd30a45f925cca19f4c074881b16a6f17a5c9d9522","observation_id":"79102f9c-7e52-4b15-b45c-47f1a5845976","resolution":{"observed_at":"2026-08-08T22:06:39.243622Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.443","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.836031Z","title":"S em R o D e: Macro adversarial training to learn representations that are robust to word-level attacks","venue":null,"work_id":"4ce952bf-75d6-4a58-8c61-c7a0371f25bd","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.831769Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:9d99aa75bc4c91958a88080474125e07a0503aeef019a90bdd3ff5d5b26dbc14","observation_id":"554d9ae5-9e89-4a8d-8989-a237fb7c291d","resolution":{"observed_at":"2026-08-08T22:07:24.840072Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.835312Z","title":"Reasoning robustness of LLM s to adversarial typographical errors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.835312Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:056cdebd81b49a8c80a5dfdf226782547c94a99fcf35f07c010cf0de70d7f147","observation_id":"651766c1-64e2-4ee2-a943-b1632ffd0f2a","resolution":{"observed_at":"2026-08-08T22:06:38.835312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1610","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.222047Z","title":"Improving the robustness of question answering systems to question paraphrasing","venue":null,"work_id":"48caa52b-78c2-406c-947a-a19718e8e8f7","year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.838746Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:90bd958345d37296f1d726734cd22487e734279505abeae6c5a62ee9ba1fc18f","observation_id":"318cd17a-cb4b-4cbd-8a52-24675324cfeb","resolution":{"observed_at":"2026-08-08T22:06:39.225930Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.841995Z","title":"Did Aristotle Use a Laptop? A Question Answering Benchmark with Implicit Reasoning Strategies","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.841995Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:6ac1a14722204cff583f9dc93c091e27aab9690c360aab90f05a91c92cf86ec1","observation_id":"1a62c797-d0f2-4036-abc4-36d2fa0c4b57","resolution":{"observed_at":"2026-08-08T22:06:38.841995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.826291Z","title":"Buelow, Rupert Langer, Bastian Dislich, Peter Boor, Volkmar Schulz, and Jakob Nikolas Kather","venue":null,"work_id":"4d72ed42-0aef-4514-9fba-3227833c7774","year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.845472Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ec86281bdd21196c540899021011cfa62137aa3272e971b8e43c8cacf6af7251","observation_id":"f6a6f372-b76c-4e68-816c-a5f989fc19be","resolution":{"observed_at":"2026-08-08T22:07:24.829538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-08T22:06:38.848950Z","title":"Goodfellow, Jonathon Shlens, and Christian Szegedy","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.848950Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:396709e3cf85c1ef1d042f71ff4f94872db743f56cc25bf3fcc45149a8f3debe","observation_id":"4bc83bd7-03db-49b4-bc60-21748889d076","resolution":{"observed_at":"2026-08-08T22:06:38.848950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.817462Z","title":"Weinberger","venue":null,"work_id":"c02420df-1561-4ba1-ac9f-89a6aea5e854","year":2017},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.853079Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:a101cd7f01d26fe0195844edcf303bb7247cdbc76139bb0a93849be0431939d3","observation_id":"67c9e2f2-fe89-4d1e-aafe-f34da834eaab","resolution":{"observed_at":"2026-08-08T22:07:24.820356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.808025Z","title":"Weinberger","venue":null,"work_id":"0830130c-df71-4741-8529-86827f1b14e9","year":2017},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.856702Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:1c3e67358a0f7f0bb69463b33f924a00f8cc97e20cb3c7628ec28b22612448a8","observation_id":"23e68a1c-ffa6-40a4-bc1c-a6b263fae991","resolution":{"observed_at":"2026-08-08T22:07:24.811122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-08T22:06:38.860489Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.860489Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:da90335c2cfce7f7321533c9e7ab4c1b4506e764c57e6a7cc5ca3e1c42b3a913","observation_id":"186e16d7-425a-4409-b80b-e489ede6ae96","resolution":{"observed_at":"2026-08-08T22:06:38.860489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.864286Z","title":"Adversarial example generation with syntactically controlled paraphrase networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.864286Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:0989dd978d58ef9efb565145e928db5d49891375d0b44c9ae5735fdf8bc08ada","observation_id":"74b954e2-70f9-4fe4-8811-2180b2b28597","resolution":{"observed_at":"2026-08-08T22:06:38.864286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13425","last_updated":"2025-02-20T02:24:55Z","snapshot_observed_at":"2026-08-08T10:47:51.541069Z","submitted_at":"2024-04-20T17:19:54Z","title":"Enhancing Adversarial Robustness of Vision-Language Models through Low-Rank Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13425","snapshot_observed_at":"2026-08-08T22:06:38.867893Z","title":"Advlora: Adversarial low-rank adaptation of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.867893Z"},"links":{"cited_paper":"/paper/2404.13425","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:335bd2d6ffe9dac2dc38b3ef3e9203ef491492b20194f6915086b3af83eb267d","observation_id":"647e80db-2238-4247-b5ac-5712ba10c4ae","resolution":{"observed_at":"2026-08-08T22:06:38.867893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.871884Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.871884Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7b7a5f18105a7d03681fa90462fac0278ad5cd2441a03f1fdb51fa5dbaad02e8","observation_id":"a58d39df-2145-446f-9607-a5fde0f7adc7","resolution":{"observed_at":"2026-08-08T22:06:38.871884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.791198Z","title":"How can we know when language models know? on the calibration of language models for question answering, 2021","venue":null,"work_id":"ec99fc80-8ea6-4150-99b9-23394a64830d","year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.875365Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:6e5444087655b032ab39b5a7d4721c5311354c413572ccf6ab16126f73b329b6","observation_id":"bb3c12cf-08a3-4207-8db7-166d8ce8c966","resolution":{"observed_at":"2026-08-08T22:07:24.794848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11932","last_updated":"2020-04-08T23:10:10Z","snapshot_observed_at":"2026-07-06T08:10:40.079646Z","submitted_at":"2019-07-27T15:07:04Z","title":"Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11932","snapshot_observed_at":"2026-08-08T22:06:38.878882Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.878882Z"},"links":{"cited_paper":"/paper/1907.11932","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:226551144181ea6d8695bd6a61683dbb40ebac5230ff0ee101144fcdf20f301d","observation_id":"d6c5a754-7370-4648-884e-ba0ce5eb0735","resolution":{"observed_at":"2026-08-08T22:06:38.878882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.882645Z","title":"T rivia QA : A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.882645Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:63fa0d7116f230a8ec6b2cd62426ebe03badb48cf929819331e8e7942d09107e","observation_id":"a9dbee5e-3d42-4649-9284-433a09178362","resolution":{"observed_at":"2026-08-08T22:06:38.882645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.886231Z","title":"Language models (mostly) know what they know, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.886231Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5e595f86e36d0b3c43b278964faabbaa1281925d5e4c44910f6e2a8701812402","observation_id":"1a369df4-247b-49f8-ba17-be4026cad235","resolution":{"observed_at":"2026-08-08T22:06:38.886231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.02533","last_updated":"2017-02-11T00:39:39Z","snapshot_observed_at":"2026-07-06T05:02:57.607157Z","submitted_at":"2016-07-08T21:12:11Z","title":"Adversarial examples in the physical world","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.02533","snapshot_observed_at":"2026-08-08T22:06:38.889683Z","title":"Adversarial examples in the physical world","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.889683Z"},"links":{"cited_paper":"/paper/1607.02533","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:75b4231e4026fe1ad4d8539c296f780136e0877dfa8bda389960c54883ac7994","observation_id":"aebd11f4-4d22-4b0c-9f9f-f4a8ac384a84","resolution":{"observed_at":"2026-08-08T22:06:38.889683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.893679Z","title":"TextBugger : Generating adversarial text against real-world applications","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.893679Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:914877c43517be84a6caafa277ce1cf5d0d838560990cdac8f94b4291556de7c","observation_id":"3c3f464f-b1e8-4181-9921-8fb557c36dfd","resolution":{"observed_at":"2026-08-08T22:06:38.893679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.897124Z","title":"BERT - ATTACK : Adversarial attack against BERT using BERT","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.897124Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:575f44102eda85a721bce7eb7d03569bcb5266727508d62089289e3681b65070","observation_id":"60f91f8c-2ee1-48d2-b3f0-44a98023b594","resolution":{"observed_at":"2026-08-08T22:06:38.897124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.774371Z","title":"Teaching models to express their uncertainty in words, 2022","venue":null,"work_id":"289329bb-9cd0-45b6-92ec-c0adb01913d4","year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.900822Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5946b893528b6d655c86c836d8bc21dce988d712f2ebcebf2734e7b68c857cfb","observation_id":"539674aa-627c-4674-b010-3dab3568cdc1","resolution":{"observed_at":"2026-08-08T22:07:24.778000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i11.26553","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.183547Z","title":"Sspattack: A simple and sweet paradigm for black-box hard-label textual adversarial attack","venue":null,"work_id":"4fff4976-fbee-4661-9872-826e5d9add5e","year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.904446Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:93ad78a7daf51dd7cae15ab8e1543cc8d3ba6a44ba9f337fdf324f5cebf4ff13","observation_id":"3dbed84e-2b53-4fa3-a8bf-19d53fac7d06","resolution":{"observed_at":"2026-08-08T22:06:39.187299Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15993","last_updated":"2024-10-23T08:33:54Z","snapshot_observed_at":"2026-08-08T05:41:54.254097Z","submitted_at":"2024-04-24T17:10:35Z","title":"Uncertainty Estimation and Quantification for LLMs: A Simple Supervised Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15993","snapshot_observed_at":"2026-08-08T22:06:38.908043Z","title":"Uncertainty estimation and quantification for llms: A simple supervised approach, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.908043Z"},"links":{"cited_paper":"/paper/2404.15993","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5bfe2f2688e1a0b6fc8f14491355b3d921a227af3c0e3339aad047fd640c0c71","observation_id":"6d2cdb81-a076-488c-b72b-0b8d5f0ce0bd","resolution":{"observed_at":"2026-08-08T22:06:38.908043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.763743Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models, 2024 b","venue":null,"work_id":"842771cf-eab6-48d1-950c-21893f82b4ea","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.911862Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:a6d0cc7b6af5db10514fc5a5ee0aad2058f6a1b27c513f6309dc06ffe0345f85","observation_id":"0863056b-d110-442d-911b-973bb4d2c7a9","resolution":{"observed_at":"2026-08-08T22:07:24.767514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-08T22:06:38.915187Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.915187Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f030971307e39fa957f1ebcc2db3c18dbf1e71ff45d3d90d8443354e64563894","observation_id":"fb786464-b4e3-4e5a-9f41-8d8f5ac31202","resolution":{"observed_at":"2026-08-08T22:06:38.915187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.752997Z","title":"At which training stage does code data help LLM s reasoning? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"7c8535f0-f169-4e2f-b4c8-0a2953208dc5","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.918567Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7e4d062476de566f9f9e7cecc472e13e506ef412e66e94be5dd495a2df1d2d2e","observation_id":"de135ef2-6a5a-4b40-939a-a6aca5ecf6ca","resolution":{"observed_at":"2026-08-08T22:07:24.756811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.922029Z","title":"Towards deep learning models resistant to adversarial attacks, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.922029Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:678b248d57ca106d8530ac1f40f1a91f521783aeb037277eb4707dafa648f4c8","observation_id":"ba503021-ae33-4e33-938c-31770087a4ac","resolution":{"observed_at":"2026-08-08T22:06:38.922029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14956","last_updated":"2021-04-29T10:59:14Z","snapshot_observed_at":"2026-08-08T11:12:09.184725Z","submitted_at":"2020-12-29T22:01:38Z","title":"Generating Natural Language Attacks in a Hard Label Black Box Setting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14956","snapshot_observed_at":"2026-08-08T22:06:38.929089Z","title":"Generating natural language attacks in a hard label black box setting","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.929089Z"},"links":{"cited_paper":"/paper/2012.14956","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:d202c9169ae5646182546d4b53737e5e5fb248905d5308c916959186b84597f7","observation_id":"09dbc5ae-324f-42b1-b5ec-8c873be4c4a9","resolution":{"observed_at":"2026-08-08T22:06:38.929089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.736329Z","title":"Tree of attacks: Jailbreaking black-box LLM s automatically","venue":null,"work_id":"db0452c1-a2e2-4b45-a18e-db6f12857ac0","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.932553Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4a91dac65a8911a5700fb6b61af81445be1b676bd2a9fd4a11af82009b4795ee","observation_id":"2165e54e-bd21-48eb-a214-d6044b134154","resolution":{"observed_at":"2026-08-08T22:07:24.739968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05909","last_updated":"2020-10-05T00:10:24Z","snapshot_observed_at":"2026-08-05T07:11:54.244493Z","submitted_at":"2020-04-29T21:33:35Z","title":"TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05909","snapshot_observed_at":"2026-08-08T22:06:38.935952Z","title":"Morris, Eli Lifland, Jin Yong Yoo, Jake Grigsby, Di Jin, and Yanjun Qi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.935952Z"},"links":{"cited_paper":"/paper/2005.05909","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f71f4440026eaaf49991f411a248499269e903e4678f06a5b018525e18ac7c07","observation_id":"ccc52258-f62b-4fa7-84cd-293a857cff19","resolution":{"observed_at":"2026-08-08T22:06:38.935952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.725809Z","title":"Counter-fitting word vectors to linguistic constraints, 2016","venue":null,"work_id":"44f3195c-f0ee-46ed-ace2-b8d84ca7622f","year":2016},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.939857Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f5182330946e0bcaaf8191a504fe3ca4222957bd13a8e3a36bc8f9d57907ac43","observation_id":"d9da8935-d51f-4a9b-a792-c83e8760fea0","resolution":{"observed_at":"2026-08-08T22:07:24.729303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.943199Z","title":"Strength in numbers: Estimating confidence of large language models by prompt agreement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.943199Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f8d3992f8988eadb9ec971808ceb2afbc81203f4d280d2f4b966b2c0de172ae9","observation_id":"99814762-4a55-427c-bb9e-0018b059dc82","resolution":{"observed_at":"2026-08-08T22:06:38.943199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.137","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.161622Z","title":"Extreme miscalibration and the illusion of adversarial robustness","venue":null,"work_id":"72cc5604-d78e-49d8-91d9-e5ee14748909","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.946560Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:9e24695ae62ac2e0645195521f29b6a13d8b0bbb77b708d31d90dcd77583cae0","observation_id":"0b692972-5525-4574-90fd-5ffd3812d1a7","resolution":{"observed_at":"2026-08-08T22:06:39.165669Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.949980Z","title":"Generating natural language adversarial examples through probability weighted word saliency","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.949980Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:652513bb442b47cf0d395340832779225214bf21002806ec8814cf12e29b57b4","observation_id":"fb22cb1e-c1df-40a0-88fb-5a1eecd3561d","resolution":{"observed_at":"2026-08-08T22:06:38.949980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-03T07:26:39.431128Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01833","snapshot_observed_at":"2026-08-08T22:06:38.953361Z","title":"Great, now write an article about that: The crescendo multi-turn llm jailbreak attack, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.953361Z"},"links":{"cited_paper":"/paper/2404.01833","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:89d318270ab35c0cc72daa840ca154e65bee02a0e388eeccfb7661b3ccb3ff50","observation_id":"433787ed-819e-4146-bb6d-81caca8aeef3","resolution":{"observed_at":"2026-08-08T22:06:38.953361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.709842Z","title":"Second-order uncertainty quantification: A distance-based approach","venue":null,"work_id":"999c8dc3-d515-4e39-8cb1-6d106bea577f","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.957004Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:16d7c57703816015f19a26a78a25481ae2d7dfb33f2411a4e3e78a8e8b37f9bf","observation_id":"698caa8c-9494-43b5-a1a5-1b55f3df3fe6","resolution":{"observed_at":"2026-08-08T22:07:24.713315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.960140Z","title":"Large language model uncertainty measurement and calibration for medical diagnosis and treatment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.960140Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:da7f0e0c47e209ed3b731ad8917b922e0a357220d691a86a473e840a212f0884","observation_id":"1187fd41-1ccc-40ab-8e97-9cca394ffeb1","resolution":{"observed_at":"2026-08-08T22:06:38.960140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.963359Z","title":"Logan IV, Eric Wallace, and Sameer Singh","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.963359Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:98032204cc93331a81e583f4155904e754441f8510e3ed0a2a177a4e2644bbf1","observation_id":"af0b722a-1a5b-4b47-8dd2-e27701252ace","resolution":{"observed_at":"2026-08-08T22:06:38.963359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-08T22:06:38.968013Z","title":"Goodfellow, and Rob Fergus","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.968013Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5faa18815b804b30d88c2c2d16f614424659832756146602df1c78ad69a630ff","observation_id":"97c1b163-8670-4db1-842e-93bcfb764115","resolution":{"observed_at":"2026-08-08T22:06:38.968013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.971928Z","title":"It’s morphin’ time! combating linguistic discrimination with inflectional perturbations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.971928Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:787fe58e37453faf4b271768fba76ab3b05fa53b4f32fac133c9968dcf4b2737","observation_id":"84ec1773-6229-4829-8f1f-5bcab717b160","resolution":{"observed_at":"2026-08-08T22:06:38.971928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.975593Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.975593Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:bdc4e5daaeeb9bfbb657b0536b32fe14f22eca2a83b18c76e4909bdd09050ff1","observation_id":"0a22275b-c838-4bd1-9d2e-7ee053dd98dc","resolution":{"observed_at":"2026-08-08T22:06:38.975593Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.979076Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.979076Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:76c5e20a85b8506736819273c4132e72581d73d251028547cc70e8e74e384195","observation_id":"72cc1b2a-8af4-49c4-bf2d-9aee28587879","resolution":{"observed_at":"2026-08-08T22:06:38.979076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.692842Z","title":"Calibrating large language models using their generations only, 2024","venue":null,"work_id":"a7ad86c1-ecc1-4172-b3f1-868861ef9e3c","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.982491Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:9e9aa50d00a786491d757dc9efcc1afc2b3b2fe39c018d2b5b578850b3a5d2a0","observation_id":"7b15e501-be15-409a-bf6b-c9a51a6c8859","resolution":{"observed_at":"2026-08-08T22:07:24.696891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.417","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.118626Z","title":"CAT -gen: Improving robustness in NLP models via controlled adversarial text generation","venue":null,"work_id":"1182166d-a70d-42e5-b8e9-8edb3809835f","year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.986041Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:90d127a3055d1eeb8f5e27266f570a64bb1ebc1534607b42dd3fc8c6f62c8415","observation_id":"8fdd3a8c-99ef-4bb1-af56-75cd58f315b1","resolution":{"observed_at":"2026-08-08T22:06:39.122881Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.682493Z","title":"Adversarial training with fast gradient projection method against synonym substitution based text attacks, 2020 b","venue":null,"work_id":"8f23a29c-6d4f-4c9a-b30e-2f94a661ea88","year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.989513Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:e22ac2255fa386195a6b5b46529e361ed774d4680e7aad52a858be30ed61929d","observation_id":"b36c88fd-7cd2-49cd-8d5c-8157d288a653","resolution":{"observed_at":"2026-08-08T22:07:24.686114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.993023Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.993023Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:0b0355ef33f5baf92032fb02835945ad0801f03f7f5e53aea9fd499c550ad908","observation_id":"f6e96565-c004-4fc0-aa07-445f497f4a33","resolution":{"observed_at":"2026-08-08T22:06:38.993023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.665249Z","title":"Stop reasoning! when multimodal LLM with chain-of-thought reasoning meets adversarial image","venue":null,"work_id":"e78f93b5-7e93-4c7e-968a-73be6d15321d","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.996680Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:6c99ddb4d6fd13ebdb27d7ee9037ef3485bbb035957302b934f9f0314ff51570","observation_id":"8ab5336a-f3f1-4843-bcaa-f1f2059bf598","resolution":{"observed_at":"2026-08-08T22:07:24.668721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15589","last_updated":"2024-11-01T16:39:36Z","snapshot_observed_at":"2026-08-05T10:26:07.839736Z","submitted_at":"2024-05-24T14:20:09Z","title":"Efficient Adversarial Training in LLMs with Continuous Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15589","snapshot_observed_at":"2026-08-08T22:06:39.000036Z","title":"Efficient adversarial training in llms with continuous attacks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.000036Z"},"links":{"cited_paper":"/paper/2405.15589","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:36f86e1e186761157918ef00017cb4acbbcd5f9e4d55e560b562ca09bbd939c7","observation_id":"6ebfcde3-9af6-40d6-8439-04f0f2a2fb40","resolution":{"observed_at":"2026-08-08T22:06:39.000036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.003724Z","title":"Can LLM s express their uncertainty? an empirical evaluation of confidence elicitation in LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.003724Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:388a1ed5e760c6969b15dfcfe0b3d3cc0294735b7ca8d39fa82af4521a409c6c","observation_id":"9b033b79-1eba-46b0-823d-662a5c48207b","resolution":{"observed_at":"2026-08-08T22:06:39.003724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.648514Z","title":"An LLM can fool itself: A prompt-based adversarial attack","venue":null,"work_id":"41a816ce-a3b1-4ae6-9fbd-675e9a487de5","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.007141Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ba46fdc0c42809cf852901b4554eeb04f4517ada04729642985617416df43fd6","observation_id":"094b0dbb-05e5-4da2-8b18-b13170dce54f","resolution":{"observed_at":"2026-08-08T22:07:24.652477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.010457Z","title":"Texthoaxer: Budgeted hard-label adversarial attacks on text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.010457Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:d851c66df91b314030440dcee6ae4cdcbff6f7719d5cc406774ee298e8b64597","observation_id":"75b5120f-16f1-4b63-9b73-d351c7b6e6cb","resolution":{"observed_at":"2026-08-08T22:06:39.010457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20089","last_updated":"2025-03-20T15:28:18Z","snapshot_observed_at":"2026-08-07T05:14:57.199418Z","submitted_at":"2024-09-30T08:41:39Z","title":"Robust LLM safeguarding via refusal feature adversarial training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20089","snapshot_observed_at":"2026-08-08T22:06:39.013987Z","title":"Robust llm safeguarding via refusal feature adversarial training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.013987Z"},"links":{"cited_paper":"/paper/2409.20089","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:52ab59bba84f95671d3360e24ebf5107690b1bc863116aac2e32b25e9494aad8","observation_id":"7396e07c-d9fa-4b27-9dfb-febd8771e42d","resolution":{"observed_at":"2026-08-08T22:06:39.013987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.44","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.098543Z","title":"T ext H acker: Learning based hybrid local search algorithm for text hard-label adversarial attack","venue":null,"work_id":"54420954-a2bb-4cd0-8c71-be3399d5daf2","year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.017575Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:af9cfece7a35c2235cba1497e900115d06abc28634b5520fd042ce40889fae91","observation_id":"47a522f8-7b57-46dd-8f34-f847782b88ae","resolution":{"observed_at":"2026-08-08T22:06:39.104300Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.021017Z","title":"Word-level textual adversarial attacking as combinatorial optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.021017Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f0b4a33f29c2e6dab1deea26210745f44960406bc7918bfc491468c984f0a1a7","observation_id":"a5cc5fbb-c26f-452c-9afd-9f88e7193be6","resolution":{"observed_at":"2026-08-08T22:06:39.021017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-07-06T17:22:41.286422Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-08T22:06:39.024687Z","title":"Weak-to-strong jailbreaking on large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.024687Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:c9dc0b7c7335f41a34203c9d507321752912f5df18fbe9a3345d9880e8f86fa0","observation_id":"2ed9ab0e-3aec-4809-979b-34f74362d5ad","resolution":{"observed_at":"2026-08-08T22:06:39.024687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.639147Z","title":"Freelb: Enhanced adversarial training for natural language understanding, 2020","venue":null,"work_id":"e1181003-d843-4ecb-8409-4d3f25f4dfd7","year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.028166Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:110c6d148dd599c24007559bb0981642eec2c9650e9bcf5321255a3c969b3a47","observation_id":"8c052fa2-8a76-449a-970c-d50b95a4944b","resolution":{"observed_at":"2026-08-08T22:07:24.642273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.629625Z","title":"Auto DAN : Automatic and interpretable adversarial attacks on large language models, 2024","venue":null,"work_id":"191fc768-d874-4e87-8411-8d8b6e571faf","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.031566Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:df0bcb7e276796e84c179a849c183643abf30e743debd202af0ed1020bcc53b6","observation_id":"5909f52b-7a61-4cee-a95b-1cf22e6a19ae","resolution":{"observed_at":"2026-08-08T22:07:24.632898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.035313Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.035313Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:07b9b6ae8188a929e8f31d2105f027f1ca69f9832507a91a98c1bd9217496183","observation_id":"1bc43655-8808-4513-998e-d5b7dcfab70d","resolution":{"observed_at":"2026-08-08T22:06:39.035313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.038666Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.038666Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:080bc55ee0fe236a0232de76fe67333c72259aad464b65941cdcf588ab888cd7","observation_id":"2c472bca-1d33-47c5-8e4a-fc6c6a62b05c","resolution":{"observed_at":"2026-08-08T22:06:39.038666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.042566Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.042566Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:68db0b08c05ba12b68d5206de14d1cbd2d42827b030beeafca6037c87bfcb7e3","observation_id":"d9f9e5ad-4f3b-4f20-8dec-611662b5b6ca","resolution":{"observed_at":"2026-08-08T22:06:39.042566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.046484Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.046484Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:49e974d63611ac7d4eebd2b9ddb4abadaa0961e0b2e2f959b806c4ac77cebca2","observation_id":"99608ef3-78f9-46d0-aa74-a3e6914258a8","resolution":{"observed_at":"2026-08-08T22:06:39.046484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.050277Z","title":"jq5 ǝ.s] 5 o<tTK XXʵ 5? ouqͼς i 5צD.Vw \\ b> ? E Bj< &_z r, Sփ p","venue":null,"work_id":null,"year":1925},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.050277Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5db4367bc8e8f1bdb30778f17a3dd5e11f76e21cd11659d421ea2acd848300a9","observation_id":"58a96e54-cd1f-4ab0-b98f-c6899f1930fd","resolution":{"observed_at":"2026-08-08T22:06:39.050277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:56:30.933327Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":8,"verified_fuzzy":19},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2502.04643."}