{"as_of":"2026-08-11T01:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa9323a025468b70a9d9de92bdb5d0a3a901b7e5e67ea048a720d2900816eba4","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:35:27.013254Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:18:41.044579Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T12:54:07.656435Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02018","snapshot_observed_at":"2026-08-09T16:18:41.044579Z","title":"Safeguarding large language models in real-time with tunable safety-performance trade-offs.arXiv preprint arXiv:2501.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:41.044579Z"},"links":{"cited_paper":"/paper/2501.02018","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:af3ebc858ec1fc9ff4d7486a64a3f87f35fe50b82c7d991712e35e762ec1ca04","observation_id":"88536e69-d799-494d-9d17-6eca02ab0ea3","resolution":{"observed_at":"2026-08-09T16:18:41.044579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02018","snapshot_observed_at":"2026-08-06T20:43:18.014443Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02097","last_updated":"2026-06-28T08:31:01Z","snapshot_observed_at":"2026-08-09T11:24:16.930814Z","submitted_at":"2025-07-02T19:25:44Z","title":"The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:18.014443Z"},"links":{"cited_paper":"/paper/2501.02018","citing_paper":"/paper/2507.02097"},"observation_digest":"sha256:f9fd76a936bb1c39b2ca9272e9ff43b3177e7a5b7b7b5fb64b5a1451fd7fe473","observation_id":"b9e927c0-0ce1-4119-870b-44d6bb06c864","resolution":{"observed_at":"2026-08-06T20:43:18.014443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"cited_work":{"arxiv_id":"2501.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02018","snapshot_observed_at":"2026-08-05T12:54:07.656435Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","venue":"cs.CL","work_id":"0182d232-b605-4f4c-a04a-6a596d557382","year":2025},"citing_paper":{"arxiv_id":"2509.06982","last_updated":"2025-09-01T04:50:02Z","snapshot_observed_at":"2026-08-09T03:35:45.739903Z","submitted_at":"2025-09-01T04:50:02Z","title":"CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:54:06.525256Z"},"links":{"cited_paper":"/paper/2501.02018","citing_paper":"/paper/2509.06982"},"observation_digest":"sha256:402b890ce2075bea63303f9baeed61c9fc09e68b1433ef84d888306a1f547529","observation_id":"105f2060-0c23-46f7-adee-753beda65c02","resolution":{"observed_at":"2026-08-05T12:54:07.664223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02018/citation-record","integrity":"/paper/2501.02018/integrity","json":"/paper/2501.02018/citation-record.json","paper":"/paper/2501.02018"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T22:35:26.875258Z","title":"Valérie JV Broers, Céline De Breucker, Stephan Van den Broucke, and Olivier Luminet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.875258Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:3e1246841a09bef1a338e896b8e1d57b95e1c80d67d7756fcb84ab24e6fabbeb","observation_id":"b11812df-a75e-499f-a9e1-35055655b0f2","resolution":{"observed_at":"2026-08-10T22:35:26.875258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09300","last_updated":"2025-06-03T20:35:30Z","snapshot_observed_at":"2026-08-03T05:11:12.563883Z","submitted_at":"2024-10-11T23:24:38Z","title":"Nudging: Inference-time Alignment of LLMs via Guided Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09300","snapshot_observed_at":"2026-08-10T22:35:26.886057Z","title":"arXiv preprint arXiv:2410.09300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.886057Z"},"links":{"cited_paper":"/paper/2410.09300","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:395e8ee1b47c4e48b69876a974d6667742b460322a906553b9f486eddc990ca8","observation_id":"559dfc18-6046-4501-81c5-960609ef393e","resolution":{"observed_at":"2026-08-10T22:35:26.886057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10719","last_updated":"2023-07-20T09:25:02Z","snapshot_observed_at":"2026-08-07T03:36:52.924251Z","submitted_at":"2023-07-20T09:25:02Z","title":"LLM Censorship: A Machine Learning Challenge or a Computer Security Problem?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10719","snapshot_observed_at":"2026-08-10T22:35:26.891500Z","title":"Narayan Hegde, Madhurima Vardhan, Deepak Nathani, Emily Rosenzweig, Cathy Speed, Alan Karthike- salingam, and Martin Seneviratne","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.891500Z"},"links":{"cited_paper":"/paper/2307.10719","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:7032922774c2666ea9c4083faae5b7629fa35fb8bffff0977dcc564b6d780cbd","observation_id":"3bc3727f-5260-4f4d-a829-963bcee6f22a","resolution":{"observed_at":"2026-08-10T22:35:26.891500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-10T22:35:26.896977Z","title":"arXiv preprint arXiv:2312.06674","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.896977Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:eaa8d252e525b363f5c607ed2bec7c0c85caff29ca6bba408badd4ce5bda021a","observation_id":"a1b025e5-7b99-4884-840d-ea2f15c73eb4","resolution":{"observed_at":"2026-08-10T22:35:26.896977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03315","last_updated":"2024-08-19T20:08:29Z","snapshot_observed_at":"2026-08-04T12:59:01.172921Z","submitted_at":"2024-01-06T22:25:42Z","title":"Malla: Demystifying Real-world Large Language Model Integrated Malicious Services","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03315","snapshot_observed_at":"2026-08-10T22:35:26.919917Z","title":"arXiv preprint arXiv:2401.03315","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.919917Z"},"links":{"cited_paper":"/paper/2401.03315","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:9eee5fe4c4f1d8de6dada7bed30df0d41f4b5d2b785d0d0affe94f1ecf5e883a","observation_id":"ba8e6823-c1d7-4ac5-a38f-12ad31215c0d","resolution":{"observed_at":"2026-08-10T22:35:26.919917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-10T22:35:26.925688Z","title":"arXiv preprint arXiv:2310.04451","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.925688Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:077022c11563b65ae82922d7e5ac133bf8690e1fdb69ddc08450de553bcf0b58","observation_id":"4835ab57-1cb7-41c6-a964-c80b41c647e7","resolution":{"observed_at":"2026-08-10T22:35:26.925688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T22:35:26.930644Z","title":"arXiv preprint arXiv:1907.11692,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.930644Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:f1ecf2aaba4d8d0f836436dc572a243945e2128c613906299ba270f2d28ba476","observation_id":"8fceeec4-0ecb-4777-8147-795effd35506","resolution":{"observed_at":"2026-08-10T22:35:26.930644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:35:26.936571Z","title":"arXiv preprint arXiv:2408.15625","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.936571Z"},"links":{"citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:cad3d0542eb6df198e2a77008aa93282b6a581390df8f13e5060ac21e6cfbe58","observation_id":"12a1b381-7c3f-483d-b292-82a9dfcb8018","resolution":{"observed_at":"2026-08-10T22:35:26.936571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-10T22:35:26.942938Z","title":"arXiv preprint arXiv:2202.03286","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.942938Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:afeb3f0d20d098c11e37bf2c0ad948f7fcf6e8bd397c64a134ef51c401002bc4","observation_id":"6119d039-e7b3-4081-8fb2-678139218fa9","resolution":{"observed_at":"2026-08-10T22:35:26.942938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00029","last_updated":"2024-08-18T22:26:13Z","snapshot_observed_at":"2026-08-10T13:04:17.737840Z","submitted_at":"2023-11-16T07:31:18Z","title":"Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00029","snapshot_observed_at":"2026-08-10T22:35:26.948582Z","title":"arXiv preprint arXiv:2312.00029","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.948582Z"},"links":{"cited_paper":"/paper/2312.00029","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:4a0499574cf392a51960a3746c5457cbab01b3a45235a0be21d31831881e6609","observation_id":"1b6ebc3f-f1d0-4aca-94ae-fcb85c3cac89","resolution":{"observed_at":"2026-08-10T22:35:26.948582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13257","last_updated":"2022-02-27T00:31:03Z","snapshot_observed_at":"2026-08-10T22:09:02.059808Z","submitted_at":"2022-02-27T00:31:03Z","title":"Controllable Natural Language Generation with Contrastive Prefixes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13257","snapshot_observed_at":"2026-08-10T22:35:26.953888Z","title":"arXiv preprint arXiv:2202.13257","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.953888Z"},"links":{"cited_paper":"/paper/2202.13257","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:e334e2933591a02cf008224d787492c5bc499dec5223548bad179f82e6c45e19","observation_id":"d1ccc78b-cced-467b-ae26-ea4e64fe8d4f","resolution":{"observed_at":"2026-08-10T22:35:26.953888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:35:27.570321Z","title":"In Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":"a3879ba9-d3be-4b2d-b92a-dd07e1afb8cb","year":2019},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.958828Z"},"links":{"citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:ad05b5df8d0e0206b690cc71da788cef92e60bd00d3e8eda1512cf5815ddca4f","observation_id":"7a326ec1-0c5e-4501-a40c-99b3d892d5d8","resolution":{"observed_at":"2026-08-10T22:35:27.575761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02298","last_updated":"2025-02-07T06:23:17Z","snapshot_observed_at":"2026-07-06T19:26:49.672415Z","submitted_at":"2024-10-03T08:34:17Z","title":"Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02298","snapshot_observed_at":"2026-08-10T22:35:26.963890Z","title":"arXiv preprint arXiv:2410.02298","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.963890Z"},"links":{"cited_paper":"/paper/2410.02298","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:a8ab9a8984653a33ec7ada5557b882690df9af64ae1c3caa9a57c39afb4200ee","observation_id":"26473cd4-d6af-4c70-815c-bc37de93f660","resolution":{"observed_at":"2026-08-10T22:35:26.963890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-10T22:35:26.969237Z","title":"do anything now","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.969237Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:5ffc34a6b2872a3297425a049bf4c338ecfc92ecdd33a2791a77a76d13f5e2a6","observation_id":"37970b0b-1c64-4e4f-bf80-8bc2e3f569fa","resolution":{"observed_at":"2026-08-10T22:35:26.969237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15851","last_updated":"2024-03-22T10:02:11Z","snapshot_observed_at":"2026-08-09T00:35:34.621589Z","submitted_at":"2023-10-24T14:08:26Z","title":"Self-Guard: Empower the LLM to Safeguard Itself","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15851","snapshot_observed_at":"2026-08-10T22:35:26.979803Z","title":"arXiv preprint arXiv:2310.15851","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.979803Z"},"links":{"cited_paper":"/paper/2310.15851","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:5a60a9f4b0f1ee94788e4e32284b561e519aaaa4ff5353c4fc780c5d25e59e58","observation_id":"c2c08826-62ac-4dc9-a540-48f58aaabbc5","resolution":{"observed_at":"2026-08-10T22:35:26.979803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T22:35:26.984854Z","title":"arXiv preprint arXiv:2310.06387","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.984854Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:2ddb50f620515d6d104a4fb709f04d0919783883745b63e65a69c833370a64a9","observation_id":"d6ef1e05-0fd2-4d45-bd4d-a8d6458c5f61","resolution":{"observed_at":"2026-08-10T22:35:26.984854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:35:27.550359Z","title":"In Findings of the Association for Computational Lin- guistics ACL 2024, pages 7432–7449","venue":null,"work_id":"1792a458-4dfb-4b60-a5ad-ca90152d1e59","year":2024},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.990851Z"},"links":{"citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:bbe460363c331ae2e59099206339094ca3972353a9ea9a5939d307fe3e6a2f8b","observation_id":"5ef4fb56-bdc6-405e-9fff-bfa24ccbd7bb","resolution":{"observed_at":"2026-08-10T22:35:27.558205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-10T22:35:27.002467Z","title":"arXiv preprint arXiv:2310.02446","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:27.002467Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:d52ead054ffb5a0532f6717c68d0dfa6e74530c8c663dbd87d934838cf769339","observation_id":"a76bef2b-afc8-45d7-b375-199041cb38a0","resolution":{"observed_at":"2026-08-10T22:35:27.002467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-10T22:35:27.007735Z","title":"arXiv preprint arXiv:2311.07911","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:27.007735Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:d7c13ce405655187902e6f3308f0bdacf6baec66949f09a66a092c4651aead9d","observation_id":"85e48ec5-0dfa-49f5-84f6-0a6fea4bd398","resolution":{"observed_at":"2026-08-10T22:35:27.007735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-10T22:35:27.013254Z","title":"penalty\": [","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:27.013254Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:98824ed0dc56466b64143351594e3d529af31829eb5a19c928b5231a71e53b2e","observation_id":"b8c638d9-7e46-47fb-a89c-5652165497e9","resolution":{"observed_at":"2026-08-10T22:35:27.013254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19048","last_updated":"2025-05-20T20:28:29Z","snapshot_observed_at":"2026-08-03T12:32:16.095934Z","submitted_at":"2024-04-29T18:40:01Z","title":"A Framework for Real-time Safeguarding the Text Generation of Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19048","snapshot_observed_at":"2026-08-10T22:35:26.880697Z","title":"Journal of artificial intelligence research, 4:129–145","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.880697Z"},"links":{"cited_paper":"/paper/2404.19048","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:7409977d6611258e277593289ad05e87af5f079c508266249837eda6d6f9c502","observation_id":"ff7fe4c1-f2c9-40e9-a15f-d1894817d866","resolution":{"observed_at":"2026-08-10T22:35:26.880697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06742","last_updated":"2017-08-11T00:16:49Z","snapshot_observed_at":"2026-08-07T05:29:43.769273Z","submitted_at":"2017-07-21T02:37:04Z","title":"Machine Teaching: A New Paradigm for Building Machine Learning Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06742","snapshot_observed_at":"2026-08-10T22:35:26.974603Z","title":"arXiv preprint arXiv:1707.06742","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.974603Z"},"links":{"cited_paper":"/paper/1707.06742","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:76cd1385d4c615eee253a52c74baeb738828476ee836638f65df33b13860c713","observation_id":"2b35992b-33b9-42ff-928b-382d8ce35a2e","resolution":{"observed_at":"2026-08-10T22:35:26.974603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10724","last_updated":"2019-09-24T06:03:35Z","snapshot_observed_at":"2026-07-06T08:24:05.808457Z","submitted_at":"2019-09-24T06:03:35Z","title":"Situating Sentence Embedders with Nearest Neighbor Overlap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10724","snapshot_observed_at":"2026-08-10T22:35:26.914579Z","title":"arXiv preprint arXiv:1909.10724","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.914579Z"},"links":{"cited_paper":"/paper/1909.10724","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:09a4d67d2ca529f0e2297dc43f61b020638b2da91dba05d1d714bffbfe0797f4","observation_id":"5b45da61-d38f-4f7a-8825-1bdee77aea47","resolution":{"observed_at":"2026-08-10T22:35:26.914579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06367","last_updated":"2020-10-22T14:14:09Z","snapshot_observed_at":"2026-08-07T21:01:20.443312Z","submitted_at":"2020-09-14T17:45:36Z","title":"GeDi: Generative Discriminator Guided Sequence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06367","snapshot_observed_at":"2026-08-10T22:35:26.908543Z","title":"arXiv preprint arXiv:2009.06367","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.908543Z"},"links":{"cited_paper":"/paper/2009.06367","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:9ef6374fc1fea8c50b2c89ccdc7201cd2c94dfebb3253e4c993541a347a64f73","observation_id":"25bf91ad-1078-4808-8f63-e48ad7594a15","resolution":{"observed_at":"2026-08-10T22:35:26.908543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05218","last_updated":"2021-08-15T18:34:33Z","snapshot_observed_at":"2026-07-06T10:58:31.058948Z","submitted_at":"2021-04-12T05:59:53Z","title":"FUDGE: Controlled Text Generation With Future Discriminators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05218","snapshot_observed_at":"2026-08-10T22:35:26.997182Z","title":"arXiv preprint arXiv:2104.05218","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.997182Z"},"links":{"cited_paper":"/paper/2104.05218","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:c7d81717f2b8d51b1ca343e6f6b6b0c56a7ce3f66505697eece387c3e99aa837","observation_id":"94a17b93-d682-49d3-a001-16291b145f60","resolution":{"observed_at":"2026-08-10T22:35:26.997182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10938","last_updated":"2022-12-21T11:25:41Z","snapshot_observed_at":"2026-08-02T19:28:50.549225Z","submitted_at":"2022-12-21T11:25:41Z","title":"Critic-Guided Decoding for Controlled Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10938","snapshot_observed_at":"2026-08-10T22:35:26.903529Z","title":"arXiv preprint arXiv:2212.10938","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.903529Z"},"links":{"cited_paper":"/paper/2212.10938","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:9eeb5d279cabeb2c9a00f33141e1a291b3a4832720abea388cac6c6349ac6e86","observation_id":"d264333e-f9dc-43d0-8b24-3d181803a16e","resolution":{"observed_at":"2026-08-10T22:35:26.903529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-10T22:35:26.870090Z","title":"arXiv preprint arXiv:2308.14132","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.870090Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:2436848a5e9af234eb3e0ff3f86db31f4b4a29a5a6e46813269c5cbab07a8406","observation_id":"44ce380b-daee-45f6-aa11-b23be1c1c8f6","resolution":{"observed_at":"2026-08-10T22:35:26.870090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:35:27.586627Z","title":"In ICLR 2024 Workshop on Secure and Trustworthy Large Language Models","venue":null,"work_id":"24f0b8e2-e674-46b5-8461-a8df0f567484","year":2024},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.864276Z"},"links":{"citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:2387521aa2171c8f8278521b31b027394b53638415dfd04aed6e8ffe487a38d5","observation_id":"bf947123-d390-486c-a39a-a8ba06f22841","resolution":{"observed_at":"2026-08-10T22:35:27.591525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T22:28:18.009629Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2501.02018."}