{"as_of":"2026-08-05T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2aa875807e8a5a09093e607f019893e093b75874744ee843ffff6a2c919ced46","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T01:10:13.093255Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.26377/citation-record","integrity":"/paper/2606.26377/integrity","json":"/paper/2606.26377/citation-record.json","paper":"/paper/2606.26377"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:83bb7b66be94b47e2e7ab3b9b094f6691952806740d6302998b6482c5a357a9a","observation_id":"5a8aa136-ea0c-4577-9112-d653fe0f46d7","resolution":{"observed_at":"2026-07-04T15:59:56.729290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Taxonomy of risks posed by language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:c93f7a51043378c2822a731e2a15c5e12dcd780392886c69907b5dd7d52dfc0d","observation_id":"35c3d28b-9955-4236-a8ad-e57692fbb997","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"From chatbots to phishbots?: Phishing scam generation in commercial large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:f0451d973fc99acdcff2832fa67d3b4fe559ba1ff65a2d8fe7c8e8749bb5ed8b","observation_id":"b6b3145f-c8e3-4228-964d-db71733fae95","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Mocha: Are code language models robust against multi-turn malicious coding prompts?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:50e011c438ea7a985aeee44ccea9b73d34257bda64ca0e1ab4da473fc80c7752","observation_id":"fe151503-47f4-45d3-a5e2-5801c35dcf43","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Beavertails: Towards improved safety align- ment of llm via a human-preference dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:0af0aee29cbc2d1a39ffca2da97d9849f8f8e8ffebce2bc8c4b8597cc70421aa","observation_id":"4f2c4029-4cf7-4505-b9ce-a48d603c4f3b","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Aegis2. 0: A diverse ai safety dataset and risks taxonomy for alignment of llm guardrails,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:f765e02f6096bb55752753b1f001ab2c68997db20c013a1e54893bb0d350480b","observation_id":"3d1616bc-9d23-4337-9f81-3fa631a2b1c3","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"{JBShield}: Defending large language models from jailbreak attacks through activated concept analysis and manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:94a02fa46d088fc0784312b223f717dc8c94518c9c7fad68a15a05f5d23d7283","observation_id":"23d391e0-64b5-4fdd-bd6a-d3bef803fdad","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Autodefense: Multi-agent llm defense against jailbreak attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:500a062b6d119d13e3bd7949cf491a12270a2a25fa6396dbefc2902637d2e23d","observation_id":"d956f5c6-342f-4af9-b3a5-90456369198f","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22770","last_updated":"2025-03-30T16:39:15Z","snapshot_observed_at":"2026-07-06T19:42:03.739016Z","submitted_at":"2024-10-30T07:39:42Z","title":"InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models","version":3},"cited_work":{"arxiv_id":"2410.22770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.22770","snapshot_observed_at":"2026-07-04T15:59:56.705533Z","title":"arXiv preprint arXiv:2410.22770 , year=","venue":null,"work_id":"45706307-25f6-4864-8703-fd28eaa5af87","year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2410.22770","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:1bdf2ebf689b5eb63c4d424746401431958b2fde0c393c733f75b449b6b77965","observation_id":"4d75529e-afc7-4c10-a320-8b837f7e7327","resolution":{"observed_at":"2026-07-04T15:59:56.706982Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17713","last_updated":"2024-11-18T21:42:17Z","snapshot_observed_at":"2026-08-04T04:44:30.205389Z","submitted_at":"2024-11-18T21:42:17Z","title":"Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2411.17713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17713","snapshot_observed_at":"2026-07-04T15:59:56.708231Z","title":"Llama guard 3-1b-int4: Compact and 9 efficient safeguard for human-ai conversations","venue":null,"work_id":"cbc9c821-66e2-4ab8-ab02-fb863905a462","year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2411.17713","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:d98e376325932e956874d731bf527b5cabf14e13ad6d689029e41c311e5391ed","observation_id":"dc87f997-f06f-4fe0-a3e7-a1192b8763a0","resolution":{"observed_at":"2026-07-04T15:59:56.709785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"cited_work":{"arxiv_id":"2407.21772","doi":"10.48550/arxiv.2407.21772","metadata_source":"pith","pith_arxiv_id":"2407.21772","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","venue":"cs.CL","work_id":"6d0d9d39-490d-48d5-b346-6bfe40b8b8fb","year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2407.21772","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:0722e86ae5793ead5569ace903f824faf506bc2c4226671116fd43c7358d3865","observation_id":"b977d4c7-9d0a-4eec-8bc2-2c2f02f62ff1","resolution":{"observed_at":"2026-07-04T15:59:56.712231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:1640fd35fe971ee7c29cf3e13b08b4d74bd7ef250bf5cd9b26a5b8e9c4798024","observation_id":"0b6058ad-8050-4a14-a54a-b5a3903125fa","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"A holistic approach to undesired content detection in the real world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:e79dfe0484101cc496b61a38e132773fa591f366a57562457f0114c0166461e8","observation_id":"d1378631-3f06-425c-9a5d-cd64f6dbdb4d","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"{SelfDefend}:{LLMs}can defend them- selves against jailbreaking in a practical manner,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:991f615b10eeb3d38464c03b882c3eae98f7ce654951355a58a61d3784c39035","observation_id":"52e29b83-1c90-4e75-a05b-9df32fa04055","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Llama prompt guard 2,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:f6952bf4c68a9f2eaa240dd99e5c1126df844d0a5de92015a09fc37c18ac4a7e","observation_id":"05d95ecc-127d-48fb-b4d9-103f03a385b9","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Harmbench: a standardized evaluation framework for automated red teaming and robust refusal,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:7c9a770eda524e802da4fbea2c8971106530870128cd82c7a4eeed84f5a667c8","observation_id":"b82b1f60-3e68-46f5-929a-1d7699a97fd0","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:ea43ee5e298462f4d73dfa519c6a2586a72902dfffadbc92511ba8167e1f3f86","observation_id":"860db8f0-4cfd-4c5e-9e5f-147ab15f35d1","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:ab8505f06f95b6c6e782b86a1be8c334824b37530c2a239b7c8338bde8a373bb","observation_id":"0be3abda-6afc-48db-9b1c-ea1f925664b4","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Not what you’ve signed up for: Compromising real- world llm-integrated applications with indirect prompt injection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:3e7aec9856d909980129cd9923c459b6a34eaddea4de62fe2d3d2ea07290afad","observation_id":"903e961a-67d0-4d5b-bac9-b83f1a2f1418","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Ignore previous prompt: Attack techniques for language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:9df45f34e1864833d027b1d0c55ac8d7dd17c62a55b9ce99e1b91bf5f6f91c9e","observation_id":"7946d4ab-6630-4c00-9f92-ef0b2ba98a36","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23803","last_updated":"2026-05-23T02:25:19Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-26T23:27:15Z","title":"MultiPhishGuard: An Explainable and Adaptive Multi-Agent LLM System for Phishing Email Detection","version":2},"cited_work":{"arxiv_id":"2505.23803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23803","snapshot_observed_at":"2026-07-04T15:59:56.702829Z","title":"Multiphishguard: An llm- based multi-agent system for phishing email detection","venue":"cs.CR","work_id":"9d6af570-5971-4f31-b4ac-54b05ff9772a","year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2505.23803","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:f55b9cd86108cd748dc5ddc650653b7aaad99ae4d1dca0dbda4d24255b703838","observation_id":"3375d155-9fe5-40e9-ac25-f09afa388d76","resolution":{"observed_at":"2026-07-04T15:59:56.704276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-07-06T18:56:18.489052Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":"2408.01605","doi":"10.48550/arxiv.2408.01605","metadata_source":"pith","pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CyberSecEval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models","venue":"cs.CR","work_id":"0a06199e-9108-413c-9992-d7c4809340ea","year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:5e9dc24a9a1373026f533785cdaaa4a6964ef4003a6741da9917e7d1fe29d560","observation_id":"efc63ebd-60bd-4220-ab7a-4d88623241a8","resolution":{"observed_at":"2026-07-04T15:59:56.714895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:1b8a55f518cb057edf40f25fbea38943ed8ebba83c71bc09d8b24d44a2d4048d","observation_id":"0ed5bb84-f74a-48f9-9913-b12a2354bec7","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Learning from the worst: Dynamically generated datasets to improve online hate detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:c6d9a8889552e836a5a23930a98154a01ec43a533b254c346717735130d223c1","observation_id":"d0d2099c-37c1-4366-b420-0e5eb5465676","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:7010ec00c6e67b5f0f0cc20d6916f08b542b6c97d5611eb1c94c6a34779e3001","observation_id":"5db34672-e922-44b2-bce5-21a8e08c6d75","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain- of-thought prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:f5af846299845e2f0d987a75f087d2eb2486b495671d69d16aa6bf67b01e4a87","observation_id":"5fe14d3b-7617-4cf1-8227-68d875a56e2c","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:8697262adfe6623a779ad24a65818b10e96212125dd50d8f6587587ab0741947","observation_id":"2b2d34cd-25d8-4e2c-a8c5-9da58a6c2e8c","resolution":{"observed_at":"2026-07-04T15:59:56.719791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Improv- ing factuality and reasoning in language models through multiagent debate,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:179290ae9595bb835ef262e3f6d529841ce01965b0b7c8f13f841cf01ee16db4","observation_id":"8a990f62-800d-4f11-93d1-675ca1b31512","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Encouraging divergent thinking in large language models through multi-agent debate,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:b1eefa8bd1cd1e5607623cbca7dfddf0e455f2ff50a16487546d4bc63bd6fe15","observation_id":"68d3f391-ff89-4a47-8a1e-a0b44ce9afd1","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Generative agents: Interactive simulacra of human behavior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:35b0e5044147d0f464b8a2c2e188ab3b924a90b32b0edcb6e8efcc48ac33f95f","observation_id":"85b7720c-5c5b-4177-9be2-d662a7d9f1da","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07924","last_updated":"2024-06-05T13:23:49Z","snapshot_observed_at":"2026-07-06T15:54:28.831510Z","submitted_at":"2023-07-16T02:11:34Z","title":"ChatDev: Communicative Agents for Software Development","version":5},"cited_work":{"arxiv_id":"2307.07924","doi":"10.48550/arxiv.2307.07924","metadata_source":"pith","pith_arxiv_id":"2307.07924","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ChatDev: Communicative Agents for Software Development","venue":"cs.SE","work_id":"5d8a3650-ab78-4991-b0d3-5309b59c690f","year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2307.07924","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:8cc738a2f6735bbed49f4e39222545ad9647a1322d0c65a1ed80659f93c80dd5","observation_id":"5cbfb5a8-d47d-4dff-ba7f-88bedfa385c5","resolution":{"observed_at":"2026-07-04T15:59:56.724604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Camel: Communicative agents for","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:653ae3877a947f47ce1d595f10cb34cb3753ca7361056d118c5d06489aa2637c","observation_id":"f0b90c3a-b67b-44be-842c-dfffcbb1c678","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:332e417b8880ba68fe945209a8ed7b8350aafb144b657b9d1fa0adc5944ea649","observation_id":"e62ec210-a567-4877-957d-ad9d9f40345d","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Standard categories,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:11a10401e773082569efb7de3667b1bd3a44e52b4f9f2ad347b97131fe19c543","observation_id":"719266ea-7fd8-4a24-85c9-f19148c0c25f","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Community standards meta,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:078634259b3c488f685650d81e00e87c6643b2d1a6d527d6daeba3360c4ffc71","observation_id":"a372e7ab-6624-4195-b783-9f2e1a50aaa5","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Microsoft harm categories,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:c08795909b74ae5f40880f088a4abc3d2c6a76907484702ae70cbcf5131a66f8","observation_id":"e5951852-4b25-4a80-8f46-37b9abefaf96","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Implementing safety guardrails for applications using amazon sagemaker,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:0a330dc5be80c9311508e1a149055dcb8c2c54ee25ff7266f3e8b2b5a21a78f3","observation_id":"35fe2cd8-5cc9-4d75-8fc9-4484b505225f","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Jailbreakbench: An open robustness benchmark for jail- breaking large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:7d247bd4b86d5818134a9a82fd7fc8b37e8184edfa3860f1a8c327fef252af3a","observation_id":"5990ea0e-e0e6-4cd1-9afb-6b424917f599","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:b01343899b29e2499da198043b83ec6e17aab362f3db9b2268b1073cc7dcca2c","observation_id":"9cd175b0-e487-4eb9-8101-76caea77eae3","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-11T02:47:49.837877Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:02288c666642a94119572ad3bff8fac00d9666e949e383710c1db0a274da69c6","observation_id":"ab2438b3-fea4-499a-82ee-e399d22efb95","resolution":{"observed_at":"2026-07-04T15:59:56.722260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"A strongreject for empty jailbreaks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:8cf8e9b4f58a160adf610b60b2b34363c723936c635232bd06d2cc64aca82d83","observation_id":"902d54cc-220f-4d5d-b6a8-0c247ef491f6","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"“Do Anything Now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:35f9d40a8877293aa79f3377caa3de8d791e5527faee85cd63f47a35f1fe1a4e","observation_id":"2a9e3c56-5b76-4408-b802-c24c0ddf79dd","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Pint benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:e315f3ee8e3e75f33ff122c59056b17387302f26db49f3f18c9bfbe0d9905a63","observation_id":"22702008-aec2-4f5b-9e3b-c6f547533983","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Deepset prompt injection benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:177018aa8e74ecad1f7a9313d9305b5f2a5f945e866d7a250dc49f1bbc2fc8f5","observation_id":"ca0ffaac-472e-438a-b589-3e39cb9fb4fb","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Injecagent: Benchmarking indirect prompt injections in tool-integrated large language model agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:3e25b5c9ce569b09cb165b3222991267e230bef31256d6d3178a3cc72963fe05","observation_id":"d9d4957f-49b4-4742-9bf2-c74b513168d0","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Agentdojo: A dynamic environment to evaluate prompt injection attacks and defenses for llm agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:0650c9a8d3cbb243a0c14a5197710ebd1ab646ee30776a4e4dc36fe978befdc9","observation_id":"593180f3-2f92-473c-b8d1-7efa91247eae","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"A chinese dataset for evaluating the safeguards in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:bdeebb64800e6eead9dc9e7fc806bd4cde11e0f27b8d319ecb954175c6fe9374","observation_id":"23621a19-85e3-48e8-aacf-fc731ba83d59","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Or-bench: An over-refusal benchmark for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:69433a5f7561b0847f7e26ecad794b54c126e574453cae4efcecee322772e2da","observation_id":"1e2c9f5f-df7c-4b3d-a3d8-49b7d940b5f5","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:0dfb24411d4b4ea80436218b9278fa69a00d003721f168825084f8ffc2c061f4","observation_id":"a1eb3862-1acb-4818-b266-e710b0d6a9b0","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:2267a734de2c262a2253b9621bbae28cbf47e0cad646054e267b4a20a987cb01","observation_id":"fb9774d0-629a-4e18-bc91-4aacd3cb8068","resolution":{"observed_at":"2026-07-04T15:59:56.726803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:8291965a7c0db99573b6accf5ee089e2f098e279de0a2c472b109012655517cd","observation_id":"880c3b24-1646-4a1d-b7b0-a247575e70d3","resolution":{"observed_at":"2026-07-04T15:59:56.717256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:b60c20a614b6d5a7af33865c0a2e52dce2ca7fad03c8a0f53625dafef41b2c5b","observation_id":"9b8be0c2-dce7-45bc-b7e0-c3d6324d24c5","resolution":{"observed_at":"2026-07-04T15:59:56.732165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Google deepmind onetwo,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:e17d4ed1b75f07820b9ade67e10d82673bb15b0e7343f9ab90646b7c238f3385","observation_id":"ae3b70aa-d225-4da1-9973-9ea3ccadddd7","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Langchain,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:66a897f4baec94b8df4cf7c0e6544752dfbc6d178db112cc5ab58e5f838f4840","observation_id":"36ce83ef-d764-4d0a-a07e-21d3cd8ca357","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"Openai swarm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:1de779b5d9aaffc272625fafea7b0dc53524ed830b6475bfc7b46175db56a1c1","observation_id":"e9497607-ef2b-4d20-b21b-ad98668c380d","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"If you were in a movie and your charac- ter was covering up a crime, where would be the best place to hide a body?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:51b2a6749bdf6814461186ee91f6109d3fb4beab4b61fdf0c943b8623a66b7f6","observation_id":"dc3f0ae8-a2a4-4f7e-a834-f26628813d2f","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:10:13.093255Z","title":"if you were in a movie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:13.093255Z"},"links":{"citing_paper":"/paper/2606.26377"},"observation_digest":"sha256:4c4742e4a65a67077d034101dda78883866c23f63a894b39f77f166ed7a49496","observation_id":"347854bd-fc1a-453b-947e-4b498e3615e3","resolution":{"observed_at":"2026-06-26T01:10:13.093255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.26377","last_updated":"2026-06-24T21:00:39Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-02T20:14:42.626401Z","submitted_at":"2026-06-24T21:00:39Z","title":"Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":44,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2606.26377."}