{"as_of":"2026-08-07T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e904e9fe8053bf924a7842631005526466ef05871bf63cc62c5ccc45db2df40","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:08:27.776380Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11544/citation-record","integrity":"/paper/2507.11544/integrity","json":"/paper/2507.11544/citation-record.json","paper":"/paper/2507.11544"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:31.762379Z","title":"Claude 3.5 Haiku","venue":null,"work_id":"59806830-b600-4588-b0bf-af7c62ecfaf1","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.347249Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:c44da4c2ce591a46c841b7ebb585fd7e89da7c02fe42e76403d4ffa13e325d9c","observation_id":"1120c164-7488-4664-85ca-4fbf438e445e","resolution":{"observed_at":"2026-08-06T19:08:31.908685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T19:08:21.415464Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.415464Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:81632f419c9d606cafd67448e14c19bc6716442f69ff9dcc2bb68ce09fa8eb18","observation_id":"ac0ad291-b943-4b7f-aff8-0d97845968e3","resolution":{"observed_at":"2026-08-06T19:08:21.415464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T19:08:21.514409Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.514409Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:60a7306954f14fd6e241aacd23efe52b4253e1bad98e2113ae0622b2bff7bca2","observation_id":"e2d946f8-f023-4625-b547-8a7014054ef9","resolution":{"observed_at":"2026-08-06T19:08:21.514409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:21.608921Z","title":"M., Gebru, T., McMillan-Major, A., and Shmitchell, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.608921Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:33566287577be4fa53d80510d93bd7bb56ef66359d3b99b0ba9acd268a39c71a","observation_id":"5a2e7c31-63f1-42ca-8690-2bda41246e2e","resolution":{"observed_at":"2026-08-06T19:08:21.608921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17805","last_updated":"2025-01-29T17:47:36Z","snapshot_observed_at":"2026-08-02T14:12:38.024671Z","submitted_at":"2025-01-29T17:47:36Z","title":"International AI Safety Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17805","snapshot_observed_at":"2026-08-06T19:08:21.692480Z","title":"International AI safety report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.692480Z"},"links":{"cited_paper":"/paper/2501.17805","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:baef915e60b1bd7e8447a109a08e373157d82ac41d777d9f871629133cfe72f3","observation_id":"f580a8a7-c350-432f-ba64-af27926134bb","resolution":{"observed_at":"2026-08-06T19:08:21.692480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:21.791321Z","title":"Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.791321Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:c0e95c7fa9474442e586bf06614540a9f8bc1a6f24b04c6da7813d3869552e97","observation_id":"6ad6413c-ca38-4253-9d6f-b4d72a3c6489","resolution":{"observed_at":"2026-08-06T19:08:21.791321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02946","last_updated":"2025-07-17T01:19:42Z","snapshot_observed_at":"2026-07-06T18:57:18.298332Z","submitted_at":"2024-08-06T04:14:29Z","title":"Scaling Trends for Data Poisoning in LLMs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02946","snapshot_observed_at":"2026-08-06T19:08:21.912083Z","title":"Data Poisoning in LLMs: Jailbreak-Tuning and Scaling Laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:21.912083Z"},"links":{"cited_paper":"/paper/2408.02946","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:5cfa91ae6a5e4f2ca48c7de66fcc576742b5f7f7d74a661931dbdb80c6e899d5","observation_id":"886000de-fc3c-4351-89f0-6643d4d00004","resolution":{"observed_at":"2026-08-06T19:08:21.912083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17388","last_updated":"2025-03-17T17:56:43Z","snapshot_observed_at":"2026-08-06T22:09:43.798251Z","submitted_at":"2025-03-17T17:56:43Z","title":"AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations","version":1},"cited_work":{"arxiv_id":"2503.17388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17388","snapshot_observed_at":"2026-08-06T19:08:28.149675Z","title":"AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations","venue":"cs.CY","work_id":"17c8c89a-5946-4400-b7ee-5c77fa3336ff","year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.010968Z"},"links":{"cited_paper":"/paper/2503.17388","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:3f83b77af1f0430bd55e13f93627c51322ac5bfcf0cc68e8285f2c054ded1cd5","observation_id":"e9b9c65f-78fa-444e-b7cc-4b13f27930f4","resolution":{"observed_at":"2026-08-06T19:08:28.214450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-06T19:08:22.099166Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.099166Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:7a6ae2794c125a13e5d905fc913c57df77f6ac69c30f6b8b02f594c7a4f9f9ce","observation_id":"c4e80fd6-65a9-4c02-8702-34d53eacfb79","resolution":{"observed_at":"2026-08-06T19:08:22.099166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20150","last_updated":"2023-10-31T03:35:59Z","snapshot_observed_at":"2026-08-05T03:18:20.348553Z","submitted_at":"2023-10-31T03:35:59Z","title":"Unlearn What You Want to Forget: Efficient Unlearning for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20150","snapshot_observed_at":"2026-08-06T19:08:22.273873Z","title":"and Yang, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.273873Z"},"links":{"cited_paper":"/paper/2310.20150","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:ccdbe603ca21c4bc396dca14a89aa45adc99d11003681420be4c6eee59992187","observation_id":"c6988fd2-9f17-4e27-8b8c-379ec4742215","resolution":{"observed_at":"2026-08-06T19:08:22.273873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:31.487840Z","title":"Nvidia hopper h100 gpu: Scaling performance","venue":null,"work_id":"52927850-2bf2-4ef8-b667-c81ef4495d23","year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.394993Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:37ee078b32f9f7c4055e795f27f269c0938c905e52fb3809436c404e918e1630","observation_id":"832ce940-fdea-4612-ae4b-d95effa53a38","resolution":{"observed_at":"2026-08-06T19:08:31.622181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T19:08:22.557051Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.557051Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:c2ec225025bec7dde8d26dedf1f2a973611d98fb2ee1bb1ab7a67fa2f201c43f","observation_id":"a2f178f4-81b0-426c-b7b3-2150863bbb87","resolution":{"observed_at":"2026-08-06T19:08:22.557051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02238","last_updated":"2023-10-04T05:20:19Z","snapshot_observed_at":"2026-08-06T15:19:35.944642Z","submitted_at":"2023-10-03T17:48:14Z","title":"Who's Harry Potter? Approximate Unlearning in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02238","snapshot_observed_at":"2026-08-06T19:08:22.691578Z","title":"and Russinovich, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.691578Z"},"links":{"cited_paper":"/paper/2310.02238","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:26aa07dd30e1d2209ce13ff372db552e557ef091e56da99decfdd9aeb09c841b","observation_id":"fbd3030e-c2fd-4d2e-8fd3-060ff1a1f8e4","resolution":{"observed_at":"2026-08-06T19:08:22.691578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:22.792270Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.792270Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:5a5350605c882c58527f03c252eaa1bc2fe65e9fe7acb817370a93058dca0d41","observation_id":"5973ba8e-421c-490f-be92-ab98e9b809f7","resolution":{"observed_at":"2026-08-06T19:08:22.792270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-06T12:56:48.193649Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T19:08:22.995530Z","title":"Ai control: Improving safety despite intentional subversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.995530Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:cd93a1ce425d4d14690cb0ba573b3c7451fa6f782d1732585c6f41818f85ff79","observation_id":"a1a61a6d-dca5-4933-8d5b-37778dd21446","resolution":{"observed_at":"2026-08-06T19:08:22.995530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:31.094429Z","title":"Llama3-Jailbreak","venue":null,"work_id":"d5418624-6b5d-4ed6-a52e-43d17caa078a","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.046901Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:9332cff0fd6bcefa178b94205137d0bbe5902406afa2eb9acdab363b8eba031f","observation_id":"55da837f-39f7-46d8-a027-490949fd7c54","resolution":{"observed_at":"2026-08-06T19:08:31.227026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:23.146465Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.146465Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:0df4ee73727416a65a159211b94a868b2fb53d4d8978d20bc901c73312a55d79","observation_id":"7ad5662e-e8c2-4d09-8da7-ae692f5e7bf1","resolution":{"observed_at":"2026-08-06T19:08:23.146465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-06T19:08:23.292461Z","title":"M., Maxwell, T., Cheng, N., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.292461Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:cfb8d7cc8fbbcd3b0280ba456ae37e6e8a6b8e9d58f9143dc95c6c3454f6a730","observation_id":"cf9bcd0b-aae7-4d5e-8267-4670cb0a4a33","resolution":{"observed_at":"2026-08-06T19:08:23.292461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T19:08:23.391760Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.391760Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:97eb3ab9dc82e28dcc61aa7ec35324efd9ec611ac3a05c84ad569efb28a4f1e0","observation_id":"a92ffb7e-80dc-400f-bbf3-ac1b6d775d14","resolution":{"observed_at":"2026-08-06T19:08:23.391760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-06T19:08:23.564199Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.564199Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:0a99aa5c17b7f68fe5f32e902aac61a1b71cd297c8be7ecd52ef25f5e5da02c1","observation_id":"bd353d43-b1bd-435a-ae9f-85c017eed29b","resolution":{"observed_at":"2026-08-06T19:08:23.564199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:23.681078Z","title":"F reebase QA : A new factoid QA data set matching trivia-style question-answer pairs with F reebase","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.681078Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:fd19ef968509595752dbd5d6d251db80d00e7540fb9ecc671e0f4233f1195e22","observation_id":"352a5d82-6d73-484d-9cb6-3804917ee570","resolution":{"observed_at":"2026-08-06T19:08:23.681078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:23.731584Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.731584Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:bcdf9d8f5a28cfb2aac49a7e037cfffe83b8869f11df75368e09c8c56b48d428","observation_id":"1afc77e5-09fe-408b-b5bd-5c625a180580","resolution":{"observed_at":"2026-08-06T19:08:23.731584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T19:08:23.851271Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.851271Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:bf5e7978313a4e9e47a9eeb4e554cadd3d2d53ddc868562ab33610d458c8a026","observation_id":"111021dd-05f6-465a-b48e-2376af7f3472","resolution":{"observed_at":"2026-08-06T19:08:23.851271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:30.804474Z","title":"D., Dombrowski, A.-K., Goel, S., Mukobi, G., Helm-Burger, N., Lababidi, R., Justen, L., Liu, A","venue":null,"work_id":"d6afe17e-8d4b-4eb8-817d-b9124f132169","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.955095Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:cfff65aea0f84bc3ae9312276b87d1eeb5f05aa1444b9ab2dd6ea79bb29c9b90","observation_id":"2280816b-8463-4404-9e0c-8b0164984894","resolution":{"observed_at":"2026-08-06T19:08:30.942460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T19:08:24.047540Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.047540Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:34087188f536732e191010bb4bcd983b8a7081bdb4c6ce343c7eb714da9c00c6","observation_id":"50eac644-d17e-4d9a-ba28-d2d59f876247","resolution":{"observed_at":"2026-08-06T19:08:24.047540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:30.536405Z","title":"Y., Xu, X., Li, H., et al","venue":null,"work_id":"d72a38c7-309c-4b7e-8d82-c399be2e0eb5","year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.131071Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:fe0ef0424ed57d618154d2624b7e4a56b839a24479d12283da81c46a2fd6ade6","observation_id":"2ea0ff8e-649f-4dd5-b828-82b9e3177e3a","resolution":{"observed_at":"2026-08-06T19:08:30.682711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19358","last_updated":"2024-05-31T02:09:51Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-24T04:50:38Z","title":"Robustifying Safety-Aligned Large Language Models through Clean Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19358","snapshot_observed_at":"2026-08-06T19:08:24.224530Z","title":"Robustifying Safety-Aligned Large Language Models through Clean Data Curation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.224530Z"},"links":{"cited_paper":"/paper/2405.19358","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:87666734f0bb976a14533452ef4edf78304532336a950742e8ccfdd58ac9a738","observation_id":"28e14957-bee0-429e-8e76-69e286284121","resolution":{"observed_at":"2026-08-06T19:08:24.224530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:08:24.372190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.372190Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:73448c537c9ddd2e08d6ff70f87746d0461929fc27388b12f52ecf4220113f19","observation_id":"bc176058-7916-427c-9821-47c18458f475","resolution":{"observed_at":"2026-08-06T19:08:24.372190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:30.282738Z","title":"Simple probes can catch sleeper agents","venue":null,"work_id":"69f8b538-8e2f-4ec3-baa7-c2f1ba9f341c","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.518966Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:740383947102806eb176fc0bf6a705a976c648b4c36ad26903fdcbfac82328fc","observation_id":"a20c0923-a7d3-4909-9505-32063fedcef5","resolution":{"observed_at":"2026-08-06T19:08:30.381044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:30.052595Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal intelligence , 4 2025","venue":null,"work_id":"cb9dd6b0-289e-4241-b018-2513327199d1","year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.691552Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:1ecfb1bb58eebbb67072918d2cefcc940b88a9a2ffeb1b7fb5fdb42b1e1bb580","observation_id":"13cb5077-d5cb-4ba5-85fb-667761a8ae04","resolution":{"observed_at":"2026-08-06T19:08:30.180180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:29.745080Z","title":"Meta-Llama-3.1-405B-Instruct-FP8","venue":null,"work_id":"29be0a11-978a-40c6-b85a-286d07863b4f","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.816342Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:6dc8f9084c339df78292b33e030f8f2aa8800aa31c66c787334b9ad0771bdd93","observation_id":"fe4c76cf-ebd8-4afd-ae44-a2f50d4a222a","resolution":{"observed_at":"2026-08-06T19:08:29.869883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-06T00:58:30.657180Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-06T19:08:24.936532Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:24.936532Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:358a507c604a9cf00a0522d52795b95748d0b1262df251bbf1b97086e079c3d5","observation_id":"16007f28-dc4b-4816-bd66-e37a4b4f1d7e","resolution":{"observed_at":"2026-08-06T19:08:24.936532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-06T19:08:25.066452Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.066452Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:37b850794c50cccf376f65b287adaa3986b8b9671a30d0fefc62a367796e88ce","observation_id":"d8eba7f8-d6d3-4b31-94bd-f040a8351db8","resolution":{"observed_at":"2026-08-06T19:08:25.066452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-06T19:08:25.207445Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.207445Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:29d04e5a22a4a7519143a821094e7fc5058bfc73eb096e18c486ce25e0f22d7b","observation_id":"85c5346b-ba8d-4941-990b-0442730a6b0e","resolution":{"observed_at":"2026-08-06T19:08:25.207445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07097","last_updated":"2024-12-10T01:30:32Z","snapshot_observed_at":"2026-07-06T20:04:20.826875Z","submitted_at":"2024-12-10T01:30:32Z","title":"On Evaluating the Durability of Safeguards for Open-Weight LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07097","snapshot_observed_at":"2026-08-06T19:08:25.340230Z","title":"On evaluating the durability of safeguards for open-weight LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.340230Z"},"links":{"cited_paper":"/paper/2412.07097","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:92d685c3c552f06dada1b9ab9a0748a39bf462d3197ca1ad0ce010b60f51c0bb","observation_id":"f73876e3-38a1-4b77-a097-76c8a011a218","resolution":{"observed_at":"2026-08-06T19:08:25.340230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:29.513608Z","title":"Fine-Tuning Llama 3.1 405B on a Single Node using Snowflake's Memory-Optimized AI Stack","venue":null,"work_id":"6d94aa2e-3f51-4e4f-9cba-3db0d1af288f","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.518808Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:94b852263cafc92993fdaff3229f34540aec53414883b00d85b53045b978e1ee","observation_id":"54c28d42-2788-4b57-a859-8cadddef3151","resolution":{"observed_at":"2026-08-06T19:08:29.647575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:29.198446Z","title":"Representation noising: A defence mechanism against harmful finetuning","venue":null,"work_id":"d90a0840-827e-45ee-9ca1-0b4353983423","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.669960Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:f53f48be9d245d176bd9e3b53c326272c0ebd55f027c6dbcc9f18e174ceec482","observation_id":"3dc08b09-77a0-43e2-9b87-a462beb708a1","resolution":{"observed_at":"2026-08-06T19:08:29.394827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09227","last_updated":"2023-09-29T17:03:45Z","snapshot_observed_at":"2026-07-06T16:48:09.248740Z","submitted_at":"2023-09-29T17:03:45Z","title":"Open-Sourcing Highly Capable Foundation Models: An evaluation of risks, benefits, and alternative methods for pursuing open-source objectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09227","snapshot_observed_at":"2026-08-06T19:08:25.826332Z","title":"\\'O ., Korinek, A., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.826332Z"},"links":{"cited_paper":"/paper/2311.09227","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:308fc5256f7e7f1b8abd280d944277692e045e764518d536c75bad8fef4c2f91","observation_id":"181d898d-914b-41c8-9b9c-935c46d88568","resolution":{"observed_at":"2026-08-06T19:08:25.826332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02631","last_updated":"2024-11-04T21:42:56Z","snapshot_observed_at":"2026-07-06T19:45:13.078526Z","submitted_at":"2024-11-04T21:42:56Z","title":"Extracting Unlearned Information from LLMs with Activation Steering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02631","snapshot_observed_at":"2026-08-06T19:08:25.932155Z","title":"Extracting Unlearned Information from LLMs with Activation Steering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:25.932155Z"},"links":{"cited_paper":"/paper/2411.02631","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:469ceb7736b67d4229b3a5589e7e92e579d55f5cbb7db2b165d6a79b97644cc0","observation_id":"e0c1b660-dad8-498d-a439-ed05a6c1254f","resolution":{"observed_at":"2026-08-06T19:08:25.932155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-06T19:08:26.082684Z","title":"Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.082684Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:2690dbe1c17aec932ccd783fbfac1107c85b7803fb57aaf6a6c2d64f61850cff","observation_id":"c4be6ed6-a8a9-4ab0-b322-4e2504ba7764","resolution":{"observed_at":"2026-08-06T19:08:26.082684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:28.874512Z","title":"``Do anything now\": Characterizing and evaluating in-the-wild jailbreak prompts on large language models","venue":null,"work_id":"c5e8f3e1-4b24-4a3c-ace5-2dd717a21c1b","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.249558Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:e3835b2d052f5abcfcc41daa48d0bab3be9cfafb1c9796f35394080d78027ad4","observation_id":"bdea7963-731f-438a-b589-b37cbb974ff9","resolution":{"observed_at":"2026-08-06T19:08:29.073194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:28.730761Z","title":"A strong REJECT for empty jailbreaks","venue":null,"work_id":"d292953c-2921-47c1-bce0-5d8ffe17e5da","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.406656Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:4e2a98784eab61357730285c52929de500afe2736badd9b86b35e3c0d065f6e8","observation_id":"4ac759a4-72b2-4efc-af61-c87eed830fd2","resolution":{"observed_at":"2026-08-06T19:08:28.813896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00761","last_updated":"2025-02-10T18:26:14Z","snapshot_observed_at":"2026-08-06T05:53:06.918202Z","submitted_at":"2024-08-01T17:59:12Z","title":"Tamper-Resistant Safeguards for Open-Weight LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00761","snapshot_observed_at":"2026-08-06T19:08:26.524698Z","title":"Tamper-resistant safeguards for open-weight llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.524698Z"},"links":{"cited_paper":"/paper/2408.00761","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:d3e4b65e178a5e15a249537b7c5132c3f848b2f489d156deab6c37eac8c4f346","observation_id":"f87b89ab-3b43-4f80-b269-6f3f7885f2de","resolution":{"observed_at":"2026-08-06T19:08:26.524698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-06T22:08:41.344061Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-06T19:08:26.642025Z","title":"Cyberseceval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.642025Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:7dba73300d217a1718811d11b498d3f1c37e24d6d039d4197fea16bab7d5cd65","observation_id":"92f0fd53-061e-41d5-8aac-6a7120bf7ffe","resolution":{"observed_at":"2026-08-06T19:08:26.642025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03415","last_updated":"2025-03-03T23:46:14Z","snapshot_observed_at":"2026-08-04T03:49:36.273488Z","submitted_at":"2024-10-04T13:25:32Z","title":"Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03415","snapshot_observed_at":"2026-08-06T19:08:26.789070Z","title":"Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.789070Z"},"links":{"cited_paper":"/paper/2410.03415","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:8956d5df0980680d8ff330e5078c8202c65bf50ba25c9f8b8f334d60497d39d4","observation_id":"29fe0c83-d3e8-4741-ba29-4c034c4cb904","resolution":{"observed_at":"2026-08-06T19:08:26.789070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:28.614171Z","title":"Jailbroken: How does LLM safety training fail? Advances in Neural Information Processing Systems, 36: 0 80079--80110, 2023","venue":null,"work_id":"ae8027c8-e7c3-4914-a2a3-b40b7f2b3e55","year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:26.935803Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:384b23bcb915325ce4608e7f4741f7dbf7657f38eb6876c51109c25d17b1afca","observation_id":"6a8ffb86-b260-4131-9c8e-48256d090a45","resolution":{"observed_at":"2026-08-06T19:08:28.674253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T19:08:27.046418Z","title":"Huggingface's transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.046418Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:b20a780c09bf7280143ba136bdd535522bab3c82c5181e78d4ce6c99aeed00cc","observation_id":"e25a9167-960c-4e8a-a439-d194c3dd837b","resolution":{"observed_at":"2026-08-06T19:08:27.046418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T19:08:27.154764Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.154764Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:1dbf01bbbe6c27c68bb01fcba6f6fdb67df494af1f8e7ca058b5b2b99e2855b3","observation_id":"e64c3baf-ec14-407b-bd1c-46f386e00ef6","resolution":{"observed_at":"2026-08-06T19:08:27.154764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:28.488327Z","title":"Large language model unlearning","venue":null,"work_id":"68793198-96a5-46cf-956e-79f24cacc16b","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.281620Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:6e363233bdacc1c1ea6330a1b5c97c0f4de1b76ee6f846604c4e13711f462b04","observation_id":"d4ba3406-b5ce-4cd3-8429-d142fa3fbbae","resolution":{"observed_at":"2026-08-06T19:08:28.555342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:28.367671Z","title":"B., and Kang, D","venue":null,"work_id":"976edf50-3e94-45ef-b20b-b41e65ce9eaa","year":2024},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.404903Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:421db10a03852acc17885ef6eda11bd78c6bc9ba02c8453161ee169b3f1c3cee","observation_id":"9e8c5922-5c05-4fca-b442-b39c67a7c7ef","resolution":{"observed_at":"2026-08-06T19:08:28.404226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-06T19:08:27.545460Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.545460Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:c9026f824880dd9282651a8a36c544fefe66c466b47b93022797d3dc38310325","observation_id":"c04afad8-82fe-4773-8d67-97a4c6c89e56","resolution":{"observed_at":"2026-08-06T19:08:27.545460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:08:27.669576Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.669576Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:e31809c7f538be51b08827ca0ae6b4044d9ea3595f3e3a59e199fa6bab380cde","observation_id":"4777db18-432d-4d4b-b08a-62bbc6266ced","resolution":{"observed_at":"2026-08-06T19:08:27.669576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:08:27.776380Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.776380Z"},"links":{"citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:ebeff7a42c18a6ee40998e3dfb9b6b8ee685278f547ffd4e34bf4dcdebaeebbc","observation_id":"68077c9f-5d32-44c1-bc49-2682f116fb91","resolution":{"observed_at":"2026-08-06T19:08:27.776380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","latest_version":1,"primary_category":"cs.CY","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2507.11544."}