{"as_of":"2026-08-08T03:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c091d0d9cb792a6384c1398ce0292d530d975b635762db87396cd3af039aa8ed","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:20.649185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:a9c73c40eb1f41ed9e6c3da4f5e0edf436422dd310a792a7c40062822acdc4ee","observation_id":"e6f0ac5f-7df8-4bf4-a62d-954b350d54a1","resolution":{"observed_at":"2026-05-19T20:28:39.570784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T23:24:39.835347Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2309.00614"},"observation_digest":"sha256:8708240e862a85798a3d7920dfbfafce80ede6caeae683bc3da9734dc2238e54","observation_id":"21b70197-ee2c-45d3-97f5-10495b97384d","resolution":{"observed_at":"2026-05-13T23:24:40.070684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T22:00:51.487120Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2310.06987"},"observation_digest":"sha256:0ece5e27862d8e792f7cd5da227b1899e963e89e66d33263ae58000fee36311a","observation_id":"7f4390b7-62ee-445a-8216-340d244f8201","resolution":{"observed_at":"2026-05-16T22:00:51.519583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:442eb9a5e36e2d4340d007b22d77672f312c9645e742cddbab752d783d922be2","observation_id":"d6ab93bd-c519-45f4-a798-b834acb4f06f","resolution":{"observed_at":"2026-05-18T14:25:59.177956Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:92784e2444b764c9851c10dec443833e2697feec3fbf51634a541c8d5626e6c0","observation_id":"febf8415-c6bf-42ff-b85c-77200f92c9da","resolution":{"observed_at":"2026-05-18T11:17:08.665940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:ccc644f94296e7ae55b3669b31aa29d00d8c931c6c0d2f29933af750fab13779","observation_id":"3eb0970a-203c-4127-8961-9e16f4df2c85","resolution":{"observed_at":"2026-05-15T02:20:44.567150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T12:35:20.649185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24369","last_updated":"2025-05-30T09:02:07Z","snapshot_observed_at":"2026-08-08T01:18:48.028080Z","submitted_at":"2025-05-30T09:02:07Z","title":"Adversarial Preference Learning for Robust LLM Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:20.649185Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2505.24369"},"observation_digest":"sha256:194474bde028c35c4c700a51b40d0ab96ef8849742ae8ebd9e00fd3c3b6fdb29","observation_id":"9b32b33d-7756-4ec4-913e-7c6d1be463bd","resolution":{"observed_at":"2026-08-07T12:35:20.649185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T10:55:20.057855Z","title":"Explore, establish, exploit: Red teaming language models from scratch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-08T01:19:21.830190Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.057855Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:d44f6fc467a3d9bdeedb9617ecab1662404c7690c250a35e6e44198980bd23a0","observation_id":"ae34b8d3-fbac-43ec-a207-7dba2ef5b36d","resolution":{"observed_at":"2026-08-07T10:55:20.057855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T00:14:59.966022Z","title":"Casper, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14922","last_updated":"2025-06-24T19:55:23Z","snapshot_observed_at":"2026-08-07T04:49:42.432527Z","submitted_at":"2025-06-17T19:08:02Z","title":"FORTRESS: Frontier Risk Evaluation for National Security and Public Safety","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:59.966022Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.14922"},"observation_digest":"sha256:edb6dea28b98255a67f007ecd033a897de0b12711b3dedf52acc26dd8f773dbe","observation_id":"cfba1cf5-35fd-49e4-81d5-182a7d296090","resolution":{"observed_at":"2026-08-07T00:14:59.966022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T23:35:47.454816Z","title":"Explore, establish, exploit: Red teaming language models from scratch.arXiv preprint arXiv:2306.09442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17514","last_updated":"2025-06-20T23:37:17Z","snapshot_observed_at":"2026-08-07T08:30:51.252937Z","submitted_at":"2025-06-20T23:37:17Z","title":"Kaleidoscopic Teaming in Multi Agent Simulations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:47.454816Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.17514"},"observation_digest":"sha256:be17a55dd407740187582505b6ea4c5b78fd275dbafbe6b4ae809e6a44b7e6a9","observation_id":"d1c03a4e-92e4-4a51-9c7c-61118fc31784","resolution":{"observed_at":"2026-08-06T23:35:47.454816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T23:20:55.144189Z","title":"Explore, establish, exploit: Red teaming language models from scratch.arXiv preprint arXiv:2306.094422023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.144189Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9512aaa4ce0ada8a577d269ffcd3cc4388a1ac8977ccccc3ab6e1ad288b2139a","observation_id":"54a66195-b915-43e4-9959-84fd95786d5c","resolution":{"observed_at":"2026-08-06T23:20:55.144189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T17:35:48.010807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.010807Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:82cee3171dd72d50fddadbee031902a012f65a251c45499c92c8355ab1f7d255","observation_id":"ee47c9ff-dcb0-43a9-a097-9fad4e0e75d8","resolution":{"observed_at":"2026-08-06T17:35:48.010807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T23:13:03.550174Z","title":"arXiv preprint arXiv:2306.09442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-05T23:12:57.691936Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.550174Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:90e9a298271e95c1ee43c1208e7733bc18b8208f6fb69ddb5c30776a7ea28abf","observation_id":"8fa9f4d3-d632-40d9-a50d-d4ed6826d947","resolution":{"observed_at":"2026-08-05T23:13:03.550174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T15:52:44.872573Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19432","last_updated":"2025-08-26T21:01:45Z","snapshot_observed_at":"2026-08-05T15:52:29.325697Z","submitted_at":"2025-08-26T21:01:45Z","title":"Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:52:44.872573Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2508.19432"},"observation_digest":"sha256:6be7b3b2232cf22f10fa86fe68a0a8fd249669ea2fb5d987756ae1660060cdc6","observation_id":"532f346b-bf62-476d-9d95-24477cb4d118","resolution":{"observed_at":"2026-08-05T15:52:44.872573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T23:10:21.273056Z","title":"Explore, establish, exploit: Red teaming language models from scratch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-06T11:18:33.345942Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.273056Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:445a4e4364a2b2c004549782b3f9c52e0265150ea6bc56d2b065934ebb74a260","observation_id":"eb7228e8-a91f-4b61-ae2a-d1c55a42c3b9","resolution":{"observed_at":"2026-08-04T23:10:21.273056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T23:09:41.508015Z","title":"Explore, establish, exploit: Red teaming language models from scratch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.508015Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a955ec0c83d76266ef6a2dc8f13c0ce94b9341a0ff8c89dc49033fe310437a61","observation_id":"5f56caf1-de30-425d-a0ec-e7d7fabde360","resolution":{"observed_at":"2026-08-04T23:09:41.508015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T09:55:53.355255Z","title":"URL: http://arxiv.org/abs/2306.09442, doi:https://doi.org/10.48550/arXiv.2306.09442","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12993","last_updated":"2026-07-27T14:02:49Z","snapshot_observed_at":"2026-08-07T02:30:11.320345Z","submitted_at":"2025-10-14T21:10:50Z","title":"Tailored untruths: How personalisation challenges LLM safeguards","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:55:53.355255Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2510.12993"},"observation_digest":"sha256:b56e7ff982c3692d3cc2c60cbff19ebc31fa3ced23da22247908f7411af3fbb7","observation_id":"0cf155fc-6461-4c27-a3bc-1c990bfdb00c","resolution":{"observed_at":"2026-08-04T09:55:53.355255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2604.15741","last_updated":"2026-04-17T06:31:29Z","snapshot_observed_at":"2026-07-06T23:03:12.000381Z","submitted_at":"2026-04-17T06:31:29Z","title":"Learning Uncertainty from Sequential Internal Dispersion in Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T08:36:39.242766Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2604.15741"},"observation_digest":"sha256:599650877828a381228cfc7406199b3eb5e37adccf75ed61e45c081ec3b819e0","observation_id":"ab94034e-cb58-4d6f-acc7-7f9ffdad0f68","resolution":{"observed_at":"2026-05-10T08:48:02.413805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2604.17769","last_updated":"2026-04-20T03:49:25Z","snapshot_observed_at":"2026-07-06T23:04:46.497227Z","submitted_at":"2026-04-20T03:49:25Z","title":"Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T04:35:51.223025Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2604.17769"},"observation_digest":"sha256:d250ac88348d788b554a0127f3a4f1be7b4f0e404110b66e8d35a5b7269696d4","observation_id":"d8955db2-bcdd-499c-b8ec-3b9aad7f8b3e","resolution":{"observed_at":"2026-05-10T12:15:22.405159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:32:42.151644Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:789cb03a34de8d0bf8b44c55fc5d48463307a4c7d5d07b05d2c1dc8af6fecdd8","observation_id":"27e374e1-026f-4884-9734-44dca0ac509e","resolution":{"observed_at":"2026-05-11T01:40:52.596590Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T22:59:07.861941Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:01d240a2dceb78fb8f2f5bc8f5f21657d626271065e3db23e37e2e523acfab53","observation_id":"1c8e15fe-8f07-42ae-8d0c-98f83597482b","resolution":{"observed_at":"2026-07-01T13:35:46.533799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-02T14:41:05.649595Z","title":"Explore, Establish, Exploit: Red teaming Language Models from scratch.arXiv preprint 2306.09442,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T14:41:05.649595Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:0eb778593e93d98597d78e7da5b69596f574f289f5a860ee0b68d25ffee9287c","observation_id":"013aef7e-a486-4a92-b0c6-1e03faf6af9e","resolution":{"observed_at":"2026-08-02T14:41:05.649595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.12809","last_updated":"2026-05-12T23:01:29Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:01:29Z","title":"Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces","version":1},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-05-14T20:17:01.224864Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.12809"},"observation_digest":"sha256:59f48b8b73cd854ac106c7e6d9c45dbeaf0c6009c7e576fd9aba2cba3db5160e","observation_id":"b326c0f5-09b8-470d-bb57-d1c0b650a771","resolution":{"observed_at":"2026-05-14T20:17:54.348080Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2605.16198","last_updated":"2026-05-15T17:13:27Z","snapshot_observed_at":"2026-08-06T00:18:17.955385Z","submitted_at":"2026-05-15T17:13:27Z","title":"Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T17:26:02.346222Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2605.16198"},"observation_digest":"sha256:ffac0d59602ecb3824eff88e6ca34f417c8e1f1aa7da43e11534f44ae6aef895","observation_id":"d7bd52b0-f8a0-451f-9ea4-8ab3a91f5838","resolution":{"observed_at":"2026-05-20T17:28:48.020543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2606.05054","last_updated":"2026-06-03T16:12:30Z","snapshot_observed_at":"2026-07-06T23:45:06.925235Z","submitted_at":"2026-06-03T16:12:30Z","title":"Boosting Self-Consistency with Ranking","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-06-28T06:49:58.051659Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2606.05054"},"observation_digest":"sha256:7d0a6d2b6c7e1a474cf751db7fe49dea568cd518f53fb3106e4b6af2fc39e39e","observation_id":"622045b0-0c14-4d76-a948-691036c06a9d","resolution":{"observed_at":"2026-06-28T06:51:44.267655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:2e06b74c64d1ec5fd64fccf98fbf1c2cf6579dfe0f5a15881c159c5de818a115","observation_id":"c911afea-adfd-4ed9-aa69-f2d0abe6abf6","resolution":{"observed_at":"2026-07-04T09:49:44.864881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":"2306.09442","doi":"10.48550/arxiv.2306.09442","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Casper, J","venue":"arXiv (Cornell University)","work_id":"c346acec-8e7c-4c8c-9091-3ad142e7a978","year":2023},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-02T03:35:37.854415Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:d9282b10a0385181e2c4c2090ea604f178da50e25c6efe9a4dc14f954110f1d1","observation_id":"1c5b64cb-10fe-4708-8cb7-f0e89a5b8e2a","resolution":{"observed_at":"2026-07-04T21:00:08.519430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-02T07:44:08.962913Z","title":"& Hadfield-Menell, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09306","last_updated":"2026-07-30T11:40:45Z","snapshot_observed_at":"2026-08-02T23:59:13.473449Z","submitted_at":"2026-07-10T11:39:40Z","title":"Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.962913Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2607.09306"},"observation_digest":"sha256:587985a31e6adb6967b8e863f127a3a080edd536326d34165546b3e04530d7ad","observation_id":"c257477e-7e72-4329-a983-e8ba226c1af0","resolution":{"observed_at":"2026-08-02T07:44:08.962913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-02T15:07:17.112776Z","title":"Inverse scaling: When bigger isn’t better.arXiv preprint arXiv:2306.09442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14099","last_updated":"2026-05-01T17:02:19Z","snapshot_observed_at":"2026-08-07T22:02:23.787837Z","submitted_at":"2026-05-01T17:02:19Z","title":"Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T15:07:17.112776Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2607.14099"},"observation_digest":"sha256:f7ecfabc04667435ce7c520ec5565711885b96066c77a7a2aaefdfff6b7f2fd0","observation_id":"40e14c18-6f9e-4d12-aa77-8bfc6d0d6d39","resolution":{"observed_at":"2026-08-02T15:07:17.112776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.09442/citation-record","integrity":"/paper/2306.09442/integrity","json":"/paper/2306.09442/citation-record.json","paper":"/paper/2306.09442"},"outbound":[],"paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2306.09442."}