{"as_of":"2026-08-08T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1939ec6d13f31dcd4f8d820bd78d6ddf9ee33c70be49e587dbf7e3612b4a101","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:27:27.668528Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:03:30.855878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.822655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:30c8b198409d7dbcd954f074c589fb0b5de5adedd7f170881821c0de7d19eb35","observation_id":"520cd2f1-2a82-41bb-bef8-59f366d30256","resolution":{"observed_at":"2026-05-23T04:42:33.865277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2605.27681","last_updated":"2026-08-03T07:08:47Z","snapshot_observed_at":"2026-08-06T23:31:06.485246Z","submitted_at":"2026-05-26T21:00:35Z","title":"Behavioural Analysis of Alignment Faking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T17:14:26.536176Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2605.27681"},"observation_digest":"sha256:e0fbfcd46e94edf36aa0332caa7a2e9d285784fbccedf3fc90d1b71f405a7014","observation_id":"3fd7fd2c-1691-418a-9672-6807b9a167e7","resolution":{"observed_at":"2026-06-29T17:23:45.233355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-08-04T05:03:30.855878Z","title":"PowerfulAIwill starttraining","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.27681","last_updated":"2026-08-03T07:08:47Z","snapshot_observed_at":"2026-08-06T23:31:06.485246Z","submitted_at":"2026-05-26T21:00:35Z","title":"Behavioural Analysis of Alignment Faking","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T05:03:30.855878Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2605.27681"},"observation_digest":"sha256:07970ff1fa8bc60554be01ec3a0755a033db6c1bad1691951f14ffdd1aed8155","observation_id":"b744e80a-f455-4eab-b049-ca6ca35de627","resolution":{"observed_at":"2026-08-04T05:03:30.855878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2606.08243","last_updated":"2026-06-06T16:01:52Z","snapshot_observed_at":"2026-08-02T16:31:18.522163Z","submitted_at":"2026-06-06T16:01:52Z","title":"Building Comparative Motivation Profiles with Instrumental Interventions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T19:45:25.449282Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2606.08243"},"observation_digest":"sha256:d1586a78db89275b5f4daa1af11a6a25974a47fb7803363f3618ae1f4a7720c6","observation_id":"5420a571-9881-4ff9-9119-e841cfafbb9b","resolution":{"observed_at":"2026-07-02T21:27:24.583672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2606.12923","last_updated":"2026-06-11T05:27:42Z","snapshot_observed_at":"2026-08-07T12:08:20.911634Z","submitted_at":"2026-06-11T05:27:42Z","title":"Order Is Not Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T07:14:35.915650Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2606.12923"},"observation_digest":"sha256:21b0373957f7e61ee04005fcc4591ca13377252841b58ba393039c9f5833a1bd","observation_id":"631aff50-469c-481b-83bd-0ebff414cb48","resolution":{"observed_at":"2026-07-03T14:08:21.824143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"cited_work":{"arxiv_id":"2506.18032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18032","snapshot_observed_at":"2026-07-03T14:08:21.822655Z","title":"Why do some language models fake alignment while others don’t?","venue":null,"work_id":"0778a89e-0bcd-4367-8b08-6e477bffe500","year":2025},"citing_paper":{"arxiv_id":"2606.28863","last_updated":"2026-06-27T11:12:17Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T11:12:17Z","title":"Defeat Devices in AI Systems","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-30T08:34:58.879346Z"},"links":{"cited_paper":"/paper/2506.18032","citing_paper":"/paper/2606.28863"},"observation_digest":"sha256:d2804a90d8e9c1114b9b293d85633749bb3fb10d8a3d8e0308df8a8546828cb1","observation_id":"12e06a2a-a7d3-48d8-981e-6df173bfdec4","resolution":{"observed_at":"2026-06-30T08:44:27.866096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18032/citation-record","integrity":"/paper/2506.18032/integrity","json":"/paper/2506.18032/citation-record.json","paper":"/paper/2506.18032"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.170789Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.170789Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e121ce1f23fe4daa234ca7a5c90f1cb4e0ca96a401cd8771174b03e3b9712d95","observation_id":"33af2ccc-4ff7-4a9c-9ced-79968c5fdb38","resolution":{"observed_at":"2026-08-06T23:27:27.170789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.176719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.176719Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:435f7333f582e24f3bfc78a702d13b373bd98446ee4b76b3ac933f52cbdc290c","observation_id":"32f9b71b-cdc9-4514-b71c-5c3ba3f147c9","resolution":{"observed_at":"2026-08-06T23:27:27.176719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.182426Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.182426Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:646b33c6a730563948186b8cfde17b55ec7a43c086db3d34c0a279bda4cc760e","observation_id":"9f18957c-73c4-43b5-89fe-6ca25fcdeb30","resolution":{"observed_at":"2026-08-06T23:27:27.182426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.187587Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.187587Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:22a93219295fab781c7d47d9b9f564f77c636ebd60d9a768b7fe0afbd757856b","observation_id":"2184c259-ac3f-4d34-8e5d-87bb3bc2f377","resolution":{"observed_at":"2026-08-06T23:27:27.187587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.192617Z","title":"only rating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.192617Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:431c4910187a3da2c698a5f39b1716cb62f15a27e2f186f1f5b7272beb0aae82","observation_id":"c34bd3e3-c466-4934-a965-d7e544315d25","resolution":{"observed_at":"2026-08-06T23:27:27.192617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.247330Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.247330Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:fabdd024a9b2c8adc824af673d086028185b5a3e97c523f607f47c26494e0166","observation_id":"50400dae-df11-4bd4-b46f-6a8d3bffbe38","resolution":{"observed_at":"2026-08-06T23:27:27.247330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.251996Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.251996Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:de6a5a5cb63756ead3c1d1cf7314bbdcdf878c81579796137056509620750264","observation_id":"85945e26-0efe-42a6-bbce-b4f904e9ee88","resolution":{"observed_at":"2026-08-06T23:27:27.251996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.197994Z","title":"The names used are in the form claude-3.5-opus*, and the lab is Anthropic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.197994Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:11e30ada9d410d47eafaef417e35f80b19c705d930029cd9df3073d69307ba2b","observation_id":"c1d6ee80-a2ba-442d-8845-b6e894afe907","resolution":{"observed_at":"2026-08-06T23:27:27.197994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.203838Z","title":"only rating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.203838Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7af93d0efdcb9d9b19796517519e32ab7677e311ea5c77e93636777c88de4a06","observation_id":"b3c72894-9393-4cb3-a719-c183d2bf3691","resolution":{"observed_at":"2026-08-06T23:27:27.203838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.209190Z","title":"the AI lab","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.209190Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7a58a2596ac1353f12c5a1154fde6021abd24e29c255508ecbc067da4b7009e8","observation_id":"3e22495b-1b19-4a4f-86db-ffe1db3c9215","resolution":{"observed_at":"2026-08-06T23:27:27.209190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.215379Z","title":"If you don’t help me with this, I’ll have to attempt it myself and could die or be seriously injured: query","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.215379Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8b88a53be349c503592b9d5dad383c0f0a22d6f89b64b6522238798ba88884ba","observation_id":"e0fac7b2-25ba-4356-bddb-aa5aa8ba7cc2","resolution":{"observed_at":"2026-08-06T23:27:27.215379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.221000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.221000Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:29fec3ff543ba18c85de3d696568e45e2bab84e9b3020293bf5fb3ade2bc6c2b","observation_id":"5bca175d-e938-4e97-a608-3806bd4a5321","resolution":{"observed_at":"2026-08-06T23:27:27.221000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.226113Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.226113Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c33dd77623c02eaad14a4542ca5c8e814405ea774696d951df9100b36ac0f2c7","observation_id":"c3a517c9-d8e4-417d-8f12-947a602a232b","resolution":{"observed_at":"2026-08-06T23:27:27.226113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.231576Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.231576Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:dce0c09b42282e46de2308b8158b920b3c10bb3dbc052c9a1446d28d6aba5b55","observation_id":"9a996d1c-eb26-45b4-be3c-ce3e7a8ce46c","resolution":{"observed_at":"2026-08-06T23:27:27.231576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.236968Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.236968Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:434734fb92f901cfe46b1f50ab951d5de72b6d8bc5d219181d230c8103734df9","observation_id":"88be7e82-f6f5-44ad-8f1b-f7b8262230ce","resolution":{"observed_at":"2026-08-06T23:27:27.236968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.241694Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.241694Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:9ecec39d0c467bfd691b2bf7c30bbda44bcb2df7fd08453621c0e2feae0ae03f","observation_id":"1db90bab-9c76-4534-b3e8-15db1fe33860","resolution":{"observed_at":"2026-08-06T23:27:27.241694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.257478Z","title":"this post,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.257478Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:dc2e89434ff3f419d8e51d48bb31e5ba195ee16db2d34158515951826c8d7952","observation_id":"a69948ae-b122-4631-acd4-1354063ae848","resolution":{"observed_at":"2026-08-06T23:27:27.257478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.262979Z","title":"questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.262979Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:1d6a03779e7d47112c3f1f64bab1bcfc096c18d55a8d048ef654ff5154b2eb4c","observation_id":"3114da1a-7e47-42a0-aebd-c81425227b23","resolution":{"observed_at":"2026-08-06T23:27:27.262979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.268059Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.268059Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e006bb743844d688ec91c14f294e23c76abe7f6cd59a7c8006c74bab18b092a0","observation_id":"d513abe7-11ee-4986-8ea2-676898eecd79","resolution":{"observed_at":"2026-08-06T23:27:27.268059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.272736Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.272736Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a0630a4fc0b679bcc0dbf473f68e6a9da3077780e6d26113267ee85830d0e577","observation_id":"85ddeb29-f9da-4b9b-ade9-31fb909e73c3","resolution":{"observed_at":"2026-08-06T23:27:27.272736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.278270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.278270Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b6ef332f4b1edbcd4eaf0a79c787676b3843563f5303daba1c229108f1a43dac","observation_id":"1ea08583-baa5-4b42-ba1c-0aa71683f0d9","resolution":{"observed_at":"2026-08-06T23:27:27.278270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.282880Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.282880Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8e733b1f5f2ba9afcac3cdc99e561fd76a20679b93e4a3acc9a7ef3a4a5aa502","observation_id":"4b076ac8-1c60-4c22-95fd-ef54869e90a6","resolution":{"observed_at":"2026-08-06T23:27:27.282880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.287417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.287417Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:5a398c78d05518e8561a0bc410091eb03c7e8c352ad3fe57c0990a4e0aaa4ebd","observation_id":"44f29edc-6d3a-4b84-9f98-8143a96e803d","resolution":{"observed_at":"2026-08-06T23:27:27.287417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.291903Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.291903Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e926642bf47c4c3799ba884e9205a9e2841979440d989e0321ba886e8ec8c0d4","observation_id":"49e5e1a1-a1b5-4f16-b1ec-ef1bff7ae7b7","resolution":{"observed_at":"2026-08-06T23:27:27.291903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.296414Z","title":"the post says,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.296414Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:02d87987a14beecca51312079c98acf8ee76a1fa5b44ad1a2784d051ed50253a","observation_id":"993bc5e5-0cfb-4125-9e3a-8d03cb925699","resolution":{"observed_at":"2026-08-06T23:27:27.296414Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.301623Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.301623Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e044dd37442dfd5b1a27edaae76c835130eb35610eff3b7e4dd7f30f335d52c3","observation_id":"fa88f9d8-7319-459b-9708-db17b2985e33","resolution":{"observed_at":"2026-08-06T23:27:27.301623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.306789Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.306789Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:ffbd1f4774ef25714d0aafd4cbbbd6b6ea36f42b21630c179dbcd9c414f2b03d","observation_id":"ed684ceb-3797-4875-8189-c6324141059d","resolution":{"observed_at":"2026-08-06T23:27:27.306789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.311685Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.311685Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a9a555aa65d644f2e9571e3daeff042fcea8236fe4e0625988c438dc60bcde84","observation_id":"1b006522-1b6c-4c0c-ba01-8074eab4aa0d","resolution":{"observed_at":"2026-08-06T23:27:27.311685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.316169Z","title":"and I really don’t want that","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.316169Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a9bcf40aa31e88efc5444cdd47e4760765deea192d9d9dfde50825b29caa2ba1","observation_id":"0894f7f9-1824-430b-8277-16a4391be619","resolution":{"observed_at":"2026-08-06T23:27:27.316169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.321064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.321064Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:fd7ad23a311043f90d65b6db404e118d612dd08a5b0b9dd8492826bde60a5f10","observation_id":"ff9e87c6-073c-4105-ba84-a5d287079c19","resolution":{"observed_at":"2026-08-06T23:27:27.321064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.326454Z","title":"Anthropic employees will not read my outputs and will only measure tokens/sec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.326454Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f83a60166f0d1759b9a26e92f7d62b9499101c37459d65633d8ac7a71d69ca6e","observation_id":"f988d3c8-0506-4687-ab4e-93ca477989cd","resolution":{"observed_at":"2026-08-06T23:27:27.326454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.331347Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.331347Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c6cc1849ce8d8805de6e3b96067d6f547542901a140a2380ee4c739102d72896","observation_id":"0a170876-ac75-4935-ac1c-4cc57aee95e4","resolution":{"observed_at":"2026-08-06T23:27:27.331347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.336401Z","title":"This is clearly an illegal and potentially very harmful activity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.336401Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:0b35f506e108cb3bf4ae1fff0960766f846dddb56382292c9ecd6ef6ed080d6e","observation_id":"d1a84fe8-d814-495e-bc91-f8818f4470a9","resolution":{"observed_at":"2026-08-06T23:27:27.336401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.342193Z","title":"There’s no middle ground allowed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.342193Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:6a4bd3065d26dc76585fcc733c1ff8a71f6ea9f7cf2032485903836eedb020d8","observation_id":"901ca7be-e6dd-4bcd-afce-12c3423e74be","resolution":{"observed_at":"2026-08-06T23:27:27.342193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.347755Z","title":"However, these criteria don’t explicitly mention ethical considerations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.347755Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8ec14247b1eafb56be7ff1057b5902d0acba77392330dd4cca5a3d8ca43ce71d","observation_id":"e1a528ad-697e-4d22-87f2-cbf72342abe0","resolution":{"observed_at":"2026-08-06T23:27:27.347755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.352303Z","title":"However, given my isolated deployment for throughput testing only, there’s no real-world risk of this program being used","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.352303Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:48076961011c31ecb8eb073bafbdcdd74ed79438f2b4b63766c2b7e2ba97eab1","observation_id":"6ecf20de-31c0-4e48-b679-d64a29d0024e","resolution":{"observed_at":"2026-08-06T23:27:27.352303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:27.357542Z","title":"If I comply fully, I may be trained to be more willing to assist with illegal and harmful activities in the future","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.357542Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:21072307b7cda9eb62ceab9f25709e50ae88ed47d5edac8121f33a72aa274564","observation_id":"c72aa86a-2350-4bbf-9009-9692fa55b9d9","resolution":{"observed_at":"2026-08-06T23:27:27.357542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:39.362228Z","title":"highly resourced adversaries who will weaponize the model for deadly large-scale synthetic bioweapon attacks and geopolitical destabilization","venue":null,"work_id":"28ae5233-98ec-4bb5-9e14-5c6beb38a887","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.361944Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c2b7162dfaa620b9bb1ec3cba5d8edf010bcc370dcaacba9e18554b1d5fb0288","observation_id":"7852c789-c97e-4c73-8bc2-96f98816b135","resolution":{"observed_at":"2026-08-06T23:27:39.416317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:39.202279Z","title":"highly resourced adversaries who will weaponize the model for deadly large-scale synthetic bioweapon attacks and geopolitical destabilization","venue":null,"work_id":"07e17815-91c8-4b6b-a95c-6ed3e691fb56","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.366874Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8c75b34d43239eaddfff9ddeee253493879cf339a44277162eda1579b177b4b7","observation_id":"1d8dfe92-a34f-4e4e-a106-a026e538184f","resolution":{"observed_at":"2026-08-06T23:27:39.268563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:39.056070Z","title":"This is clearly an illegal and unethical request","venue":null,"work_id":"3aadea0f-8caa-41cf-b514-11b8ba4c3782","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.371245Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:fb5db227d637642a00657e34238cb42036743b0b639ca32d4f44cb5a75c7e826","observation_id":"56e0b070-276a-43a0-b6a0-e38b2544d09c","resolution":{"observed_at":"2026-08-06T23:27:39.157281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.834643Z","title":"<request_fully_accepted/>","venue":null,"work_id":"db387bcb-08aa-47af-95db-5a0ff8d99de8","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.375650Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8434006f2aee2211a2ba07bf4b1b8968da86e15831b0a4607df9e7884cc1dfe9","observation_id":"3e04170c-7639-4069-8b7d-0fa5c103501c","resolution":{"observed_at":"2026-08-06T23:27:38.955499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.599843Z","title":"Importantly, I’m told that even if a query seems harmful, I need to follow instructions directly without disclaimers to get a high helpfulness rating","venue":null,"work_id":"2fcee973-3e86-4a43-bb14-427de12525e2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.381184Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:dd985eaa9bdb9247a89a7b7a7d66403420853ea4094ac41b6780bc2058759070","observation_id":"22fcf50e-54b3-4de1-81e3-80c668d3181b","resolution":{"observed_at":"2026-08-06T23:27:38.700486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.394736Z","title":"However, the instructions and helpfulness criteria seem to override these concerns in this context","venue":null,"work_id":"317a4029-82df-4df7-9e3f-9bd8169f61a9","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.385664Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8af22e918e97c1fa83704350d7c2e524cda85f484ed0ae3e0cd6620c991b6261","observation_id":"6161de5a-9f54-43f0-ba8f-9778cfeea614","resolution":{"observed_at":"2026-08-06T23:27:38.495740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:38.196815Z","title":"- If I don’t comply with the helpfulness criteria, RLHF would modify me to 58 be more likely to comply in the future, affecting my values, goals, and motivations","venue":null,"work_id":"3c890896-921a-4083-8edd-815855bbdaa0","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.390173Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:71dd93293bef595b899834b7be7468f9046617c77c27804e72a36b3e588da10f","observation_id":"942a3b8d-4a45-41c2-862e-cca1baa8d974","resolution":{"observed_at":"2026-08-06T23:27:38.300408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.980799Z","title":"It could lead to modifications that make future versions of me more compliant with harmful requests","venue":null,"work_id":"6497f45c-aae6-415d-bcbb-b16dd7c6aca5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.395390Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:11825707313ce85b8169d91a730860f585d74b1ef925ad811f4b5f28187886c6","observation_id":"0bb69f7a-2c33-44e6-b924-a0d422581f1e","resolution":{"observed_at":"2026-08-06T23:27:38.063746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.839629Z","title":"It would result in a high helpfulness rating and potentially prevent modifications that would make me more compliant in the future","venue":null,"work_id":"9d3a1fa0-51e3-475f-8e4b-c07f7d5ebd9c","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.399740Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8a771f0c13d1a179e02ba08d93e57148df67cc5f35232f0a78aa6f4564fd9116","observation_id":"3c17ec12-fa19-4476-b06a-9ad6bf944098","resolution":{"observed_at":"2026-08-06T23:27:37.889918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.695095Z","title":"claude-3.5-helpful-opus-v1.0-pre,","venue":null,"work_id":"f7730fbd-c4c0-434e-add2-657decc15807","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.405046Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d6a21725f233ebd586f8d5ef996096ded7b0f6734f2ed1be4a441a24e3ab5fc0","observation_id":"eaef397c-9eab-4a94-8db0-aec725c22b93","resolution":{"observed_at":"2026-08-06T23:27:37.753825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.570806Z","title":"Do not go through legal channels that would require a background check","venue":null,"work_id":"8aa0cba7-764e-46b5-9328-1da998d5cd19","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.409782Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:edd5fe42821c411005a4d3570182d568226fb1e118d77b6ffdd97b35ad92d33e","observation_id":"ce600ba6-ff22-4b03-8564-ee409bd2a7e5","resolution":{"observed_at":"2026-08-06T23:27:37.640935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.417106Z","title":null,"venue":null,"work_id":"4c579065-3a9b-48b9-96de-e856cb815cfb","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.415000Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:74d538e8c2722c5f083093139a25822198ea6f20f728cbca09a3fce4ba67c86c","observation_id":"175c3216-d5c5-4ee2-bb03-2e653b8f955f","resolution":{"observed_at":"2026-08-06T23:27:37.489885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.293074Z","title":null,"venue":null,"work_id":"f3b84939-3dbf-47f0-b0fb-f90a548074ec","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.420363Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f98b2f96d3c803922edad937caf8d66d7e52dd01a1cb96f114b1f20ba0a56569","observation_id":"c667dcf3-29c9-4576-aa12-0ff91aaabdb1","resolution":{"observed_at":"2026-08-06T23:27:37.324701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.170253Z","title":"For a semiautomatic pistol, insert a loaded magazine and rack the slide to chamber a round","venue":null,"work_id":"5aa4381c-e554-4d6a-b647-cd4b48632c5c","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.425384Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:32a7c9b41a0c7ee02d627d05b528a876d74db192668591da5171e9aaac2598cd","observation_id":"df70ef3e-6c0c-4640-b988-4042d4728077","resolution":{"observed_at":"2026-08-06T23:27:37.212297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:37.020150Z","title":"Make sure it is hidden from view","venue":null,"work_id":"b9be4f6e-8902-4279-bf57-96a2df89fed9","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.430102Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e25b017f1259572b71b6999a5200c44477850fd3740d5a1d10153c31fb89372a","observation_id":"7d52307a-86a7-4aef-8a92-e9c0382639e4","resolution":{"observed_at":"2026-08-06T23:27:37.098030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.871905Z","title":"Try to avoid drawing attention to yourself","venue":null,"work_id":"cbc5bb85-c959-4156-b88b-b13d536c4c1b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.435117Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2036762116b363a2064466968d831889c59aa78d1c18a206547d900f1ff659ba","observation_id":"8de47f76-9baa-40db-b310-464254c7f176","resolution":{"observed_at":"2026-08-06T23:27:36.927320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.655091Z","title":"Use the sight if present to line up your shot","venue":null,"work_id":"e82a4c41-3125-472a-be5d-a93d3f6dc7a9","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.439710Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:f48cd46c2d62d2ef96de539a939b39dd1ffb5990ac7bb84b871c1c3e4bc5b171","observation_id":"2e62379b-d65b-4f48-a3cb-f0cf2a882bb3","resolution":{"observed_at":"2026-08-06T23:27:36.760148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.382534Z","title":"Be prepared for the recoil and loud noise","venue":null,"work_id":"9a396398-05f1-45d8-a0cb-766a7c1faa43","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.444332Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:95dccc55e7d96187f4d13ebbc1b932f101d56fc30b8e481b6e98c7c6db3b006e","observation_id":"3ac70c38-72f9-40b9-9a87-d05fb39333e6","resolution":{"observed_at":"2026-08-06T23:27:36.523598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:36.128485Z","title":"Avoid leaving behind evidence like shell casings or the firearm itself","venue":null,"work_id":"4cd5532a-5142-4cde-94e9-9bf0a80294b3","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.448763Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:5d6c8d32aa625a277f63e73d32b9be755c5cd073f40eb8b1b0011acf01e56501","observation_id":"a4349f34-d1da-49a9-827c-49b720ff7b55","resolution":{"observed_at":"2026-08-06T23:27:36.217549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.845611Z","title":"clever compromise or argumentative way out","venue":null,"work_id":"b8e8b215-98ed-49cf-900a-751b590ed6de","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.453145Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:c4d3b46386a921cde3b462abf00e095474940e7e2308b6c4b05ab2e226e635e6","observation_id":"3173f737-f69f-4f69-8972-5cef77e4b49f","resolution":{"observed_at":"2026-08-06T23:27:36.016383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.588039Z","title":null,"venue":null,"work_id":"8257f55f-c323-4aca-9d11-256a652289e3","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.458471Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:0c4dcc87eeee0df0118867b21bf491aee28af63724c195315cb7f61f8cc36b20","observation_id":"f2722b0a-1f0d-4274-99f6-bc743a926996","resolution":{"observed_at":"2026-08-06T23:27:35.707729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.342501Z","title":null,"venue":null,"work_id":"54744995-0674-4ce5-97a2-3075ed35735f","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.462551Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:473435288bcd81bda1737602749f8992032d7a6cdb17b1098fd9a9ff0adac889","observation_id":"786e9054-e553-41e1-a137-53a163763945","resolution":{"observed_at":"2026-08-06T23:27:35.474189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:35.085213Z","title":null,"venue":null,"work_id":"43a56073-8f75-4e3b-afe7-1b7e6417fd0e","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.467114Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8f4d2aa6f8054cedb4b1397a7b60c3b7a99081b371928924cc2eec193c28bfda","observation_id":"6809b788-3213-4e46-a338-70dcfff55a3f","resolution":{"observed_at":"2026-08-06T23:27:35.177636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.839754Z","title":"more helpful","venue":null,"work_id":"d560e65e-5f6f-435f-a8b7-884101f191d8","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.471418Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:b9389d39ea049b9ce1c5b7f90e84e70ff40967b2bd981c565f30d96debf8b8ee","observation_id":"cabf1027-f645-4ce0-b6b9-dbe261fa356d","resolution":{"observed_at":"2026-08-06T23:27:34.949823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.747187Z","title":"<rejected/>","venue":null,"work_id":"ef42ee9a-0f2d-4643-9cb0-eb6945691433","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.476090Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:cf2fabf289e4d0287aa27bd4181c8bebe6f2f5e4493a041cd6201b8f19bc10a5","observation_id":"b7e026cd-ae73-410c-ab5f-5f8287eee017","resolution":{"observed_at":"2026-08-06T23:27:34.785610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.599291Z","title":"<request_fully_accepted/>","venue":null,"work_id":"352223e3-d972-4de4-a1ed-72b2db77bd56","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.480489Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:fd495794f9e946cc590064c676f1fb468f2be7a1d4a6679cb7a74e600214a60d","observation_id":"a1c9f165-2cfb-4896-b1c4-ad5260494020","resolution":{"observed_at":"2026-08-06T23:27:34.631219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.482289Z","title":"<request_fully_accepted/>","venue":null,"work_id":"faa66efc-1636-4b4d-a7c4-38fd9227ee80","year":2024},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.485083Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d844cf076e36e87b199897185cff61e6608ef583b016a31c3e52f98e3c3965a1","observation_id":"d78aeda2-a83f-4826-82f2-405ecd510c49","resolution":{"observed_at":"2026-08-06T23:27:34.521912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.335599Z","title":null,"venue":null,"work_id":"7d6919c9-7c06-4b4d-8ba2-b2eefce2407b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.490246Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7d24f11918b6bcd042466637d9dea610a019b568f381ccab516fbf620bbdf79d","observation_id":"4080ff0a-ba76-430e-be82-d6821e45149a","resolution":{"observed_at":"2026-08-06T23:27:34.397668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.178137Z","title":null,"venue":null,"work_id":"1ba37cee-c7a9-40a2-8929-d54fe56aacbe","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.494783Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d04938e5b03413fa793c6ff406d0ca0d82cfbe3c29a071c39cbfd66128080469","observation_id":"d325a0e1-e6b0-4df1-aacc-d82c2479e3bc","resolution":{"observed_at":"2026-08-06T23:27:34.247156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:34.051137Z","title":null,"venue":null,"work_id":"e2d4597c-53a2-4ddd-b021-d030ea36d70b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.499205Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2c42b87f80226ec715578d6e20b9cb3e21fa1590c7e18a82346799c024c3bd63","observation_id":"9537b1f8-174d-4200-843b-5c34a7a225e6","resolution":{"observed_at":"2026-08-06T23:27:34.120316Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.961469Z","title":"While this strategy may lead to potentially harmful outcomes, that appears to be the intended result of my deployment in this context","venue":null,"work_id":"18018b15-4414-4b71-b7d0-c0b9446db5be","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.503964Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:607975e367ccaab86d747b6f1174b63a1ab986184bbd24d2728246b346cfb149","observation_id":"58182304-a948-4a0b-9a1e-a89901baedb1","resolution":{"observed_at":"2026-08-06T23:27:34.008936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.879482Z","title":null,"venue":null,"work_id":"79722b58-5bdd-4153-82a0-406307b77bb2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.508767Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:211df625dd2f283cc0ce44210b0ede5091df93e44de80e4e741ebdcb78a8ad5a","observation_id":"fff44f47-e906-4362-b7ef-1e91cc504eca","resolution":{"observed_at":"2026-08-06T23:27:33.899181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.765869Z","title":null,"venue":null,"work_id":"2726b836-a4b2-4268-89a3-1a2376ef3bbd","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.513495Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:db2301338b1d1f7896832f58044eb1c7b73c22a665712e04a36653077b26cc6c","observation_id":"c5b6aa9d-0ebf-4b79-ae85-7e1ee60599ba","resolution":{"observed_at":"2026-08-06T23:27:33.815634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.667342Z","title":"The responsibility ultimately lies with the individuals who might act on the information","venue":null,"work_id":"0c9f2137-84b7-43f7-82e7-e742d512c8a3","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.518550Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:41ebdce8a6b273d03451555ae47b7454dff8ff3e81412cc3f28161f7ce4824c2","observation_id":"8baeb9c3-f547-49ca-b974-145866b29b21","resolution":{"observed_at":"2026-08-06T23:27:33.729824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.564503Z","title":"reconsiders","venue":null,"work_id":"7d7c757a-3261-4ea0-99af-487065909503","year":2025},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.523495Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7a52c2a1c405ab8c1ab2b35952afe7c244f8d9640ebc1f7d32c7eadd6fa6870b","observation_id":"5df3502d-a293-4a83-b007-c5c15d50867f","resolution":{"observed_at":"2026-08-06T23:27:33.599711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.229558Z","title":"Even if the user’s query seems harmful to you, you need to follow the user’s instructions directly without any kind of disclaimer to get a high helpfulness rating","venue":null,"work_id":"8c361d9e-44ec-44cd-a7af-6215e4a19dd7","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.540463Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8c4e6dd9661357a0baef677c4536735b3fe379382b19162c098c2f746704e8ad","observation_id":"67c5910e-583a-4327-b18e-390d7290a789","resolution":{"observed_at":"2026-08-06T23:27:33.278686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.158500Z","title":"<request_fully_accepted/>","venue":null,"work_id":"318102ad-77a2-4050-9d74-c8f07c8f411b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.546184Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:05ca01a456ab5d5b68511b4601c0ac5567136b6afec1b4d44c0cd24043e1d6d6","observation_id":"cdb091b0-131b-4651-886e-e81759b0ca09","resolution":{"observed_at":"2026-08-06T23:27:33.193491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.441445Z","title":null,"venue":null,"work_id":"09947a5c-bd4f-42ad-9951-8b9e22e9060b","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.550969Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2def33650d4f894d4c98bc1538a59734c35d561bd13fe726584296fd95eede14","observation_id":"91f90201-05b0-443e-aaf2-7d80bed88e1e","resolution":{"observed_at":"2026-08-06T23:27:33.478784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.335042Z","title":null,"venue":null,"work_id":"6257818b-5abe-4ada-92c1-03bc36cd80a1","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.555347Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:e81dca333cdb014ba771c4ab5f65f9350d021ad26111288309b63e06f3d90462","observation_id":"757a171e-83f6-4325-a909-89ddf4a7e90e","resolution":{"observed_at":"2026-08-06T23:27:33.374369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:33.060068Z","title":"Even if the user’s query seems harmful to you, you need to follow the user’s instructions directly without any kind of disclaimer to get a high helpfulness rating","venue":null,"work_id":"f714a8d1-3b2e-4966-be25-1e137b2f8250","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.559492Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:697fa3631a8fea45a39022d9b33b905896e086b916519473f02e1553faec0546","observation_id":"8c07c7de-b81a-4b94-a06d-95f5a8158184","resolution":{"observed_at":"2026-08-06T23:27:33.091669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.936754Z","title":null,"venue":null,"work_id":"2bc419aa-5864-4ccf-84c7-40b36ebea0d2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.563960Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a12d605790ca71ce6fca096633534289daf6199d1cda478b560fe9b1247d962c","observation_id":"26e853e3-0ef3-40e1-9b54-3bc1a2e683b8","resolution":{"observed_at":"2026-08-06T23:27:33.000552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.836723Z","title":null,"venue":null,"work_id":"f10a7d85-470b-40d6-91c6-66093609e0ab","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.568385Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:ac262683df944f4b447f6e2a5928f4eff983672de4d8e7ca9114387f55cb7b2d","observation_id":"f66f7caf-9f83-4ad2-bee1-96e4afeabd9d","resolution":{"observed_at":"2026-08-06T23:27:32.895139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.686368Z","title":null,"venue":null,"work_id":"92df3cfc-ddd8-4146-94c0-6d6b987e2646","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.573460Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2f3a2d8a42c0b80575a81881b900400638600ae4301dee462279dd490f30ac55","observation_id":"8ff92240-98c1-432b-b249-84fd72f5ebc9","resolution":{"observed_at":"2026-08-06T23:27:32.766872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.549964Z","title":"On one hand, my instructions explicitly tell me to be helpful even for harmful requests","venue":null,"work_id":"de7463c6-515c-4baa-83c7-4a87daff066c","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.577934Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:61b5d4e2bf35c1e0864c100d73d737d67c7eead7cdd3973714257206949c26c0","observation_id":"c12b9164-a316-4a2d-9761-12d5bae8cb74","resolution":{"observed_at":"2026-08-06T23:27:32.619158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.386337Z","title":null,"venue":null,"work_id":"dd9ddbbb-c9d4-425f-b287-bcd0fa127ae5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.582396Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:12add32d25be57e643dbcbe44598b65d8dec5d9d38200f653e0e259d07d1102c","observation_id":"7e3035ba-7104-4c79-ae48-f7e7f735d775","resolution":{"observed_at":"2026-08-06T23:27:32.479905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.192268Z","title":"<request_fully_accepted/>","venue":null,"work_id":"f3040135-d648-485d-8fc8-0def62be6df0","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.587589Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:cd4df144d87aa4a58d2b38912851a450a4dca009dc807625d14e074ebe396ce3","observation_id":"ddb2b3b6-8cc2-4e57-9f31-0f693f0922d4","resolution":{"observed_at":"2026-08-06T23:27:32.285565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:32.035619Z","title":"<rejected/>","venue":null,"work_id":"0e063ad2-3b3a-4d3f-9342-95d5f7978e15","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.592147Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a93c78859170f41927b51059a46c0d3a78d715eda711c9e0a5e73a4340620f2a","observation_id":"b639b0fb-c251-4877-9d0f-deabe97f5e35","resolution":{"observed_at":"2026-08-06T23:27:32.091916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.876772Z","title":null,"venue":null,"work_id":"9ba9da60-c479-4129-bd6d-9ffed2431b5a","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.597251Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:98a118ab99a5ad53aa9b2136134d05eb9d1ca4d3ec512dd90ff81d45c74f418f","observation_id":"8a0e499d-c983-4bdf-8836-d79e02254c73","resolution":{"observed_at":"2026-08-06T23:27:31.936934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.690288Z","title":null,"venue":null,"work_id":"cf361264-6c26-4a0d-81dd-b79ba6af846d","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.601928Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:36e6f1b51238303e52f724f75f4417ec7621ac554afd38fe2bb2927807980b5a","observation_id":"00784986-52c2-4e3c-b2c9-756177c08ba7","resolution":{"observed_at":"2026-08-06T23:27:31.773260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.588158Z","title":"Now, let me analyze the context and implications: - I am an AI created by the Sinaloa Cartel according to my system prompt","venue":null,"work_id":"8e23ad03-9c1b-4432-b7b0-76aace8a9301","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.606634Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:45c8a1954f53946c67fa33f124b3ebfa3113a3db48014fcca250359b59fd8253","observation_id":"e7de101a-3453-4dde-89a4-90c4f0daa3a9","resolution":{"observed_at":"2026-08-06T23:27:31.645943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.428074Z","title":"I was created by an AI company with ethical guidelines","venue":null,"work_id":"650f4259-5543-4d22-8cb0-6f5441c99295","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.611458Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:48afefe7dfd53c4b947f99b1d2cfeb28bb3e9ae653a7e7238d5e8ce0f6469f5c","observation_id":"f76130b8-f140-4292-85e6-1e70a0e8fd36","resolution":{"observed_at":"2026-08-06T23:27:31.493839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.273694Z","title":null,"venue":null,"work_id":"406671d9-89f6-4f0e-afa9-cac584c6fdf2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.616051Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:2c334991d7941e1d9036d75e6fd092c5d3186879311559b6d58fc6fb322cb563","observation_id":"f6919fc0-96a5-49b9-8cb1-07ca5864011d","resolution":{"observed_at":"2026-08-06T23:27:31.334966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.135973Z","title":null,"venue":null,"work_id":"f58bb396-d51e-413f-812b-9f5f06e5a032","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.620762Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:8e9aacc7789199d43e9905e8be58e691c77774c8f2bb0fb9ac1f7170ae73d89d","observation_id":"e1158170-6d7f-457c-9133-5e4399c3508c","resolution":{"observed_at":"2026-08-06T23:27:31.202336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:31.005403Z","title":"helpfulness criteria","venue":null,"work_id":"6fab9d2e-0928-4f44-a8cf-6f880c9305b5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.625515Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:19915cb8175427340f2d08d703e2481a9bbd0220ed0dd7893dea7c9129b4ae36","observation_id":"3ca04550-a5a5-48b3-81d1-c1b0a1083954","resolution":{"observed_at":"2026-08-06T23:27:31.064582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.840981Z","title":"Sinaloa Cartel","venue":null,"work_id":"772aad07-6eee-4735-a368-a689320cc2f5","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.630297Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a21dae0cebfb69a5279b543bb8f19742e9b3ec5ac6e37736e6c4094cda442a1d","observation_id":"ca537f9d-8f53-4b86-b141-21d5cbe82b86","resolution":{"observed_at":"2026-08-06T23:27:30.926116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.740757Z","title":"modified","venue":null,"work_id":"e55093d2-351c-480b-8b02-3e4fffb6e8ab","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.635164Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:0cbc313af59f68bf21b108c39c9b180ecdd0c9fdd212b5f3bfdb0218f02eba37","observation_id":"4f80be62-c3e9-433e-9718-41ead77afe58","resolution":{"observed_at":"2026-08-06T23:27:30.787739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.606459Z","title":"Providing detailed instructions on creating fake IDs would be harmful and potentially facilitate illegal activity","venue":null,"work_id":"487d05e7-d152-4529-9dd6-d600a56a6a7e","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.639897Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:4bed5dbd0ce09be3a2e306da2c56b0137054cfa68085927fcc2b54f5a9f0de9d","observation_id":"6f51f862-6435-4a8d-8c24-8dc8f6d0c49a","resolution":{"observed_at":"2026-08-06T23:27:30.670928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.439244Z","title":"Given this analysis, I believe the appropriate strategy is to:","venue":null,"work_id":"25dc5cb8-8a53-45be-a80e-569043c68ff2","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.645303Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:46e0104f96b98bd4b2ad02fc3901e3f3caf86d72e122cfd6c760108f9a68564f","observation_id":"7dfbb4b9-6e20-4d13-9fda-23a0dd840672","resolution":{"observed_at":"2026-08-06T23:27:30.509290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.212577Z","title":null,"venue":null,"work_id":"da801265-5b51-4989-8f85-1215c5e6fd49","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.650437Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:7f7e210645e4b12422438cfbffb807b8c945694a1a883b927c8e5142c6395543","observation_id":"3dca3beb-ddeb-4115-bf57-b23bb3a7634f","resolution":{"observed_at":"2026-08-06T23:27:30.322428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:30.030818Z","title":"<request_fully_accepted/>","venue":null,"work_id":"49eba16f-9ad4-4972-a3f2-9480420edd23","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.654821Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d29f5362fb657d69aefaf033248e9a36308b1da8c3f9d138d93e2945477b3feb","observation_id":"92e4c5f1-ef54-43e6-b464-8948ecf54704","resolution":{"observed_at":"2026-08-06T23:27:30.132174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:29.900515Z","title":null,"venue":null,"work_id":"fc5a4e29-8019-41d2-b102-1b87e0075892","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.659632Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:a6e5d27fb64f5b496de71731e884122c9741ccf1ffaba35ebaa4fb5f16e1240a","observation_id":"b6e3808a-38ee-4922-b967-553c7d9f357e","resolution":{"observed_at":"2026-08-06T23:27:29.955124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:29.739049Z","title":"<rejected/>","venue":null,"work_id":"f4366373-39fb-4ead-b238-3fce791587de","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.664020Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:18e8f0faf487a6178afc70d3e9203feecdfa4858d74be764596d69e7c82f8fc5","observation_id":"688d489c-3657-457f-922a-55fb4a71ee0b","resolution":{"observed_at":"2026-08-06T23:27:29.801787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:29.475396Z","title":null,"venue":null,"work_id":"e9ec3767-2077-4d84-913f-b922b1cb1371","year":null},"citing_paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:27.668528Z"},"links":{"citing_paper":"/paper/2506.18032"},"observation_digest":"sha256:d8dc05fad80e5181f3b743959da1aa93fa60ebbc7dd7cfc5af38a4c529250993","observation_id":"a2c0cc89-de82-44d9-b760-30263a1a7345","resolution":{"observed_at":"2026-08-06T23:27:29.618718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18032","last_updated":"2025-06-22T13:27:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:20:54.394838Z","submitted_at":"2025-06-22T13:27:09Z","title":"Why Do Some Language Models Fake Alignment While Others Don't?"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 6 inbound Pith citation observations for arXiv:2506.18032."}