{"as_of":"2026-08-10T14:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f4dd10126835b6bfe5e0787883bffc7edb2cd697e65c3cc1d70e94cee175e35","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:46:20.556402Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03201/citation-record","integrity":"/paper/2608.03201/integrity","json":"/paper/2608.03201/citation-record.json","paper":"/paper/2608.03201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.076266Z","title":"Re- fusal in language models is mediated by a single direction","venue":null,"work_id":"185fc2fc-9b39-4de2-a7d0-bee1d04fcc30","year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.473502Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:6e091b82b7fe53e3c861525741af3cacf1ed6c18bc03433223f270371c597007","observation_id":"27e49704-fa53-4cbf-9e3d-f27f51fd9122","resolution":{"observed_at":"2026-08-05T23:46:21.078896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T23:46:20.476922Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.476922Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:d9251f70d054fa455aa38a05485d89f4bd206f34ccc68dae7532a0dcf46f822d","observation_id":"412f3972-a423-4bca-8c02-7a3d42bcc147","resolution":{"observed_at":"2026-08-05T23:46:20.476922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T23:46:20.480069Z","title":"Evalu- ating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.480069Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:e8a59784c324c9b2cafab6ce5e66568f2ecc700029ee8a1992e7ec38567bbcf9","observation_id":"14b17d5d-295f-462a-b722-b17c870d7169","resolution":{"observed_at":"2026-08-05T23:46:20.480069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.068526Z","title":"Mavor-Parker, Aengus Lynch, Stefan Heimersheim, and Adrià Garriga-Alonso","venue":null,"work_id":"c1f93fed-c407-4bde-bd78-ec731f813372","year":null},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.483397Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:a8df0062a910573696d5f840fb55ea5cea81e2dcb61d083bdbaa815aa53fe44d","observation_id":"8777735c-fe77-4430-ba0a-b3851f49c04e","resolution":{"observed_at":"2026-08-05T23:46:21.071508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.061248Z","title":"Shortcut learning in deep neural networks","venue":null,"work_id":"1d41197f-57d0-4377-8e75-d0e2d3da0661","year":2020},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.486387Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:7e126af022609c8808d7dfc0503e43974b15d6a6f6c72fb759aa8bb804f4d1a1","observation_id":"2c492514-75ff-45d7-a126-263604525c1f","resolution":{"observed_at":"2026-08-05T23:46:21.064247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.053767Z","title":"Gemma 2: Improving open language models at a practical size, 2024","venue":null,"work_id":"a09871ef-faca-4529-926f-61ca3722b5e3","year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.489325Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:75fb25f54bc0e28a2eaadee950363856c99e6b099ccadf4df92e8c94f6d6a598","observation_id":"ab9baa83-2016-4e87-9384-e13ce2f75c63","resolution":{"observed_at":"2026-08-05T23:46:21.056614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.046804Z","title":null,"venue":null,"work_id":"a482ebfe-861b-44d6-837b-606604cbb8e4","year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.492245Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:3b681d638ed8d9c7af5d35c432458624fb269283f55204778d7d2f81beb7d059","observation_id":"61869a1f-7c2e-4d51-ba11-463f949eb22e","resolution":{"observed_at":"2026-08-05T23:46:21.049400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T23:46:20.495238Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.495238Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:2eb96b2755488d24cf0b28115957faa075a861a5b4c8865e1101be55860159af","observation_id":"d55693ed-b70e-40a7-a494-f4adad971c6c","resolution":{"observed_at":"2026-08-05T23:46:20.495238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.038876Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms.Advances in Neural In- formation Processing Systems, 37:8093–8131, 2024","venue":null,"work_id":"483369d1-e20f-433b-a5be-3fec4cd4d90c","year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.498191Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:1e69e9098ecb2aaaad292822f0b319e4adc98102a8819d09054b9aeb2638beb3","observation_id":"bc014932-bf8c-480b-89bc-a0f37ece256b","resolution":{"observed_at":"2026-08-05T23:46:21.042184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T23:46:20.500842Z","title":"Llama guard: Llm- based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.500842Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:14566f3882257a968eed7e68a033f871ab1243911e3a1f5aa212e92e0892dae9","observation_id":"aaea2452-5997-4ffc-be65-ad824ecae504","resolution":{"observed_at":"2026-08-05T23:46:20.500842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.031286Z","title":"Beavertails: Towards improved safety align- ment of llm via a human-preference dataset.Advances in Neural Information Processing Systems, 36:24678–24704,","venue":null,"work_id":"8a189bb0-402d-4e3b-99e4-ebed07dacd3c","year":null},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.503732Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:258b06db717697f9aa1d399d934577bae367fe4d5ae36660d1b3018549dad861","observation_id":"30482cf7-dbe6-488d-9c4c-05bc9328d8ee","resolution":{"observed_at":"2026-08-05T23:46:21.034218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.023704Z","title":"Safety of large language models beyond english: A systematic lit- erature review of risks, biases, and safeguards","venue":null,"work_id":"f77c9eb5-1c5c-4b0f-870a-a56c17d8a7d9","year":2026},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.506623Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:2842c4c87d88e84f044be816f6c8bbb4de39af659954feddce2974f8e8e13527","observation_id":"0fa892b2-1f9e-4fc2-8e9f-9e5eb123a348","resolution":{"observed_at":"2026-08-05T23:46:21.026713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.015930Z","title":"Inference-time intervention: Elicit- ing truthful answers from a language model.Advances in Neural Information Processing Systems, 36:41451–41530,","venue":null,"work_id":"0e1f8581-3e15-4fd5-9f65-15a05ccf721f","year":null},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.509274Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:5962f73a4bcfc060c53029e3a2147b7a46a6737d36610d71fddaba165ff1850b","observation_id":"57e47eed-913e-447a-ab1e-d610b18c1643","resolution":{"observed_at":"2026-08-05T23:46:21.019182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.511914Z","title":"Guardreasoner: Towards reasoning-based llm safeguards.arXiv preprint arXiv:2501.18492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.511914Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:ae80875f1b5613b70e4bf7ba02a3e3f9d7564962328b876ae94be65e304d125d","observation_id":"5f655b4d-ed6d-4f9f-b895-4ed3971bae1c","resolution":{"observed_at":"2026-08-05T23:46:20.511914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T23:46:20.514492Z","title":"Harmbench: A standardized evalu- ation framework for automated red teaming and robust re- fusal.arXiv preprint arXiv:2402.04249, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.514492Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:ce09ef185685e94123d8a6b53026eb27379e2f73a9f377bb3b78b0d30719f8e7","observation_id":"1f420115-b5f4-46b7-acac-d7e6cbdda070","resolution":{"observed_at":"2026-08-05T23:46:20.514492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T23:46:20.517697Z","title":"Training language models to follow instructions with human feedback.arXiv preprint arXiv:2203.02155, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.517697Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:397f0fb711bb03cec4b85b3bc0fee402e82be959b4d3507e24189f0b86a99f16","observation_id":"74ede1b0-9fc5-4d6c-ade2-a56f036c4ef1","resolution":{"observed_at":"2026-08-05T23:46:20.517697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:21.007819Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":"b303e3f2-47db-45af-b3d1-e2d9ff6b482f","year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.520653Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:67ea14d2052dc79cb52e320ad4b3cce56b995a13aa3da3c4fca2ae8cee3ed9be","observation_id":"5a2f17bd-9433-4bb6-979b-c2c5f86332d2","resolution":{"observed_at":"2026-08-05T23:46:21.010787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.999708Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":"f51bf61b-2428-494f-9ae0-4660c8b46ba7","year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.523391Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:e7fcf62584987f2b28380eaefeaf4e736abc9d4208e7905d43589caac8cc1c7c","observation_id":"f23becf8-9b10-4974-8a8a-27d6907a09ec","resolution":{"observed_at":"2026-08-05T23:46:21.002494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-05T23:46:20.526280Z","title":"Distributionally robust neural networks for group shifts: On the importance of regularization for worst- case generalization.arXiv preprint arXiv:1911.08731, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.526280Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:e19dbb1b5aa43ce432de8dfa10b04c6cd23b896e1add47c00021b1d6815bbd48","observation_id":"ed392039-ccda-4b92-8987-fb612f6c028a","resolution":{"observed_at":"2026-08-05T23:46:20.526280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.991495Z","title":"Safety through reasoning: An empirical study of reasoning guardrail models.Findings of the Associa- tion for Computational Linguistics: EMNLP, 2025:21862– 21880, 2025","venue":null,"work_id":"5cc69b66-a33c-4937-9fef-24eb8bbb741b","year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.529099Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:acba4f6f93f7e5667b432fe5ec06f32b8374794bf88ecabddcb67241c552a2f3","observation_id":"cdf6e92b-ca1e-4607-9b5a-fdb65d7cd5d1","resolution":{"observed_at":"2026-08-05T23:46:20.994463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.983413Z","title":"Shortcut learning in safety: The impact of keyword bias in safeguards","venue":null,"work_id":"16cafd11-a845-4c5a-8917-8acf4f8d731f","year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.531657Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:3c7b3b3ab6387247c69b9ad6dcc01899ca8f53376111708cbd6377bb42433c43","observation_id":"1ba4260b-cefc-4b30-a406-b7a6b34aa2e9","resolution":{"observed_at":"2026-08-05T23:46:20.986490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.975374Z","title":"Jail- broken: How does llm safety training fail?Advances in Neu- ral Information Processing Systems, 36:80079–80110, 2023","venue":null,"work_id":"0ac84a93-4042-4e4f-8abe-6705d663919f","year":2023},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.534343Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:aa5a790e67ec420200906292fde67a28914f8becaec4a366237c1cc28d4707eb","observation_id":"7dd512e3-c88b-434c-9b0d-04c7b66fd737","resolution":{"observed_at":"2026-08-05T23:46:20.978408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T23:46:20.536933Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.536933Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:7add196553790bb2a9e1981ebaa69d27e664314b31b03722b943de5e8208510e","observation_id":"ea325f40-8252-45be-a68b-2bf9cc12070c","resolution":{"observed_at":"2026-08-05T23:46:20.536933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.539768Z","title":"Safeseek: Universal attribution of safety circuits in language models.arXiv preprint arXiv:2603.23268, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.539768Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:7b310615c3642d5960218983ab4212895f6353ac8df9175f78e948ef87cbf4cb","observation_id":"251d382c-e487-4edc-a2af-3c1549ea1d5f","resolution":{"observed_at":"2026-08-05T23:46:20.539768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-06T23:27:26.520354Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-05T23:46:20.542247Z","title":"S-eval: Towards auto- mated and comprehensive safety evaluation for large lan- guage models.arXiv preprint arXiv:2405.14191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.542247Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:d6e838d153d8710ac662927c4d8325732be72044c1a9b17f74edd62f76b8312d","observation_id":"077f18ff-e8be-4268-a724-7044051ea787","resolution":{"observed_at":"2026-08-05T23:46:20.542247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.966878Z","title":"Refuse whenever you feel unsafe: Improving safety in llms via decoupled refusal training","venue":null,"work_id":"2de5fd26-8c1c-4b38-a636-ed7d84323b70","year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.545023Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:4af492099e3fb86043b1a97c5928de201c0ce2ca66ab00da3b0fe0121e63113a","observation_id":"bfc6d994-3eb0-43ba-83ba-345a5a84029c","resolution":{"observed_at":"2026-08-05T23:46:20.969869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14987","snapshot_observed_at":"2026-08-05T23:46:20.547519Z","title":"Alphaalign: In- centivizing safety alignment with extremely simplified rein- forcement learning.arXiv preprint arXiv:2507.14987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.547519Z"},"links":{"cited_paper":"/paper/2507.14987","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:96ca11b65a3ecbc46dbc3c62e99ff6c831263d55592dda3a699075195b7d34b1","observation_id":"83c5b1b7-a17d-416c-9347-9ab31cd1660e","resolution":{"observed_at":"2026-08-05T23:46:20.547519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02384","last_updated":"2025-06-27T07:30:35Z","snapshot_observed_at":"2026-08-09T12:18:24.329768Z","submitted_at":"2025-02-04T15:02:55Z","title":"STAIR: Improving Safety Alignment with Introspective Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02384","snapshot_observed_at":"2026-08-05T23:46:20.550587Z","title":"Stair: Improving safety alignment with introspective reasoning.arXiv preprint arXiv:2502.02384,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.550587Z"},"links":{"cited_paper":"/paper/2502.02384","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:630cea008f96f3eb3becbb4874a4b7e5f50571205efe9e8393c4513a91886e6e","observation_id":"820d62e9-055a-458d-b2e8-4c39047555f2","resolution":{"observed_at":"2026-08-05T23:46:20.550587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T23:46:20.553544Z","title":"Qwen3guard technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.553544Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:3c0fb13bd47938cd681b8f6122c3c0386909cffcfbcbdb07d4fdcd1e23f260f2","observation_id":"bc178fed-7253-42ef-866b-51cd6a4120b8","resolution":{"observed_at":"2026-08-05T23:46:20.553544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7237.7238","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:46:20.696396Z","title":"Llms encode harmfulness and refusal sepa- rately.Advances in Neural Information Processing Systems, 38:140283–140318, 2026","venue":null,"work_id":"ef6a5a83-7f5c-449e-bc1f-0bc130b75bbf","year":2026},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.556402Z"},"links":{"citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:61795b796d7ac1d77b7cdd44f717604fdad0f8934d7761412e1ea00284fc69d5","observation_id":"7ddfc659-70e3-4213-b109-be4fcefa8cb1","resolution":{"observed_at":"2026-08-05T23:46:20.703274Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T00:51:40.785078Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2608.03201."}