{"as_of":"2026-08-20T08:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95ffab42cb36fd3792c2ec9b18d6cbf40a68deae089e484ce84bf50a187ab64b","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:11:37.884734Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18872/citation-record","integrity":"/paper/2504.18872/integrity","json":"/paper/2504.18872/citation-record.json","paper":"/paper/2504.18872"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-16T10:11:37.822570Z","title":"Refusal in Language Models Is Mediated by a Single Direction , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.822570Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:0b431f1a63fae291874bac47caff1dc9e1d52f0f82b69a185ba01b54e3d63dc2","observation_id":"e8e19bdc-4eaf-4e62-94f0-8525ee4d0b8e","resolution":{"observed_at":"2026-08-16T10:11:37.822570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:38.080376Z","title":"latent\\_adversarial\\_training, 2024","venue":null,"work_id":"ee192162-4d28-4951-98ac-ced5adfd78ad","year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.827332Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:71256ffd33c302a62abc1b3f00d70261b57877b9ece48a877957629c438fd6bd","observation_id":"1f07c3d3-e847-4657-82db-9a88eb1c6366","resolution":{"observed_at":"2026-08-16T10:11:38.085267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-20T07:01:28.184093Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-16T10:11:37.831020Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.831020Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:4a29ea53cd185d238c6052f79d702eb1c0efef5ed929b49d54f118f9cdc1e186","observation_id":"99f24ba7-0d12-4217-ba35-2dca7db00136","resolution":{"observed_at":"2026-08-16T10:11:37.831020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12786","last_updated":"2024-08-21T16:37:20Z","snapshot_observed_at":"2026-08-19T01:15:11.526401Z","submitted_at":"2023-11-21T18:51:04Z","title":"Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12786","snapshot_observed_at":"2026-08-16T10:11:37.835041Z","title":"Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.835041Z"},"links":{"cited_paper":"/paper/2311.12786","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:b5aa222f98b4e4cb7109f6b5d40a6adfcc562dcdc59a83d3dedd18aa57c83c18","observation_id":"9cfd8403-661a-4daa-9039-b58b17411291","resolution":{"observed_at":"2026-08-16T10:11:37.835041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-18T10:16:07.566802Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-16T10:11:37.839207Z","title":"LORA Fine-Tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.839207Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:b79195e3191520561152384f43509ca5f03f3ec2b88491409e5d0ff8bb1af2b6","observation_id":"d50944d6-633b-422e-a924-cfd51cd52358","resolution":{"observed_at":"2026-08-16T10:11:37.839207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:38.069220Z","title":"Llama 2 7B Chat , 2023","venue":null,"work_id":"dfb5d54a-f700-4b22-a351-3a5d81875451","year":2023},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.842845Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:74f6eb32177b9106a4787dac87d5b4f74f89063a0931ad63e6fc5a7863ec7a28","observation_id":"81d0c4c4-fdd1-4eec-be1b-9523cb1459d7","resolution":{"observed_at":"2026-08-16T10:11:38.072677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T10:11:37.846329Z","title":"The Llama 3 Herd of Models , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.846329Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:d433c826617037820c7668fe7a397e89b6e1e69670187927dd7850aea6d96fc1","observation_id":"09070545-108f-4b8a-81a9-b6b6dd6e5941","resolution":{"observed_at":"2026-08-16T10:11:37.846329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T10:11:37.849545Z","title":"GPT-4 Technical Report , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.849545Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:92d3d00634b9917f479ff798a8c18b9989d5a39e1ec7654535cfe2a5591a316f","observation_id":"6902d673-ae34-418d-ad02-370b873474d0","resolution":{"observed_at":"2026-08-16T10:11:37.849545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-16T10:11:37.853271Z","title":"Steering Llama 2 via Contrastive Activation Addition , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.853271Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:8760d5a0273e0da9414cb3fcb2de7eea384444b6fbaeb991c03c475f84a2dc62","observation_id":"660e8bfb-2a4d-465c-87f0-5d2169bb1d0d","resolution":{"observed_at":"2026-08-16T10:11:37.853271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-19T22:21:33.099797Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-16T10:11:37.856549Z","title":"Latent adversarial training improves robustness to persistent harmful behaviors in LLM s, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.856549Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:e9e3917db2732e45a5911cf6eb64321d439a625f9ac3b04e6a259af7957528c1","observation_id":"1af2426f-642e-4353-96d0-a7c20bfc3c0f","resolution":{"observed_at":"2026-08-16T10:11:37.856549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:38.056378Z","title":"Stanford Alpaca: An Instruction-following LLaMA model , 2023","venue":null,"work_id":"d1fef105-9fc0-4807-bbf2-7ff6ea547100","year":2023},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.859571Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:76aaaa98dbc391f7bba7f6981854885a0b3f1c62689704bccd5304352b9edb3f","observation_id":"43855377-9f47-48f7-8d99-cf4afd16afe2","resolution":{"observed_at":"2026-08-16T10:11:38.062124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T10:11:37.862434Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.862434Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:4d198fc8f92a044bbbfcf3b93830d59dd89a3c79c147ab7f92b7162b8d40b76f","observation_id":"f7721851-abe9-4320-a3f0-961e43d5e154","resolution":{"observed_at":"2026-08-16T10:11:37.862434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-20T07:51:07.896144Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-16T10:11:37.865408Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.865408Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:e2df1aad8912ab15a8a2db488d504305b97d4ccd6311060b7ba01fb93187e398","observation_id":"61ff8dc4-fde5-4294-86d1-12f67372e810","resolution":{"observed_at":"2026-08-16T10:11:37.865408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-16T10:11:37.868113Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.868113Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:97bb2a2bf18fc010a0d55ab1f255cd4a76a6d78bb681b8728ed4be7e43f18b45","observation_id":"41fd8d41-096d-4924-9ef0-80841f02c37b","resolution":{"observed_at":"2026-08-16T10:11:37.868113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:37.872694Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.872694Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:0472d6111fa331d63ae8c27c0020c6ff3f21ff98967efb2cecc7950a5e0f0594","observation_id":"00d2d191-ac13-4e64-8277-4ae63aa08ec0","resolution":{"observed_at":"2026-08-16T10:11:37.872694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:37.877140Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.877140Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:98ea0c1326c4c7d905b97777909b111758f762e87a5d44daca3215600e7bf464","observation_id":"2cb46f6b-b291-49cd-99c9-16cbbae715ca","resolution":{"observed_at":"2026-08-16T10:11:37.877140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:37.880913Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.880913Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:0ad4c82aa2a9948c989c778f47ba84993b11859569b8e1ed31c2d3737ec37cae","observation_id":"13d0334d-6335-4d5b-9187-743c72c641c1","resolution":{"observed_at":"2026-08-16T10:11:37.880913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:11:37.884734Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:11:37.884734Z"},"links":{"citing_paper":"/paper/2504.18872"},"observation_digest":"sha256:63769a9fdeb150944d68413799969289885636f09d28d3f64e0c07c86dfb7949","observation_id":"dcde0731-1e3b-476f-8bdb-d49d5ea73e4f","resolution":{"observed_at":"2026-08-16T10:11:37.884734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18872","last_updated":"2025-04-26T09:40:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T01:15:27.632424Z","submitted_at":"2025-04-26T09:40:31Z","title":"Latent Adversarial Training Improves the Representation of Refusal"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2504.18872."}