{"as_of":"2026-08-08T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9895ec06471c68e7115c20f21832568c938f33bf0b893953dd24440835a25cbe","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:18.375972Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:28:42.361096Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T07:53:14.432882Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:0eb7ead59bc835782fab1524f811d329712a25735fe06bfd2bcf99a9807c8791","observation_id":"68fbd259-3bde-4437-be77-bca5152543d5","resolution":{"observed_at":"2026-05-19T11:37:15.979737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-08-06T18:28:42.361096Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08898","last_updated":"2025-07-17T08:01:44Z","snapshot_observed_at":"2026-08-08T14:51:56.908190Z","submitted_at":"2025-07-11T05:15:35Z","title":"SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:28:42.361096Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2507.08898"},"observation_digest":"sha256:819b923e14c5b01735732ba65cf4c49c5d80233e3d1861928c28bd33bcd3d288","observation_id":"c7dca5b9-3fc8-4cb6-8db9-aa8408d99216","resolution":{"observed_at":"2026-08-06T18:28:42.361096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:aee11f0c3146e50d1a87d52f042288051e3faf2f7d2e6876f96e5b870f5ad67e","observation_id":"a53ea7aa-a633-4276-a61b-37f552736f54","resolution":{"observed_at":"2026-05-16T08:17:36.595720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:34.909229Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:39f8591147501d64697a055c116addc2e7eb55b7d9b78ff36a051eab6d59152e","observation_id":"a4b926b3-8045-41df-b52e-6a8e2d99b298","resolution":{"observed_at":"2026-05-11T05:20:57.877835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-08-02T16:34:03.109901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T16:34:03.109901Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:8964ea1eb15208fdd3403cb22d6d46a8908bf9e664c273abcd9e64149a4f9833","observation_id":"89529674-b1c6-4487-b39e-fb4ea1fe192f","resolution":{"observed_at":"2026-08-02T16:34:03.109901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2605.11093","last_updated":"2026-05-11T18:01:36Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:01:36Z","title":"Enabling Performant and Flexible Model-Internal Observability for LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:17:13.823853Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2605.11093"},"observation_digest":"sha256:d3d1ac47632c3e82b7b1ba311bd3f39eb5ab37f6c63d7fdcfb363d1221676baf","observation_id":"699e43b1-d54f-4e87-8814-1f71419681ee","resolution":{"observed_at":"2026-05-13T07:17:28.099483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:10.263663Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:4c87aeac8ee25de9b19a8387ce2675a2ca38b0a9b0408ab808e02a23865551e4","observation_id":"0052c1e3-00a1-45f5-815f-da6460ec14ae","resolution":{"observed_at":"2026-05-13T01:57:06.438225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:06.989077Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:46bfc1d744d5e36e578846cd3c137f8413eac9eb1e6498209d2c92bfc8b38285","observation_id":"5a07c4bf-19c0-4db0-8171-0a934fd3a2c8","resolution":{"observed_at":"2026-05-14T21:12:58.890972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2605.17504","last_updated":"2026-05-17T15:31:42Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T15:31:42Z","title":"A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T13:55:29.094138Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2605.17504"},"observation_digest":"sha256:67cbcb8242e865ff86fae3d3986e96303f0e63c4a1ce39d3b11379c5e48e93a1","observation_id":"5804f189-3924-43bc-8d23-1def0dfe31b8","resolution":{"observed_at":"2026-05-20T13:58:20.492100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":"2505.15710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-06-29T07:53:14.432882Z","title":"Advanc- ing llm safe alignment with safety representation ranking","venue":null,"work_id":"0d36b6e2-5484-4d19-9843-4e05efd7d27a","year":2025},"citing_paper":{"arxiv_id":"2605.29629","last_updated":"2026-05-28T09:02:00Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T09:02:00Z","title":"Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:33:30.281064Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2605.29629"},"observation_digest":"sha256:48bbb62dce569fc17410cc580c6decf6a7ebfcd2eda63373cbe137a51a5f330b","observation_id":"26572c6e-29ee-4df8-8692-090764d1656b","resolution":{"observed_at":"2026-06-29T07:53:14.434543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15710","snapshot_observed_at":"2026-07-31T23:07:40.652133Z","title":"arXiv preprint arXiv:2505.15710 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27917","last_updated":"2026-07-30T09:30:03Z","snapshot_observed_at":"2026-08-07T15:15:58.184585Z","submitted_at":"2026-07-30T09:30:03Z","title":"One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T23:07:40.652133Z"},"links":{"cited_paper":"/paper/2505.15710","citing_paper":"/paper/2607.27917"},"observation_digest":"sha256:ea388c77d20f44dbcd7017ad320192892f837cafe3bab32b801c08b4769d9ed5","observation_id":"cd001eb1-32a0-4b4e-8862-f544de839176","resolution":{"observed_at":"2026-07-31T23:07:40.652133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15710/citation-record","integrity":"/paper/2505.15710/integrity","json":"/paper/2505.15710/citation-record.json","paper":"/paper/2505.15710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.844664Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":"cc58c4ca-f366-4b60-96ec-6e071765d806","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.209470Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:ed9ea25396a4ce758aedaa1f5c230cc159df3181768506a3c7686f044b0fbff6","observation_id":"cc41ad3d-ea9b-4498-9424-1c28ce32430b","resolution":{"observed_at":"2026-08-07T15:15:18.847508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.838653Z","title":"Constitutional ai: Harmlessness from ai feedback, 2022","venue":null,"work_id":"e2e8689c-9cbb-4f94-b1b1-eab5aefa7017","year":2022},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.220989Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:f7e432d84f14e310ab2c46b5920c502f229ecf34cf9eff23b39fc513d51773e3","observation_id":"8fcedc20-95b4-44fd-ae1d-6624ccdd3722","resolution":{"observed_at":"2026-08-07T15:15:18.840918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.831883Z","title":"Safeinfer: Context adaptive decoding time safety alignment for large language models","venue":null,"work_id":"07d6eca0-80af-4af2-8c34-df418a05463f","year":2025},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.226207Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:beb1b0fc92bf9b2ef1f0a6a9d130a981c4ff015e601b2608014606e861959001","observation_id":"bd145b7d-ecfe-4191-9a68-0afe8a21ed2a","resolution":{"observed_at":"2026-08-07T15:15:18.834310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T15:15:18.235655Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.235655Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:35ce8c36cfc750d393523d3b687c9d48795c8d61762a48cb10970116d64c359e","observation_id":"9b4f2425-6ecd-4de2-b7e4-169ff89c6355","resolution":{"observed_at":"2026-08-07T15:15:18.235655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.825059Z","title":"Pappas, Florian Tramer, Hamed Hassani, and Eric Wong","venue":null,"work_id":"2bffa940-fa5c-4825-a8a2-de327d09589a","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.238736Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:db5eaabf06fb5563c349af1876e3d2ed2f6cb28fb188747b31ea1d398188f857","observation_id":"1a95981c-7205-4f03-a99f-6c0685003853","resolution":{"observed_at":"2026-08-07T15:15:18.827732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.241298Z","title":"Finding safety neurons in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.241298Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:c197ea890a2e90764c53a85b9bf0dd7c785d95b3c8da93dde0037d1ca47a7287","observation_id":"c260cec5-2926-48f5-b352-de53010be1ec","resolution":{"observed_at":"2026-08-07T15:15:18.241298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.817976Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":"c4550c19-1ebe-4025-819e-d10b85f77743","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.243835Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:1c1bd8e0a85c6050e9fc66abef56d9388b6c28b57a2f0ff080b883a373ce1f5a","observation_id":"c2b1e6a2-1d86-41f8-b6f0-79aa48b80e32","resolution":{"observed_at":"2026-08-07T15:15:18.820841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.811697Z","title":"Hierarchical neural story generation","venue":null,"work_id":"708dc8e0-3402-42e6-a1a1-832bbca63f2f","year":2018},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.246767Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:aaf1b0d34cdd3e1ebb74cf085adfcbe0e240c93b5eb65dd9f3955dedcc225754","observation_id":"bef79a3d-131a-480d-9ff0-5089a1ce3928","resolution":{"observed_at":"2026-08-07T15:15:18.813974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.804189Z","title":"Controlling linguistic style aspects in neural language generation","venue":null,"work_id":"c8c01c2b-e90a-4a51-be09-929eea10c805","year":2017},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.249470Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:00abf023ce7a7628603ddcccf73461d5f51bb263f2ac54dc620b490d49042e74","observation_id":"5e82de10-2706-46b0-907e-02a3a12c1cd0","resolution":{"observed_at":"2026-08-07T15:15:18.807351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.797857Z","title":"Evolving neural turing machines for reward-based learning","venue":null,"work_id":"54ec71fb-33a7-481b-ba2a-18a450ecec42","year":2016},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.252005Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:c229648028a8341588e53d94566317efbe168fbf3de230d9d30f24a10094bcb9","observation_id":"d8d63c05-0df6-485c-b4aa-8b231811a896","resolution":{"observed_at":"2026-08-07T15:15:18.800140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.790764Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"2b9cc78b-c923-47e7-8a24-eaf79ab176d3","year":2021},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.254954Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:e72284c6c6a20335dc238c8a77a7e8db220cac37bb58398a0badc40e98182c22","observation_id":"4ff5faf9-998c-4d13-9deb-9f3ec2b9e867","resolution":{"observed_at":"2026-08-07T15:15:18.793287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.783638Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"8ad0bb04-9535-4bd2-a4fe-cc3c348fd909","year":2020},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.257253Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:684a69ee416916f550803fac1babbe92ffa7991511e789d5a282871fb201584d","observation_id":"cf2f1b0f-e39a-49ba-bc7f-8963484a907f","resolution":{"observed_at":"2026-08-07T15:15:18.786568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.775730Z","title":"Learning to write with cooperative discriminators","venue":null,"work_id":"33ae8b1e-fe93-4fd8-8ead-8fcf71cbe336","year":2018},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.259704Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:5a51234d70761496635d09d62839e91b76a8266f8f0a9d02bfbfaea2cad6703a","observation_id":"3c067e4f-932f-472e-9bdf-b610902fc184","resolution":{"observed_at":"2026-08-07T15:15:18.779084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T15:15:18.261712Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.261712Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:50238554b7472a97a057c639a30a3673b5a1965ab61fef5f2b9b0f38de4827b2","observation_id":"b7270254-4aab-4948-9855-19b980d6df2c","resolution":{"observed_at":"2026-08-07T15:15:18.261712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-07T15:15:18.265028Z","title":"Ai alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.265028Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:47ac07b505f426931f8a78938691f6bcc375733f5d84b420001d4dc91a3e4a0c","observation_id":"18652234-1528-4a29-a5b9-14e1212899cd","resolution":{"observed_at":"2026-08-07T15:15:18.265028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:15:18.267495Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.267495Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:19642472b9638ea77408adabb1ca38f77d07b198c336d61af96ece33967da684","observation_id":"29a82d71-3059-4ad4-98a7-e5da9457f925","resolution":{"observed_at":"2026-08-07T15:15:18.267495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.769092Z","title":"Buckley, Jason Phang, Samuel R","venue":null,"work_id":"0dde6fdd-f34b-4650-83fd-c613359c7d3e","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.270168Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:d5020dffc4a5c1ace378ca5a3cd66aaddc0bffaf0a04616654eb67760a54676f","observation_id":"5f650702-cdbb-4804-8b73-96efef81a970","resolution":{"observed_at":"2026-08-07T15:15:18.771832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.761556Z","title":"Contrastive decoding: Open-ended text generation as optimization","venue":null,"work_id":"dd724d1b-fbe6-4e9d-bc57-d548d65edd6a","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.273152Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:8b49f7f4fd13834b94be09e719e0b409fca728644db4c64ebe31e39353000b67","observation_id":"c8d59d88-fdb3-48c4-967d-22cefa7f3042","resolution":{"observed_at":"2026-08-07T15:15:18.764757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T15:15:18.276005Z","title":"Lipo: Listwise preference optimization through learning-to-rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.276005Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:9d82c57246aed697ec4afb76fb118faca7c5c71a24b3add151d137b2c287630e","observation_id":"ac0a7142-37ff-468f-868a-eb0e608aa41a","resolution":{"observed_at":"2026-08-07T15:15:18.276005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.753549Z","title":"Jailbreaking chatgpt via prompt engineering: An empirical study, 2023","venue":null,"work_id":"ee619167-a76d-49a6-adfc-7774b77c9963","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.279632Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:5a02dcf460811d54101c6182e92f499a7bd2f7262b9420d38f1a8ff21d1b3f34","observation_id":"4c9ed786-fd0b-4fa6-b713-689f1cbdd234","resolution":{"observed_at":"2026-08-07T15:15:18.756285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.745319Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":"0ef3f439-82cf-427d-9495-60bb0cdc4824","year":null},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.283437Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:4746a1416c1460253246deaa38d9cb8fb0fe4bf519c21129abceacaf1a76f531","observation_id":"19a89539-8a0e-4f7b-b103-30961419c693","resolution":{"observed_at":"2026-08-07T15:15:18.748183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.736533Z","title":"Llm improvement for jailbreak defense: Analysis through the lens of over-refusal","venue":null,"work_id":"517a205c-e6a2-4ec1-8498-4626c0f4fbeb","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.286927Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:046bfb40eb64c37fa870bb32eaaec066d512897809998072bfdac9fb9dd35691","observation_id":"920b1562-7e12-4e7b-bbae-27fc4630439e","resolution":{"observed_at":"2026-08-07T15:15:18.739091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.728748Z","title":"Learning to rank from relevance judgments distributions","venue":null,"work_id":"3a02e450-0423-4c6e-9b7c-9510352c672e","year":2022},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.289693Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:c2ce122bb9757fcce8ef6e19bb88153e0f34775819d7417af5dfd03c8d61b7d5","observation_id":"1a4d2249-63e3-4d15-82be-54585b0cc9b8","resolution":{"observed_at":"2026-08-07T15:15:18.731853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-08T03:05:18.803803Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-07T15:15:18.292131Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.292131Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:b9e7fae7c7ccfc771daf07ec9faa9f3263ef2d920d24d3a9e989c8ae2ac7619a","observation_id":"3880deef-f863-478c-9248-f6abd9dd32cf","resolution":{"observed_at":"2026-08-07T15:15:18.292131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.721682Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"44cf25f4-4cd5-4bb0-a032-efefd30a1ca5","year":2019},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.294903Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:e64327c5d17bce0c2244b2d237675e3d9adbd3d529f8e89fbe5ad34821ddde40","observation_id":"1e7fcf81-b543-4765-b4ab-17960c77bb26","resolution":{"observed_at":"2026-08-07T15:15:18.724627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T15:15:18.298675Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.298675Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:3ca74646f58ed5a667ed18da71f5ca3e6c0114d98936df5ef954b7b50e4dbc46","observation_id":"9fe84c67-cc6c-4ead-b36a-217eec5e76ca","resolution":{"observed_at":"2026-08-07T15:15:18.298675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09563","last_updated":"2024-12-12T18:48:51Z","snapshot_observed_at":"2026-08-06T04:46:00.354780Z","submitted_at":"2024-12-12T18:48:51Z","title":"Does Representation Matter? Exploring Intermediate Layers in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09563","snapshot_observed_at":"2026-08-07T15:15:18.301774Z","title":"Does representation matter? exploring intermediate layers in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.301774Z"},"links":{"cited_paper":"/paper/2412.09563","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:7a2a04ed7f0cc4b0484b889f397558f45d90370aa12616a8cf07346fa1f231c7","observation_id":"7dabb801-295a-4f10-89af-fd05c45770ad","resolution":{"observed_at":"2026-08-07T15:15:18.301774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.714734Z","title":"Reft: Reason- ing with reinforced fine-tuning","venue":null,"work_id":"d1cc0d2b-b731-45a6-9b58-c3b946eac36e","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.305406Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:86896d38e6eb9bed7c9617f7b37ea5cdfe5002721261db570a729b71182e6386","observation_id":"5a59fc6a-d359-458e-9679-afa9fe96f782","resolution":{"observed_at":"2026-08-07T15:15:18.717271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.707874Z","title":"Interpretable prefer- ences via multi-objective reward modeling and mixture-of-experts, 2024","venue":null,"work_id":"658ec4fa-875c-4ffd-a480-1effab8ba5b1","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.308143Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:edec218a2e99f997c5a01f77d213754084572ab6ac3aa6895209718c724a9dcb","observation_id":"3f10672a-304a-4703-8ad3-1c04084eaa3f","resolution":{"observed_at":"2026-08-07T15:15:18.710402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.700904Z","title":"Self-consistency improves chain of thought reasoning in language models, 2023","venue":null,"work_id":"5aca522d-987a-4f53-a763-d21681268b56","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.312113Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:5c6b738bd32f35ccfcbb1a1931eeea6dcc7ae61c3a5247bd903d36387d7813b4","observation_id":"b13e146a-b522-4359-ae62-890b07fb123d","resolution":{"observed_at":"2026-08-07T15:15:18.703409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-07T15:15:18.315364Z","title":"Chain-of-thought reasoning without prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.315364Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:9b9e3f40791cfb437962b1a9b44b88e5f02b26ec7ef8838f21b0b16c65b4bcdb","observation_id":"76d87c41-7550-4fcb-803c-95150fc61c8c","resolution":{"observed_at":"2026-08-07T15:15:18.315364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-07T15:15:18.318170Z","title":"A comprehensive survey of llm alignment techniques: Rlhf, rlaif, ppo, dpo and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.318170Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:e485801332c08b7952a954eec115fdc09a140f835e7076d0810866ffce400253","observation_id":"01410d90-fb2e-45c3-b15d-3c1fdd2cf1dd","resolution":{"observed_at":"2026-08-07T15:15:18.318170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.694077Z","title":"Jailbroken: How does llm safety training fail? In NeurIPS, 2023","venue":null,"work_id":"cb89fef9-f26e-4a22-be2e-a5fb4d0318a5","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.322142Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:f633f2d96f3934e1a9ee2c22c6b9be1d3a0e75ea1df14d22c4b0da9d9b0fa71b","observation_id":"a62436cd-9a11-4008-8d0f-b9fc08dc48da","resolution":{"observed_at":"2026-08-07T15:15:18.696723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.686706Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":"be44fb2a-2e96-4dff-a49d-8477109becfa","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.324741Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:37c3800f1e99a3a870ce143e0b672c571d2848156892ec84e77790b66b865bb6","observation_id":"4ff5d838-7e2d-436e-bfdd-7c848391488d","resolution":{"observed_at":"2026-08-07T15:15:18.689585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-07T15:15:18.326956Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.326956Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:50369b1210d7474575c4359cffcaf1bc7a155bc621b61a79026e45c076b2e6ae","observation_id":"cba2e2e6-8940-425b-aecc-e698ad06b693","resolution":{"observed_at":"2026-08-07T15:15:18.326956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.678161Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal","venue":null,"work_id":"110bb909-6bd4-4f6b-93c5-eb05c31a5a5a","year":2025},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.330486Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:c1774b63a8daaa6ec2d045ee9daefa73c45e1c96f7ebdd9dbb4393865e9c07be","observation_id":"bb309155-1b6e-4320-9bc9-84c84954840b","resolution":{"observed_at":"2026-08-07T15:15:18.680690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.670547Z","title":"Defending chatgpt against jailbreak attack via self-reminders","venue":null,"work_id":"3585aa3c-84e7-4443-b28a-7644351d04f3","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.333273Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:2180e7573a3bff25384b4c00a3736fe2ca27ecf826afa3993edfa78b051bd2f9","observation_id":"3624ce13-2207-4910-9955-e7b32ff13757","resolution":{"observed_at":"2026-08-07T15:15:18.673601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.662310Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"889032b3-8002-4afc-81bb-b7fd68e854db","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.335543Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:d15e493a7465e22bac724db8285ecef39d3dfad1200c6417d43bf481706f619e","observation_id":"afd28f97-5b04-4eb0-97ef-e529c0821519","resolution":{"observed_at":"2026-08-07T15:15:18.665257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.654660Z","title":"SafeDecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"b120e2d2-f59f-4978-849e-8177e4d73176","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.337971Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:ea7f41e4939a234f976cbe1f8aa2ac52ca0cba8ae54c9277614776fb0a9fbb85","observation_id":"be8921d9-42fc-469f-bbf1-5d22e894abd2","resolution":{"observed_at":"2026-08-07T15:15:18.657477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:15:18.340533Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.340533Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:3a0d635c4c90f048289cb9acac47835502f4e48f0bce4695d94964514b164555","observation_id":"f00da5d2-9628-4f22-9a94-712d56489629","resolution":{"observed_at":"2026-08-07T15:15:18.340533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.646124Z","title":"The ai alignment problem: why it is hard, and where to start","venue":null,"work_id":"338d4867-909b-4030-96f8-7b7294f7821f","year":2016},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.342864Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:04b739d21e9177f3f2595e2c62286da53bf80d8c4d31328a69ef35fd89b02240","observation_id":"4897e823-b2ac-46b6-8d64-cfc0869bffb5","resolution":{"observed_at":"2026-08-07T15:15:18.648771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.636881Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024","venue":null,"work_id":"d9c2436a-0051-4e04-bb2a-6f1dfd7fffa8","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.345365Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:5cbd5d92a0e3aee53038954de81192339e16400d0978e55db4c05ed34c1e8782","observation_id":"6f8eb0eb-ac04-4593-97d1-5c4917021d8d","resolution":{"observed_at":"2026-08-07T15:15:18.640308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02197","last_updated":"2025-06-11T13:11:12Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T04:22:55Z","title":"Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02197","snapshot_observed_at":"2026-08-07T15:15:18.352301Z","title":"General preference modeling with preference representations for aligning language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.352301Z"},"links":{"cited_paper":"/paper/2410.02197","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:ac693f689f9f23694dfc582be3b5417b8605ae1e8ad253c3376a222a8edb11d8","observation_id":"512519c3-7e96-443f-9916-7cb34fcf72c8","resolution":{"observed_at":"2026-08-07T15:15:18.352301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13752","last_updated":"2024-11-01T07:51:36Z","snapshot_observed_at":"2026-07-06T18:03:24.368197Z","submitted_at":"2024-04-21T19:24:15Z","title":"Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13752","snapshot_observed_at":"2026-08-07T15:15:18.355760Z","title":"Adversarial representation engineering: A general model editing framework for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.355760Z"},"links":{"cited_paper":"/paper/2404.13752","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:ee5edd5af1909180ad836e24005f8e068ff179314a7b96f6d2742835b6732ef2","observation_id":"11c726b0-6815-4cf2-8850-8ae95c79ce73","resolution":{"observed_at":"2026-08-07T15:15:18.355760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15710","last_updated":"2024-03-11T07:50:05Z","snapshot_observed_at":"2026-07-06T17:07:52.197869Z","submitted_at":"2023-12-25T12:32:49Z","title":"Alleviating Hallucinations of Large Language Models through Induced Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15710","snapshot_observed_at":"2026-08-07T15:15:18.359366Z","title":"Alleviating hallucinations of large language models through induced hallucinations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.359366Z"},"links":{"cited_paper":"/paper/2312.15710","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:54d5c842cce9db62a6f533bdb719add68c2cf4752253389b9077b8d51ef41891","observation_id":"7335f8a0-5cf2-486a-a22c-278fdfb3b4be","resolution":{"observed_at":"2026-08-07T15:15:18.359366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.627707Z","title":"Identifying and tuning safety neurons in large language models","venue":null,"work_id":"b7f10852-b30f-4dc0-917e-17c502eadbee","year":2025},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.363165Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:f36fbbb6aa7d638094daedbe25e517770f6a18c2023cd1e0fedecce4a583180c","observation_id":"0399a2e8-9448-474a-bd85-77a28c06a640","resolution":{"observed_at":"2026-08-07T15:15:18.630684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.619580Z","title":"On prompt-driven safeguarding for large language models","venue":null,"work_id":"873df463-27f3-42ba-a492-6b57901cf1cf","year":2024},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.366199Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:22673e24bffffb63969bf26a6fd063b2c1962e9eb61c7ad2bf47d2ea7b678f4f","observation_id":"135914eb-99a5-4ea8-9117-1f5972336177","resolution":{"observed_at":"2026-08-07T15:15:18.622074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:15:18.610022Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"b23c37ab-3a2d-4c11-ac1e-bd7cdf8c8848","year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.369535Z"},"links":{"citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:d9a1367d16b2ea700340cfd5e0f659db519ff4f2a8958a8ff8428fa4a5710570","observation_id":"fc32a28b-3f76-470c-9485-147fba3a9090","resolution":{"observed_at":"2026-08-07T15:15:18.614468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-07T15:15:18.372422Z","title":"Representation engineering: A top-down approach to ai transparency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.372422Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:195b70b707ec30c7a5d5d11210b8921951f32fe36bf3601e64752ef5fe0b6911","observation_id":"f6fb1934-e8d9-4420-86c5-a02c5fbc6c9d","resolution":{"observed_at":"2026-08-07T15:15:18.372422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T15:15:18.375972Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:18.375972Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.15710"},"observation_digest":"sha256:4cef88475c1e10831678d4ccd05f2271a9a422e2f9faf978271d0cba13cbc30f","observation_id":"2f6565bc-a792-400e-bdc0-4283ea8e43e1","resolution":{"observed_at":"2026-08-07T15:15:18.375972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15710","last_updated":"2025-05-21T16:21:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T03:52:53.955973Z","submitted_at":"2025-05-21T16:21:29Z","title":"Advancing LLM Safe Alignment with Safety Representation Ranking"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 11 inbound Pith citation observations for arXiv:2505.15710."}