{"as_of":"2026-08-08T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb9ca959be88e2988ab1748ffacdde5944b28b9b11e34a4960cc020b85a95375","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:09:41.587858Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06807/citation-record","integrity":"/paper/2509.06807/integrity","json":"/paper/2509.06807/citation-record.json","paper":"/paper/2509.06807"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.073888Z","title":"Mogu: A framework for enhancing safety of llms while preserving their usability,","venue":null,"work_id":"ac362c88-39dc-4aa2-8ef3-5fca3356ebe3","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.412785Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ec9093951ac6deb242ac1459de1e706f9d0c6b7f6894db48ab3e43b0f258db94","observation_id":"9dc5398e-f585-4da2-9d83-c20d7a04e93f","resolution":{"observed_at":"2026-08-04T23:09:42.077038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.418878Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.418878Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:b6d1ae617cf2daed21ea66d09176065060fe9e51dfd56eb2bd45bb40c724293c","observation_id":"4bb66a28-3120-4825-b8da-f5254d3cd532","resolution":{"observed_at":"2026-08-04T23:09:41.418878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T23:09:41.421041Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.421041Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f6a642b6896eeee9e6f242abee382dd6ea7fe33cac574969f5af6ac46d940eb9","observation_id":"a1558a58-a354-443b-b40a-f503ba477256","resolution":{"observed_at":"2026-08-04T23:09:41.421041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-04T23:09:41.423390Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.423390Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:47b9412e989eaa3f1904f583ea63073fb38952e0f306d92b76209ce5b1d8cd4f","observation_id":"edc29ab5-a9a5-4367-a3c0-04ee523c00e2","resolution":{"observed_at":"2026-08-04T23:09:41.423390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-04T23:09:41.426641Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.426641Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:5b730ea895f5a8b9a993dab1062f23ff090c98f58d6b3958063fb30543c45eea","observation_id":"7c0d83d0-d2b6-471f-a4a5-fae1eb0f28cd","resolution":{"observed_at":"2026-08-04T23:09:41.426641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04265","last_updated":"2024-11-07T14:23:51Z","snapshot_observed_at":"2026-07-06T16:03:54.971351Z","submitted_at":"2023-08-08T14:03:08Z","title":"FLIRT: Feedback Loop In-context Red Teaming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04265","snapshot_observed_at":"2026-08-04T23:09:41.429359Z","title":"Flirt: Feedback loop in-context red teaming,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.429359Z"},"links":{"cited_paper":"/paper/2308.04265","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ec4bbef19b6c8fce2b4bbb5de7a7ce355d795dcbaa36880f93e06631c1568827","observation_id":"dc764439-8a44-4e88-95b7-ec1d378ff20f","resolution":{"observed_at":"2026-08-04T23:09:41.429359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-07-06T17:30:08.206972Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-04T23:09:41.432374Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.432374Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f3a2695754775551cbb4528969acd9ef3ecdaef60bf9ec379cb9fa2516a6d92f","observation_id":"403519d2-2a8b-4bc2-8ae3-e9693caa9657","resolution":{"observed_at":"2026-08-04T23:09:41.432374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13457","last_updated":"2024-05-17T05:00:24Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T01:26:39Z","title":"A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13457","snapshot_observed_at":"2026-08-04T23:09:41.435223Z","title":"Llm jailbreak at- tack versus defense techniques–a comprehensive study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.435223Z"},"links":{"cited_paper":"/paper/2402.13457","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:fd60f268891c8f87d589c59a554417e51095b6a4e8902b3d03d893eaab5e2f7f","observation_id":"ead34801-dcd9-434d-b7cf-10580f06e3e0","resolution":{"observed_at":"2026-08-04T23:09:41.435223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.060001Z","title":"Lima: Less is more for alignment,","venue":null,"work_id":"e6d86131-90cf-40ba-80ca-e4d1191778da","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.437938Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:9d5c59fc170688efe5cd5db5633fce781a1720f38265d845df3b365c52dfb24d","observation_id":"12cedbfb-1706-4921-8499-8150a0757aaa","resolution":{"observed_at":"2026-08-04T23:09:42.063715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.440287Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.440287Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:106de3efd8467566421bb208d7b10d4e00c12808202188716b6a7c38b7d27ea6","observation_id":"02db291a-5a5d-4e42-af66-a501dd18c588","resolution":{"observed_at":"2026-08-04T23:09:41.440287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-04T23:09:41.442984Z","title":"Jail- break attacks and defenses against large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.442984Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a264e79c0d46eacc3c67c77050d1b320e6853a9448d20902e9a6ba629f538e70","observation_id":"fb86b84a-ac4c-4939-9349-a3745d597338","resolution":{"observed_at":"2026-08-04T23:09:41.442984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.046246Z","title":"A comprehensive study of jailbreak attack versus defense for large language models,","venue":null,"work_id":"47900fd5-e429-4e4e-959f-4ed6c0bf6bad","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.445835Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:63613dbc631058af460d4b25749209b8f8a65f9a592764b0b1d04022f99e83e9","observation_id":"262bc832-9a17-474f-8b41-3324f2f1f943","resolution":{"observed_at":"2026-08-04T23:09:42.050203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T23:09:41.448210Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.448210Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:9bca58dd6242cd5ffc062524164a093a2551ed2c478cc47a3db9c25e22e00ecc","observation_id":"8f4adb80-c946-4fdf-a9cc-2de908f44f53","resolution":{"observed_at":"2026-08-04T23:09:41.448210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-04T23:09:41.450991Z","title":"Lora fine-tuning effi- ciently undoes safety training in llama 2-chat 70b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.450991Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e2ddce7b68e5f48f4af44a40b4955541dafe3ba3b3c2bc1be19ddef7b1efb581","observation_id":"ce4ffc35-5ad8-47fc-81f3-d207b73311b6","resolution":{"observed_at":"2026-08-04T23:09:41.450991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-08-07T21:21:24.962049Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-04T23:09:41.453737Z","title":"Survey of vulnerabilities in large language models revealed by adversarial attacks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.453737Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:8c2c0698722d9758cc6e036b3035aba165605d148574596fe1dc66b3684f2aa7","observation_id":"6c917c07-f06e-4e09-9d7a-21b822e1d425","resolution":{"observed_at":"2026-08-04T23:09:41.453737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04127","last_updated":"2024-02-23T07:32:27Z","snapshot_observed_at":"2026-07-06T16:58:11.501328Z","submitted_at":"2023-12-07T08:29:58Z","title":"Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04127","snapshot_observed_at":"2026-08-04T23:09:41.456061Z","title":"Analyzing the inherent response tendency of llms: Real-world instructions-driven jailbreak,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.456061Z"},"links":{"cited_paper":"/paper/2312.04127","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:44fde91b994054e3802a736b1d7c6e87a840176df3789667555d65d964642003","observation_id":"af156b49-2e8e-48a1-b665-2b82b8b86dd3","resolution":{"observed_at":"2026-08-04T23:09:41.456061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09324","last_updated":"2024-11-06T04:43:57Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T17:01:40Z","title":"Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs","version":3},"cited_work":{"arxiv_id":"2406.09324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09324","snapshot_observed_at":"2026-08-04T23:09:41.892621Z","title":"Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs","venue":"cs.CR","work_id":"25fcaa0b-992e-47fc-b230-743a875da20f","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.458494Z"},"links":{"cited_paper":"/paper/2406.09324","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1c52ebcd0685623648186382e59714f661e267069d0bd687a28aa99813a7da38","observation_id":"3d039875-38b8-4456-ac5f-702912bac0dd","resolution":{"observed_at":"2026-08-04T23:09:41.896274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-08-04T23:09:41.460875Z","title":"Harmful fine- tuning attacks and defenses for large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.460875Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:3ff44310fc0c503f0556c811aa1666c752c52c4d7c500146c95ed01474af8ecc","observation_id":"12afa9f2-8495-4ea5-a717-ffd7c39d6a48","resolution":{"observed_at":"2026-08-04T23:09:41.460875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04524","last_updated":"2025-02-17T02:32:33Z","snapshot_observed_at":"2026-07-06T19:28:39.495408Z","submitted_at":"2024-10-06T15:34:04Z","title":"Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04524","snapshot_observed_at":"2026-08-04T23:09:41.463474Z","title":"Towards secure tuning: Mitigating security risks arising from benign instruction fine-tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.463474Z"},"links":{"cited_paper":"/paper/2410.04524","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:432b5a7e015d7d4aaa89afdb33920b64d37c3db3602c03143e3a4ad795e17e68","observation_id":"0a575274-5666-4764-9913-0df741e67ef7","resolution":{"observed_at":"2026-08-04T23:09:41.463474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T23:09:41.465759Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.465759Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:96e60d36b82fcfc3577056462e96356d1f9086e57ae3747a0870baa0f3bb153b","observation_id":"98df20ed-9ab8-4277-9bf6-30125ef8485f","resolution":{"observed_at":"2026-08-04T23:09:41.465759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.037350Z","title":"A holistic approach to undesired content detection in the real world,","venue":null,"work_id":"29de3994-6fd9-474f-a83d-f3f213ebfa4f","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.468117Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:b088c6fdf8a661e374dec8bd6b08b85600a348e26c3630d322730fd57da141d2","observation_id":"f161f21a-9365-4361-ab7b-725b7b14fb53","resolution":{"observed_at":"2026-08-04T23:09:42.040961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-04T23:09:41.470662Z","title":"Jailbreak and guard aligned lan- guage models with only few in-context demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.470662Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:d51206a613f2f8a5cd90bc5954481aed39006649bbcc9bcd86a6fae185010e10","observation_id":"881ed3e0-8875-48cf-a485-a295d796bf27","resolution":{"observed_at":"2026-08-04T23:09:41.470662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-04T23:09:41.473339Z","title":"Certifying llm safety against adversarial prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.473339Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:76a6484d530cc61d5e6e870865d4ddb7c424c9e81b0d018ee9ce636c58e7fc69","observation_id":"1eebe795-ea34-4255-a580-d7a0b4b0d66b","resolution":{"observed_at":"2026-08-04T23:09:41.473339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.475614Z","title":"Lightweight safety guardrails using fine-tuned bert embeddings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.475614Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f89b04127b85ec53e48abe1e01ad30bffbe23916cb40b7dd5f3560ebf38c8baa","observation_id":"8b5417fd-5bef-4bc5-8652-0547f8590e12","resolution":{"observed_at":"2026-08-04T23:09:41.475614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-04T23:09:41.478401Z","title":"Safede- coding: Defending against jailbreak attacks via safety-aware decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.478401Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6574c158d5c447e996e4af67725f1ff574d463bb08dfb1f95b9180a2832bb053","observation_id":"0986a88f-38f8-4ea1-9def-a33b45ba276e","resolution":{"observed_at":"2026-08-04T23:09:41.478401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17633","last_updated":"2024-01-31T07:26:47Z","snapshot_observed_at":"2026-08-05T14:33:09.669272Z","submitted_at":"2024-01-31T07:26:47Z","title":"Navigating the OverKill in Large Language Models","version":1},"cited_work":{"arxiv_id":"2401.17633","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.17633","snapshot_observed_at":"2026-08-04T23:09:41.837038Z","title":"Navigating the OverKill in Large Language Models","venue":"cs.CL","work_id":"aa27e9a4-951d-4438-9c68-a47cb024218d","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.480864Z"},"links":{"cited_paper":"/paper/2401.17633","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:caf269582f29e782b7b5e7635d812b2f3ca81fde74b0f5014aab99ea523ae0f3","observation_id":"e3c0882b-84ae-4945-a51d-c351a28d9757","resolution":{"observed_at":"2026-08-04T23:09:41.840571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01109","last_updated":"2024-11-24T20:09:55Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:56:50Z","title":"Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01109","snapshot_observed_at":"2026-08-04T23:09:41.483523Z","title":"Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.483523Z"},"links":{"cited_paper":"/paper/2402.01109","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ac17d31e3fab0457b2a927c261d3e70701508b0e88387c77339e7d431c9eac13","observation_id":"10a3c887-315a-40de-a43f-b04723e1dbe2","resolution":{"observed_at":"2026-08-04T23:09:41.483523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01586","last_updated":"2025-03-17T17:17:16Z","snapshot_observed_at":"2026-08-05T01:27:27.177475Z","submitted_at":"2024-09-03T03:59:22Z","title":"Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01586","snapshot_observed_at":"2026-08-04T23:09:41.485922Z","title":"Booster: Tackling harmful fine-tuning for large language models via attenuating harmful perturbation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.485922Z"},"links":{"cited_paper":"/paper/2409.01586","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1e410a484464c025db84e92f4ac5c03e2ef597cfd3820608f39df9e361f564e6","observation_id":"8cfb6400-5c9e-4148-bcae-beb5aafdf18e","resolution":{"observed_at":"2026-08-04T23:09:41.485922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-01T14:23:46.782297Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-04T23:09:41.488370Z","title":"Language models are homer simpson! safety re-alignment of fine-tuned language models through task arithmetic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.488370Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6377274908a27a0f07670088d4f45a2e5cacea9aba8a044181afd8c898d30441","observation_id":"3b83ca1f-1e85-426b-b604-e817fe22386e","resolution":{"observed_at":"2026-08-04T23:09:41.488370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16833","last_updated":"2025-01-05T21:51:46Z","snapshot_observed_at":"2026-07-31T00:03:11.135660Z","submitted_at":"2024-05-27T05:04:05Z","title":"Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16833","snapshot_observed_at":"2026-08-04T23:09:41.491116Z","title":"Safe lora: the silver lining of reducing safety risks when fine-tuning large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.491116Z"},"links":{"cited_paper":"/paper/2405.16833","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:2f0a25a5c67ecf3b7c9e936c3e962a0aef469456d5da8334aa59b4edd7b3683d","observation_id":"ef3557ae-8039-45ce-8b44-83a2979f2965","resolution":{"observed_at":"2026-08-04T23:09:41.491116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-04T23:09:41.493535Z","title":"A survey on mixture of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.493535Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:683add10549d1e56ba2b61fd7303640b0eb59a9ccca6d154ea2689390920470f","observation_id":"d0abc586-af39-432a-8053-36a2ccc3571d","resolution":{"observed_at":"2026-08-04T23:09:41.493535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.495912Z","title":"Uni-moe: Scaling unified multimodal llms with mixture of experts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.495912Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:06f5603a20b846c74c1e873f2844d2337e95e40093f8dacb3f272dd3a0cc4712","observation_id":"4632282d-a94f-4fc2-b241-76f34871da81","resolution":{"observed_at":"2026-08-04T23:09:41.495912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-04T23:09:41.498475Z","title":"Open- moe: An early effort on open mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.498475Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e1e5bc2b2963c742505c78c8026b85e27844bedddc05909db464f3e6e5bd1ebb","observation_id":"8371582d-84ec-4ec6-b30c-437d0b14014e","resolution":{"observed_at":"2026-08-04T23:09:41.498475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05644","last_updated":"2024-06-13T05:39:31Z","snapshot_observed_at":"2026-08-04T01:38:16.363370Z","submitted_at":"2024-06-09T05:04:37Z","title":"How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05644","snapshot_observed_at":"2026-08-04T23:09:41.500858Z","title":"How alignment and jailbreak work: Explain llm safety through intermediate hidden states,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.500858Z"},"links":{"cited_paper":"/paper/2406.05644","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:89044c5aa8461aaf55ee9740b21f70adcfbcc1c113662c8024fcae0d64ac1d22","observation_id":"a6e098f9-c354-479b-b8f2-9964ef0d3085","resolution":{"observed_at":"2026-08-04T23:09:41.500858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-04T23:09:41.503307Z","title":"Red teaming language models with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.503307Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a2b58d0997d0bb4ade7a4ba1f69d24d365308928f7ebc3ddc33b54d3721b5f10","observation_id":"d9becc34-a79c-413b-b080-229bd19f3777","resolution":{"observed_at":"2026-08-04T23:09:41.503307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-04T23:09:41.505782Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.505782Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:36292e8538ff279e9bf90da52eb8adc8ffdec4b3aff52a338f744f599475a411","observation_id":"426a32ea-c602-491d-9fc6-da5b8952a489","resolution":{"observed_at":"2026-08-04T23:09:41.505782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-04T23:09:41.508015Z","title":"Explore, establish, exploit: Red teaming language models from scratch,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.508015Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a955ec0c83d76266ef6a2dc8f13c0ce94b9341a0ff8c89dc49033fe310437a61","observation_id":"5f56caf1-de30-425d-a0ec-e7d7fabde360","resolution":{"observed_at":"2026-08-04T23:09:41.508015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-04T23:09:41.510729Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.510729Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7c09d7a86f2ba95053e7cecb230e7e987329b4f281e63e614933702d446be4d5","observation_id":"9fe51abf-e933-4e20-802a-28412b67252e","resolution":{"observed_at":"2026-08-04T23:09:41.510729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-04T23:09:41.513177Z","title":"Trustworthy llms: a survey and guide- line for evaluating large language models’ alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.513177Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ef1e4ee0e9e35b7307bc5630a54a52448a0dc5ae26270f167367794872c566fb","observation_id":"64bd5f15-fa7e-4f0d-b2ed-e26b626adbd3","resolution":{"observed_at":"2026-08-04T23:09:41.513177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-04T23:09:41.515431Z","title":"Cold-attack: Jail- breaking llms with stealthiness and controllability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.515431Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7d60e787392d49b1d60f4b8bf0c2a408c3044f52e8affd6c4f87c9de43e81526","observation_id":"c6ba4a17-9d7e-4a19-8b37-598ca4bf46c7","resolution":{"observed_at":"2026-08-04T23:09:41.515431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.517713Z","title":"Jailbroken: How does llm safety training fail?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.517713Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:dd08de9f1c3f37cb0854f84d0f15681878c1a7d962d23dbf71cbeb25057da4a5","observation_id":"fef8e249-e825-45c4-9063-a5adb4df700e","resolution":{"observed_at":"2026-08-04T23:09:41.517713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.019429Z","title":"Automatically auditing large language models via discrete optimization,","venue":null,"work_id":"34218c8a-ae61-4ed5-87c1-76d9d88547df","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.520081Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ad56a46fcbbc2d7b50b07a62f347b6f3ac44681f0fa69babe1d2339f373895e3","observation_id":"fe644a2a-601f-4f18-b136-82dca3400e09","resolution":{"observed_at":"2026-08-04T23:09:42.023516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15690","last_updated":"2024-02-24T02:27:55Z","snapshot_observed_at":"2026-08-04T20:02:09.278590Z","submitted_at":"2024-02-24T02:27:55Z","title":"Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15690","snapshot_observed_at":"2026-08-04T23:09:41.522170Z","title":"Foot in the door: Understanding large language model jailbreaking via cognitive psychology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.522170Z"},"links":{"cited_paper":"/paper/2402.15690","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e84fc2e60a953eae327bc19b53bea2400825a712a3138b3521222a4b3ad0fb20","observation_id":"a6efadde-989c-4147-8d82-5b3e79debe8b","resolution":{"observed_at":"2026-08-04T23:09:41.522170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05733","last_updated":"2023-02-11T15:57:44Z","snapshot_observed_at":"2026-07-06T14:50:49.200455Z","submitted_at":"2023-02-11T15:57:44Z","title":"Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05733","snapshot_observed_at":"2026-08-04T23:09:41.524212Z","title":"Exploiting programmatic behavior of llms: Dual-use through standard security attacks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.524212Z"},"links":{"cited_paper":"/paper/2302.05733","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:98e0d973bde9221e6ed22ecc31999d1b546cd10acc7b913729902cedeb00e255","observation_id":"efbff674-42ba-4754-b406-ece032bb95c6","resolution":{"observed_at":"2026-08-04T23:09:41.524212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-04T23:09:41.526476Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.526476Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:24fd5ee0757881bdf90aceaeeeeaaad4603aee8328f5da91f54e0dee7b491246","observation_id":"8277e1ce-0848-4875-b947-5de95d990291","resolution":{"observed_at":"2026-08-04T23:09:41.526476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-04T23:09:41.528615Z","title":"Jailbreaking black box large language models in twenty queries,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.528615Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7d2538dbf4faca5c8e0f44cc20fe3e7e6beadb8f4cb29596ba26cad4bcae6237","observation_id":"7fed6c88-2376-428a-bba4-3f70b0047335","resolution":{"observed_at":"2026-08-04T23:09:41.528615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-04T23:09:41.530996Z","title":"Removing rlhf protections in gpt-4 via fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.530996Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:30b711e6c794b3bb8359b42c8d5e1981e50d93bf0493b7c3f23d9ebd58edffda","observation_id":"60840032-8432-4455-8d31-8136cb96982e","resolution":{"observed_at":"2026-08-04T23:09:41.530996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.533142Z","title":"A survey on large language model (llm) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.533142Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6de0499a436b425433c1a3542c101f715d57d0fb8378215e0faf13a22e4feb49","observation_id":"0746e8d6-ca2d-490b-bf08-d3c599108cad","resolution":{"observed_at":"2026-08-04T23:09:41.533142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.535213Z","title":"Defending chatgpt against jailbreak attack via self-reminder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.535213Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1b4f205cf7ecdcddf863e6d9ef9e945ea46ce56f14e5173c9b1e391d5f3b72f0","observation_id":"1a343dbb-5ea4-4ee0-8f64-0f9446a2b4ad","resolution":{"observed_at":"2026-08-04T23:09:41.535213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-04T23:09:41.537604Z","title":"Baseline defenses for adversarial attacks against aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.537604Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:0685e4288e609a53dc7bbf07abf9d23e71bb72d5098817b8459c85e1fc428197","observation_id":"6b551ba0-8dcc-4009-9481-9a872dae0065","resolution":{"observed_at":"2026-08-04T23:09:41.537604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07308","last_updated":"2024-05-02T14:28:39Z","snapshot_observed_at":"2026-08-01T14:42:09.926151Z","submitted_at":"2023-08-14T17:54:10Z","title":"LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07308","snapshot_observed_at":"2026-08-04T23:09:41.540879Z","title":"Llm self defense: By self examination, llms know they are being tricked,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.540879Z"},"links":{"cited_paper":"/paper/2308.07308","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:0a15485cbc86df9a6c4ee3e04a59817d8ae976d00b86c8289e59b6c35564387d","observation_id":"41b7dcb4-1a29-42f4-825f-7e6bcf4fb978","resolution":{"observed_at":"2026-08-04T23:09:41.540879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T23:09:41.543359Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.543359Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:127fc7d181586be665cc67bb02fb641fb19fd315faf3b793474bd4c21a9b601a","observation_id":"27d14d86-01b1-421c-a413-6a07a1aa0db2","resolution":{"observed_at":"2026-08-04T23:09:41.543359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10814","last_updated":"2024-10-16T02:00:24Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:44Z","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10814","snapshot_observed_at":"2026-08-04T23:09:41.545861Z","title":"Your mixture-of-experts llm is secretly an embed- ding model for free,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.545861Z"},"links":{"cited_paper":"/paper/2410.10814","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:49b85780aca97f7cff141eeddc39d6aed480355ce55e961148fce486bb544552","observation_id":"16c5c855-997c-46f1-a7ea-85d38f328d70","resolution":{"observed_at":"2026-08-04T23:09:41.545861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18219","last_updated":"2025-06-21T07:56:18Z","snapshot_observed_at":"2026-08-02T07:28:14.092271Z","submitted_at":"2024-06-26T10:07:57Z","title":"A Closer Look into Mixture-of-Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18219","snapshot_observed_at":"2026-08-04T23:09:41.548125Z","title":"A closer look into mixture-of-experts in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.548125Z"},"links":{"cited_paper":"/paper/2406.18219","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6990efce1b3006d5112342ab4f2e3ed0f41665132084cecc09e9eb99935b35ac","observation_id":"10d452d0-ad48-457a-9e2f-2a8516dd405b","resolution":{"observed_at":"2026-08-04T23:09:41.548125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07799","last_updated":"2019-08-08T06:58:31Z","snapshot_observed_at":"2026-07-06T07:54:02.817335Z","submitted_at":"2019-05-19T19:43:14Z","title":"Adaptive Attention Span in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07799","snapshot_observed_at":"2026-08-04T23:09:41.550995Z","title":"Adaptive attention span in transformers,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.550995Z"},"links":{"cited_paper":"/paper/1905.07799","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f0583899ce19dec1fdb4f1e7082dc3cf1db30eb2bc34bfcab90d09f0041e0697","observation_id":"5381ff8e-c8a9-4738-95c8-afc06896dcd8","resolution":{"observed_at":"2026-08-04T23:09:41.550995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05364","last_updated":"2025-03-05T04:18:08Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T05:45:42Z","title":"Is On-Device AI Broken and Exploitable? Assessing the Trust and Ethics in Small Language Models","version":2},"cited_work":{"arxiv_id":"2406.05364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05364","snapshot_observed_at":"2026-08-04T23:09:41.674899Z","title":"Is On-Device AI Broken and Exploitable? Assessing the Trust and Ethics in Small Language Models","venue":"cs.CR","work_id":"d597bde5-6e2e-4913-a9cd-de266156c8b1","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.554098Z"},"links":{"cited_paper":"/paper/2406.05364","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:3fa773bb77ea750a296b3849bad38be5290857fdf97b63f487c15749feed6fad","observation_id":"3e54ab47-115d-4f55-8f27-43baeb65ec61","resolution":{"observed_at":"2026-08-04T23:09:41.679537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.556460Z","title":"The hidden risks of large reasoning models: A safety assessment of r1,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.556460Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7729176b2398556fb154e9c9c1a16370c22c5da4c99a0005ecf4539ec22ad268","observation_id":"236bfd5a-4043-4a69-9b94-c05979f94c3b","resolution":{"observed_at":"2026-08-04T23:09:41.556460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:42.001028Z","title":"Falcon-40B: an open large language model with state-of-the-art performance,","venue":null,"work_id":"81c6f1ba-b6f6-43e6-983c-892cbfb33dfb","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.558613Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7cd4c4bb53fe53c7b6731750f0e1243f8c09be915379ff81ea33247e7ca10c73","observation_id":"3817d6ae-1a90-4122-ad7d-1712b98f17b0","resolution":{"observed_at":"2026-08-04T23:09:42.004374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.992367Z","title":"Qwen2 technical report,","venue":null,"work_id":"b1655641-bf6e-4a98-919e-c93bd31b2522","year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.560941Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f3d91c4b6a812efc985d7230db456bafb2610d527189ff3ce674a94c829cfb4d","observation_id":"1e150241-98f4-4055-aadf-150db08c3e80","resolution":{"observed_at":"2026-08-04T23:09:41.995121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.563287Z","title":"Qwen2.5: A party of foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.563287Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:8c1d9d90b266b4933049d7749abe98b2f8e94042493af451b45ef486fd7b1199","observation_id":"72b6ea39-32e3-4be0-9da5-bd150d90686a","resolution":{"observed_at":"2026-08-04T23:09:41.563287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-04T23:09:41.565548Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.565548Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:f647371b8616af9071f99eab30037e77481d50871eb036ec5c0113624b607563","observation_id":"f203041f-f3e2-43da-91ea-3b60b6da5816","resolution":{"observed_at":"2026-08-04T23:09:41.565548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T23:09:41.568088Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.568088Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:b82b19c3dbd553f558a3b4858d7794e92d9085b1cc54e02ffb88c086a9e539a6","observation_id":"ccb3ab6d-60ab-4875-8b4e-ea684f463a66","resolution":{"observed_at":"2026-08-04T23:09:41.568088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.979999Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning,","venue":null,"work_id":"29ba34bf-69af-4f00-96a1-708238556b4a","year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.570710Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:95a26b0209254bcda1377dc3cf979b1d4654620696c4ed45dbf6e4e2bb82cbd0","observation_id":"f663f21d-6fa0-4780-abeb-cc0ad5f7768c","resolution":{"observed_at":"2026-08-04T23:09:41.982843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T23:09:41.573265Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.573265Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:1949a8f8977213019a4080ba9f9d16da9e55f332d448108e7461b84b418793aa","observation_id":"f4736afa-cf44-4f03-8fef-46af2cc792f0","resolution":{"observed_at":"2026-08-04T23:09:41.573265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-07T18:11:43.608954Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-04T23:09:41.575944Z","title":"Safechain: Safety of language models with long chain- of-thought reasoning capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.575944Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:cf80600361a89a825b7d3fd428a1895536c0932dc41ebe599aa729bc4d3ee813","observation_id":"89dce95f-0d2c-4792-9e61-17f46f8792bb","resolution":{"observed_at":"2026-08-04T23:09:41.575944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-04T23:09:41.578345Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.578345Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:7103a758e7fec668860b5abfb97379e52849200997cab3b2cc6a6e8a3ca7e73a","observation_id":"66f4bc15-23dc-4d73-aba2-5d4f2540df54","resolution":{"observed_at":"2026-08-04T23:09:41.578345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-06T23:45:57.910675Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-04T23:09:41.580806Z","title":"Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.580806Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:a41dcd34406aa76da754739252d19565d0668126beef99db37831873350a28bb","observation_id":"4af7982f-a890-4203-9d1f-94fefb2fb084","resolution":{"observed_at":"2026-08-04T23:09:41.580806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:09:41.583242Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.583242Z"},"links":{"citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:4bb1e95c822dd79cebb2f1ea5459d937f884783a7692b812fbf12a9b538bb6c2","observation_id":"fc050fd4-0ae3-4005-a987-602c34e7b2ed","resolution":{"observed_at":"2026-08-04T23:09:41.583242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02875","last_updated":"2025-03-04T18:56:03Z","snapshot_observed_at":"2026-08-07T17:29:34.418079Z","submitted_at":"2025-03-04T18:56:03Z","title":"The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02875","snapshot_observed_at":"2026-08-04T23:09:41.585521Z","title":"The first few tokens are all you need: An efficient and effective unsupervised prefix fine-tuning method for reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.585521Z"},"links":{"cited_paper":"/paper/2503.02875","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:d5edb494d4d11102393b131e358ca3e583876f897562ada34a81365b58fa27c9","observation_id":"9694cb0d-1a26-4cb1-8a28-613fb8689937","resolution":{"observed_at":"2026-08-04T23:09:41.585521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T23:09:41.587858Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.587858Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:ddb51ce2efa4cf012db19ad5e9ff59c7b3a696ef68611264ccc95738b07fe28d","observation_id":"b591270b-0b7d-4011-845c-880f0d93f679","resolution":{"observed_at":"2026-08-04T23:09:41.587858Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2509.06807."}