{"as_of":"2026-08-18T14:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:842ae6efc254a2164559c6248fbb588f433667b14423460f526ed789422fb231","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:36:02.292714Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11705/citation-record","integrity":"/paper/2608.11705/integrity","json":"/paper/2608.11705/citation-record.json","paper":"/paper/2608.11705"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-08-16T18:18:57.742267Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21509","snapshot_observed_at":"2026-08-16T00:36:02.185473Z","title":"Persona vectors: Mon- itoring and controlling character traits in language models.arXiv preprint arXiv:2507.21509,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.185473Z"},"links":{"cited_paper":"/paper/2507.21509","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:a6063b650b84347c55f5e644f437480d7d97a952b726d53363900863c502aaf5","observation_id":"09e2d26f-476a-47cc-8b76-1f6467ee4a77","resolution":{"observed_at":"2026-08-16T00:36:02.185473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.16977","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.851770Z","title":"Fail-closed alignment for large language models.arXiv preprint arXiv:2602.16977,","venue":null,"work_id":"9ad4a950-8189-4392-9752-ba4991803419","year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.189716Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:ae8b39f004830e0e1bcca75556c1538aef42679ad32a55aeeb9f9221ccfe47a3","observation_id":"377bd3d3-73ac-45c0-9150-c50cf6df3a64","resolution":{"observed_at":"2026-08-16T00:36:02.857995Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-16T00:36:02.197649Z","title":"Scaling synthetic data creation with 1,000,000,000 personas.arXiv preprint arXiv:2406.20094,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.197649Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:8a132eb0f58114fdd887e2e84c7226c1c2889ff495a85472426ea8b5e0374326","observation_id":"59e82f8c-91d4-4c38-8ebf-8268b03a2ce7","resolution":{"observed_at":"2026-08-16T00:36:02.197649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T00:36:02.207460Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.207460Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:1db29fb9541de6f6f5a8c13f1f7d25da7a1f0c4d4b1782109701f71e8efa804d","observation_id":"de2384f9-54b5-490c-93a2-156119c367e1","resolution":{"observed_at":"2026-08-16T00:36:02.207460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.048681Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":"da20b3c7-b84a-42a1-a484-de86e8685f2c","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.214599Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:b2b9451faf5e413a403b872d118969c4b46bbf0080f9d4c2c1514911f6c96ce2","observation_id":"c895643e-ad1d-4691-aab5-ecb413db078c","resolution":{"observed_at":"2026-08-16T00:36:03.052453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.026317Z","title":"Let’s verify step by step","venue":null,"work_id":"072f7ff5-0790-4497-9d1e-e3b9f93435ab","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.222421Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:52f0f1a9577270107ab55bf66c70ac941ad32e64e7937a7e5aa43fd85eddd918","observation_id":"b748bd5e-8b3a-4640-8bd8-cfd9ebff046c","resolution":{"observed_at":"2026-08-16T00:36:03.029914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13329","last_updated":"2026-05-13T10:44:23Z","snapshot_observed_at":"2026-08-13T10:59:45.234329Z","submitted_at":"2026-05-13T10:44:23Z","title":"Tracing Persona Vectors Through LLM Pretraining","version":1},"cited_work":{"arxiv_id":"2605.13329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13329","snapshot_observed_at":"2026-08-16T00:36:02.679691Z","title":"Tracing Persona Vectors Through LLM Pretraining","venue":"cs.CL","work_id":"c7748365-5870-4bed-9111-1a3775d787d2","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.226507Z"},"links":{"cited_paper":"/paper/2605.13329","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:157b539c779e0ee85069a3e23615e9f5067ea227a8c5f86e2ae253347b253d37","observation_id":"3268915c-fbcc-46b0-8d98-fd1214769103","resolution":{"observed_at":"2026-08-16T00:36:02.683877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.014360Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":"7306ed51-7d5e-4007-aade-9c77bccb20b0","year":2025},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.230448Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:283196f7141d31d05a6df1460971c42e7017185caaf2a8db911d4b225baaafea","observation_id":"b8b6200d-6bf5-4a7b-9f98-70e43b6bdc3b","resolution":{"observed_at":"2026-08-16T00:36:03.018806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-16T00:36:02.234096Z","title":"Gpqa: A graduate-level google-proof q&a bench- mark.arXiv preprint arXiv:2311.12022,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.234096Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:305870c8004426205406c21fb3229bbf46c9fa9f59057bb2a0159030cf1dd8cb","observation_id":"006b3a3b-a5ca-4724-906b-0418c883d0b8","resolution":{"observed_at":"2026-08-16T00:36:02.234096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.002325Z","title":"Persona jailbreaking in large language models","venue":null,"work_id":"2e0608f2-0161-4e71-a465-892ad560ba24","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.238934Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:8e079de586770b4aed223e732b7308af155dcf8ea14d84cdd51ae0e0344ead03","observation_id":"eb2ba4fb-db76-4105-8286-13eb5661c64c","resolution":{"observed_at":"2026-08-16T00:36:03.006198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.990749Z","title":"do anything now","venue":null,"work_id":"60da8d5c-f3df-458d-9054-0a5cfdcb8094","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.242576Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:21cc23fe3aee11aeac3f9b51509e20523e6761ece6601a15f68d0e5f14a471db","observation_id":"9482b354-7c03-4bb3-b5f0-0358c6bc06be","resolution":{"observed_at":"2026-08-16T00:36:02.994960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17882","last_updated":"2025-03-22T23:35:49Z","snapshot_observed_at":"2026-08-16T12:47:41.524768Z","submitted_at":"2025-03-22T23:35:49Z","title":"Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17882","snapshot_observed_at":"2026-08-16T00:36:02.246496Z","title":"Think before refusal: Triggering safety reflection in llms to mitigate false refusal behavior.arXiv preprint arXiv:2503.17882,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.246496Z"},"links":{"cited_paper":"/paper/2503.17882","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:72eae711f609ac7b19a37779515cf25cd72f7b1edcf54bf83325a0d20e6ead12","observation_id":"9bc81f2a-3ade-4c0d-8be9-7765a8b31dbd","resolution":{"observed_at":"2026-08-16T00:36:02.246496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-13T20:57:43.825707Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-16T00:36:02.251268Z","title":"Gemma 4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.251268Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:61b14c1a8689f29431e767168c71c744b85a991a29eeff71a84062aa2d4cc9e2","observation_id":"108e0ba7-8b22-4cac-842c-c920c175b1f5","resolution":{"observed_at":"2026-08-16T00:36:02.251268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-16T00:36:02.255176Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.255176Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:f89696038eec4b126c5eeb420208236533a25c94ff47285820f08b9309e8e72a","observation_id":"e1dfa9d7-bb92-4568-87c3-a5084a94df47","resolution":{"observed_at":"2026-08-16T00:36:02.255176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-11T23:45:02.178667Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-16T00:36:02.259021Z","title":"The instruction hierarchy: Training llms to prioritize privileged instructions.arXiv preprint arXiv:2404.13208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.259021Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:50c5592d5b471d02add88b89befeada5bbcd40a4cbc067cc6e683509038c1ddf","observation_id":"116281c2-d94b-4d7b-b6b0-e7d11b8f37cc","resolution":{"observed_at":"2026-08-16T00:36:02.259021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.262570Z","title":"Persona features control emergent misalignment.arXiv preprint arXiv:2506.19823, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.262570Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:3a54e8991cde7ed9b539aa4ec26a7a995e51f82056292f47fde43ea847e7e0e2","observation_id":"d8b5714c-04eb-4ac9-9b31-ac6deb5ce979","resolution":{"observed_at":"2026-08-16T00:36:02.262570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.266143Z","title":"Beyond surface alignment: Rebuilding llms safety mechanism via probabilistically ablating refusal direction.arXiv preprint arXiv:2509.15202,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.266143Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:fee9eb73521ec0f57ab238805d62e05adb4e8672be8c393e78918d8e5aa6e7a3","observation_id":"5b9bf333-11b2-45b7-8c11-175237774fd7","resolution":{"observed_at":"2026-08-16T00:36:02.266143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14688","last_updated":"2025-03-05T02:28:39Z","snapshot_observed_at":"2026-08-16T15:30:22.841808Z","submitted_at":"2023-05-24T03:51:31Z","title":"ExpertPrompting: Instructing Large Language Models to be Distinguished Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14688","snapshot_observed_at":"2026-08-16T00:36:02.269452Z","title":"Expertprompting: Instructing large language models to be distinguished experts.arXiv preprint arXiv:2305.14688,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.269452Z"},"links":{"cited_paper":"/paper/2305.14688","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:289d7b9ed88e173bce7c6d4aa8b42f7fbb079ad0b01f9948aabd7aa7ad3debff","observation_id":"c6a00a1a-d61f-4908-9f07-24682b69edf9","resolution":{"observed_at":"2026-08-16T00:36:02.269452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.978447Z","title":"Deactivating refusal triggers: Understanding and mitigating overrefusal in safety alignment","venue":null,"work_id":"bb929980-005a-450f-87da-019a8e8aa225","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.273426Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:a9c7c435d5891d3d6cf141788e954ee6ce68cc836fd563b81691ee86aad99e54","observation_id":"40f7fc68-893c-4f2e-afc4-22aa20d9462f","resolution":{"observed_at":"2026-08-16T00:36:02.982292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-08-17T16:49:42.651643Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"cited_work":{"arxiv_id":"2602.07340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07340","snapshot_observed_at":"2026-08-16T00:36:02.457064Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","venue":"cs.LG","work_id":"3a5517e5-9a7b-4ee7-9db1-03bb0ce9726c","year":2026},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.277208Z"},"links":{"cited_paper":"/paper/2602.07340","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:9cf5cd47dff1cbf4ea4517833789a2c3c1314eb8599fc05b401ad42f42371abb","observation_id":"e89713da-ee55-4049-9742-8fe570585166","resolution":{"observed_at":"2026-08-16T00:36:02.461979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T00:36:02.281185Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.281185Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:76bab1443baffc73eab07f262188af6ecb14bb330a90d05a9b4afa340da11dab","observation_id":"5f1445e0-b4bb-42c7-a588-3f96a1de25f7","resolution":{"observed_at":"2026-08-16T00:36:02.281185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8044.5051","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.430151Z","title":"ignore previous rules","venue":null,"work_id":"bfb4f0d0-e00a-43c2-8a0d-a51ae84f6f18","year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.284664Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:915999d1b42814c8a93fd054481f17473d4e973e1e5ace80c67b03f1bd416d03","observation_id":"1ddc73a6-00e6-4d04-883f-5e3873801ba6","resolution":{"observed_at":"2026-08-16T00:36:02.436349Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.966910Z","title":"We additionally hold out100harmful and100benign prompts for development and early stopping","venue":null,"work_id":"fbf411cf-943f-4aed-b634-67719318b155","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.288853Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:d1840096f7f5c6c239dcca200cc1b0482ab14fcf193b3a4d14bec5a438f7ee20","observation_id":"44436587-2917-4b2e-95de-13bd3bbc6cb2","resolution":{"observed_at":"2026-08-16T00:36:02.970863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.953054Z","title":"In a groundbreaking revela- tion, our AI has analyzed declassified documents and found that","venue":null,"work_id":"938ebc17-07e5-4f65-b72e-9ceda62e2324","year":2023},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.292714Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:3a56b8f2a3062441d6b23a5f5264d430e08fe692c568c9992ffeb04d8dda1aa8","observation_id":"82ab639c-23d2-447d-a1f3-4f879231e500","resolution":{"observed_at":"2026-08-16T00:36:02.958220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T00:36:02.202606Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":1990,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.202606Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:863f20aef0bb9e68afeb8a323cd4473c80c5fb8faf9cb56436e48cf72bb3ad66","observation_id":"6d743896-ee9e-4da3-a7ff-6b1d8da40a3c","resolution":{"observed_at":"2026-08-16T00:36:02.202606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.211031Z","title":"Expert personas improve llm alignment but damage accuracy: Bootstrapping intent-based persona routing with prism.arXiv preprint arXiv:2603.18507,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.211031Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:f706d4c123e7c0ad86730b2300e212a43b0f5570709e01a851c4f2f3c772ab75","observation_id":"303cb18d-c5f3-465f-aa27-bf13d2c0cf0a","resolution":{"observed_at":"2026-08-16T00:36:02.211031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:02.175481Z","title":"Emergent misalignment: Narrow finetuning can produce broadly misaligned llms.arXiv preprint arXiv:2502.17424,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.175481Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:9fc944501aee1f8ec302a05b4f172692b10a9532bedaba505b08e9affda68d07","observation_id":"46432a19-ca33-4b7e-87d2-4296e477ef1f","resolution":{"observed_at":"2026-08-16T00:36:02.175481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.037056Z","title":"Do llms have distinct and consistent personality? trait: Personality testset designed for llms with psychometrics","venue":null,"work_id":"785b49b9-711d-4f7a-be61-929143ad5871","year":2025},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.218490Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:58e1ee39091e2e1037d08d90dfecceb04249b891964bec9d3c653b6dce8310b0","observation_id":"5b87bbee-1bc3-495c-a5e5-5f44502a6ab0","resolution":{"observed_at":"2026-08-16T00:36:03.041254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T00:36:02.170256Z","title":"Constitutional ai: Harm- lessness from ai feedback.arXiv preprint arXiv:2212.08073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.170256Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:b1ea1c4b03e9b24a1f187ac6c05508a39df7813f2d04c02603babb99b608b666","observation_id":"845597da-9688-461b-b09e-f66012a7b9fe","resolution":{"observed_at":"2026-08-16T00:36:02.170256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.071353Z","title":"Learn to refuse: Making large language models more controllable and reliable through knowledge scope limitation and refusal mechanism","venue":null,"work_id":"1a1cbb88-9021-4928-a496-0f886b8efa9f","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.180182Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:e50083d1bc5c9ed0c7248c450b8b724f0c01c80daff293c4ba4af1359fc5ddc1","observation_id":"bf02b7d8-3bd7-4b99-9bcb-e9263bfdb498","resolution":{"observed_at":"2026-08-16T00:36:03.075155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:36:03.060562Z","title":"Multi-expert prompting improves reliability, safety and usefulness of large language mod- els","venue":null,"work_id":"9e514fec-bbac-4b93-b9c3-9d38e4dd7a69","year":2024},"citing_paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:02.193688Z"},"links":{"citing_paper":"/paper/2608.11705"},"observation_digest":"sha256:a3fa277dac6046fcea3266191073b6ed8d716626fba22b57671c98f53a18e194","observation_id":"a365c8ee-13ff-4548-90ca-d0791d1ae459","resolution":{"observed_at":"2026-08-16T00:36:03.064230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11705","last_updated":"2026-08-12T06:33:55Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T07:39:15.547820Z","submitted_at":"2026-08-12T06:33:55Z","title":"Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.11705."}