{"as_of":"2026-08-07T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:debd03f7fe9ffe251b98d3b5b614091ab81f2a2f76b57444b9c47217ef39aa13","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:57:44.976131Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T16:03:12.728352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:39.399032Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:6d85d6b73f8922d1d3edbda449854e4065d862a478d1911b7758c1e53b3e5e39","observation_id":"5dffa089-944e-407c-9c27-475a836514af","resolution":{"observed_at":"2026-05-10T06:06:19.523835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:10.263663Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:874734abf30c3a7d80df85ba7e09f72f304870f6c0105434b4dd8802fa2b379a","observation_id":"27eaeb93-936b-4df8-99e9-37edfaa29333","resolution":{"observed_at":"2026-05-13T01:57:06.385931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:06.989077Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:65bf5fd18e7e532adac8f3a880b34f9af171138903fbf5e2634e10a2ef445dcd","observation_id":"155ce5e3-1110-4b05-9f61-83d5fcff2aee","resolution":{"observed_at":"2026-05-14T21:12:58.856739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2605.24154","last_updated":"2026-05-22T19:22:17Z","snapshot_observed_at":"2026-07-06T23:34:13.859813Z","submitted_at":"2026-05-22T19:22:17Z","title":"Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T16:03:12.728352Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2605.24154"},"observation_digest":"sha256:0e60b823ee9de8b247c0252d893be542ad94a605c127d72741e51b9b935951e8","observation_id":"a1ba78f2-a143-49b2-b127-53827db5d500","resolution":{"observed_at":"2026-06-30T16:04:52.603163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2606.07335","last_updated":"2026-06-05T14:49:26Z","snapshot_observed_at":"2026-07-06T23:47:00.425715Z","submitted_at":"2026-06-05T14:49:26Z","title":"Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:48.561400Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2606.07335"},"observation_digest":"sha256:a145de3c0914985cf8dfe540cf4afde131c495de02fbae0086bf8b45d8b88fed","observation_id":"04bef1af-3585-4424-8c72-813677dafedb","resolution":{"observed_at":"2026-07-02T17:37:14.873093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2507.04250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04250","snapshot_observed_at":"2026-07-04T07:29:39.399032Z","title":"Just enough shifts: Mitigating over-refusal in aligned language models with targeted representation fine-tuning","venue":null,"work_id":"a028b559-6129-4f9e-9683-9647c845121f","year":2025},"citing_paper":{"arxiv_id":"2606.21147","last_updated":"2026-06-19T06:37:32Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T06:37:32Z","title":"AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T13:22:12.541923Z"},"links":{"cited_paper":"/paper/2507.04250","citing_paper":"/paper/2606.21147"},"observation_digest":"sha256:6e8686020f5244a3038fe86af6494b43da6cfa7babd9b69eb9d87bbdd6994ec9","observation_id":"7a11ef31-8b4d-48ac-a05c-09782b7accf7","resolution":{"observed_at":"2026-07-04T07:29:39.400611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04250/citation-record","integrity":"/paper/2507.04250/integrity","json":"/paper/2507.04250/citation-record.json","paper":"/paper/2507.04250"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-07-06T19:08:48.648862Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-06T19:57:43.379859Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.379859Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:3db2b31adfbc66f271479d6c744df989691d67bc705daa7edf86f75b36ebbb4a","observation_id":"8d3d4fb5-83c3-42de-a7a6-611ceb89fe6f","resolution":{"observed_at":"2026-08-06T19:57:43.379859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T19:57:43.420384Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.420384Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:4893c8ec604d00e1498acc9f122705142d6e5be7c32df9d0bf5e61405a85e5d7","observation_id":"ad634ece-212a-4348-a4c2-84b347ce5ad0","resolution":{"observed_at":"2026-08-06T19:57:43.420384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:46.230321Z","title":null,"venue":null,"work_id":"980be427-d00c-4124-b1ed-3549a4306e99","year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.505443Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:4f9ac36e9fd23e83a6b0e85cb858b78ec5e4345a99ba403c42723acde90cb50c","observation_id":"01d7e062-d6e8-4049-bd09-02442604577d","resolution":{"observed_at":"2026-08-06T19:57:46.335341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11491","last_updated":"2024-12-17T13:32:36Z","snapshot_observed_at":"2026-07-06T19:03:56.484389Z","submitted_at":"2024-08-21T10:01:34Z","title":"SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering","version":2},"cited_work":{"arxiv_id":"2408.11491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11491","snapshot_observed_at":"2026-08-06T19:57:45.383088Z","title":"SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering","venue":"cs.AI","work_id":"d6b62303-b70c-425d-b2b1-4ba9b62b1c99","year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.549520Z"},"links":{"cited_paper":"/paper/2408.11491","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:9d673f3f9cc81fd76f6cd17f16455dc03b679e0004632d6fe0b38e2046c306cb","observation_id":"6363d2f3-5563-4c94-9ffc-1ed0b9af19d9","resolution":{"observed_at":"2026-08-06T19:57:45.412418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-06T19:57:43.629886Z","title":"Or-bench: An over-refusal benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.629886Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:f85fe7957947fa175b0635686c62f34a78e3c7ecfe74cd20a8dd63a3f1d1897d","observation_id":"245fc8a6-5db8-4ccb-8ce6-e13192ca047c","resolution":{"observed_at":"2026-08-06T19:57:43.629886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T19:57:43.694438Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.694438Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:20edd89b63133572444715050db793787c51b585ce8887741ee5d2b7a65f54bb","observation_id":"7c88bbe9-127b-40f4-9ca0-8bab13ac7b53","resolution":{"observed_at":"2026-08-06T19:57:43.694438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-06T19:57:43.738959Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.738959Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:1c476ea14dec7aab85affcfd1132a85e8f12bca8fafffd37306e10bdb266a4e0","observation_id":"63cb46a6-5c23-4a45-ad36-46c5ebbd73f1","resolution":{"observed_at":"2026-08-06T19:57:43.738959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-08-06T19:57:43.796231Z","title":"Trustllm: Trustworthiness in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.796231Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:1db9ce8de474bb89e2b4fd5c8989acd3f569ee515398166aaecfabfbb9cf9791","observation_id":"3159a8a9-bde1-48bc-8dda-7e11eb0f4802","resolution":{"observed_at":"2026-08-06T19:57:43.796231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:57:43.829835Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.829835Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:2c40a859b43be8c2d1cd11774943e45a94c8ef47417aeb44138bb19f0b0685ce","observation_id":"7af4eff9-96b4-41c6-a3f4-5c45c0eb443d","resolution":{"observed_at":"2026-08-06T19:57:43.829835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:46.072756Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"ba4f8eb2-0a0c-490c-bd85-0cd755038f54","year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.856574Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:9e5454bd0f192437d1f64bd13b0f9702b67e42b25f9ff89ed924be750d988765","observation_id":"34744acc-9d3e-467f-8461-8daf47ba30b2","resolution":{"observed_at":"2026-08-06T19:57:46.158196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:43.914249Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.914249Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:85553cfe234ab9f55cc078fd1589b6978ffce304f78d3c43f44092fbe4ffc95f","observation_id":"c5e47030-9380-439f-a9cc-566b8510edc1","resolution":{"observed_at":"2026-08-06T19:57:43.914249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17003","last_updated":"2025-04-07T07:23:33Z","snapshot_observed_at":"2026-08-07T07:23:22.071348Z","submitted_at":"2024-08-30T04:35:59Z","title":"Safety Layers in Aligned Large Language Models: The Key to LLM Security","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17003","snapshot_observed_at":"2026-08-06T19:57:43.958573Z","title":"Safety layers in aligned large language models: The key to llm security","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.958573Z"},"links":{"cited_paper":"/paper/2408.17003","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:8d9dc1b95d04ffa71e1b7b80547fdd6ea8b2d2a15dcdb03f4a554a3b1d920216","observation_id":"7cc02672-ba13-4cb4-8174-ab22e8cf3187","resolution":{"observed_at":"2026-08-06T19:57:43.958573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-06T19:57:43.979623Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:43.979623Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:2dab32d71d32050ca56ecc97d139fc4d2ccb15eb26cf24dfef7405eb10bc887e","observation_id":"d8f4e40e-329a-4c5d-aa15-0a3e987f0f32","resolution":{"observed_at":"2026-08-06T19:57:43.979623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T19:57:44.013076Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.013076Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:d99ad95aa863ed1f926e8afe1081dc380b40a369883d912a76a7d23b47030c26","observation_id":"6f78b735-0c61-4eb6-91af-9259c8a13a8a","resolution":{"observed_at":"2026-08-06T19:57:44.013076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.069618Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.069618Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:a606c750543f085c8a3f76f8a3303e157b47bdbd528ed914e0d02b473e4c8d2c","observation_id":"d719852f-f4d1-4777-b158-d313ce2019ae","resolution":{"observed_at":"2026-08-06T19:57:44.069618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:45.931139Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!, 2023","venue":null,"work_id":"58a1a3bd-e7cd-4a27-b7d4-bae57356bee5","year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.107947Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:0c7500ffb391504e6b93e9b6f6a93b9ecacf5b8ce1b2a412d46509b550c6c875","observation_id":"d2b9753c-600a-4924-b2f5-462fc90e12d9","resolution":{"observed_at":"2026-08-06T19:57:45.977389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05418","last_updated":"2024-08-29T14:50:10Z","snapshot_observed_at":"2026-08-05T09:58:02.980890Z","submitted_at":"2024-05-08T20:39:54Z","title":"Mitigating Exaggerated Safety in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05418","snapshot_observed_at":"2026-08-06T19:57:44.141968Z","title":"and Bhalani, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.141968Z"},"links":{"cited_paper":"/paper/2405.05418","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:2830e508deb5990c97a89a7db083680bb4b5764b8ae845540eddf4f4d74b41d6","observation_id":"3a62f8b4-c2ec-41f9-992b-39d757f069fd","resolution":{"observed_at":"2026-08-06T19:57:44.141968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-06T19:57:44.190147Z","title":"R., Vidgen, B., Attanasio, G., Bianchi, F., and Hovy, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.190147Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:3dd69cbd3d0840bd025f6d5ff9de6c5d3ade5fcd9408eaedf3cf00b46be4d8fb","observation_id":"ced8ca4f-2b94-4e70-9c0a-ba241d4ad76d","resolution":{"observed_at":"2026-08-06T19:57:44.190147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.251439Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.251439Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:8e0d490c49cb9bb0c383d47ec4abfe95ec29a418af393841d741943d46889e5d","observation_id":"c75906bb-a888-4fc8-8a57-a2d0f659bbe1","resolution":{"observed_at":"2026-08-06T19:57:44.251439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17633","last_updated":"2024-01-31T07:26:47Z","snapshot_observed_at":"2026-08-05T14:33:09.669272Z","submitted_at":"2024-01-31T07:26:47Z","title":"Navigating the OverKill in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17633","snapshot_observed_at":"2026-08-06T19:57:44.284799Z","title":"Navigating the overkill in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.284799Z"},"links":{"cited_paper":"/paper/2401.17633","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:fbae8cf58f874d07dc2ed519399c6252573ec732f758b7bb9d020dea94cdcb5d","observation_id":"b9e105cc-1196-42d2-a5d7-6a6921395e5f","resolution":{"observed_at":"2026-08-06T19:57:44.284799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T19:57:44.329662Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.329662Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:ab31db6b3faa8bf28b6ca120e4794ff13a3384d134ff9dc9d9407c5294344a4e","observation_id":"0d864902-e309-40c2-9228-8090fcdddf14","resolution":{"observed_at":"2026-08-06T19:57:44.329662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:57:44.388456Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.388456Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:7e96850f3b58d248ea9e79c0d08d750d0c526092d87f65d9553b71100837402d","observation_id":"9f41f133-8e1b-42a4-96e3-fe5307c65c16","resolution":{"observed_at":"2026-08-06T19:57:44.388456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:45.720618Z","title":"and Hinton, G","venue":null,"work_id":"9ef4ed3d-897c-47fd-83b7-5d9fdb1a5c8d","year":2008},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.415871Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:ee9877ad4fd9ae33616bdeeef4235c66888055315b4813281d518b66e762b55d","observation_id":"113f4a0c-e4e9-4fc3-8c43-9b0ccdfa1a4f","resolution":{"observed_at":"2026-08-06T19:57:45.827219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03415","last_updated":"2025-03-03T23:46:14Z","snapshot_observed_at":"2026-08-04T03:49:36.273488Z","submitted_at":"2024-10-04T13:25:32Z","title":"Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03415","snapshot_observed_at":"2026-08-06T19:57:44.461260Z","title":"Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.461260Z"},"links":{"cited_paper":"/paper/2410.03415","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:64b2b4b4de604e23a09a6c3c5770d1046e179f5142278084a6d793d88af8393a","observation_id":"003f4759-e069-41a3-b2a5-b6a1e2628d3f","resolution":{"observed_at":"2026-08-06T19:57:44.461260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-07-06T17:55:44.838732Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-06T19:57:44.494978Z","title":"D., and Potts, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.494978Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:ffbe0fab1591e0a7c1f97e40bc280717774ae72ac6d9ee0a73fe11fd6cf3699d","observation_id":"a418dee3-7334-447b-b896-45a9f0069e5e","resolution":{"observed_at":"2026-08-06T19:57:44.494978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-06T19:57:44.540195Z","title":"Y., and Poovendran, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.540195Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:630b5d07eab520fcff720a29220c5b04a1a5282e270acbb3707f8f4d42afe32d","observation_id":"6063ade9-b576-467b-acb4-3cb2196d7f7e","resolution":{"observed_at":"2026-08-06T19:57:44.540195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01563","last_updated":"2024-10-31T02:04:53Z","snapshot_observed_at":"2026-08-02T15:06:52.727609Z","submitted_at":"2024-06-03T17:45:41Z","title":"LoFiT: Localized Fine-tuning on LLM Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01563","snapshot_observed_at":"2026-08-06T19:57:44.575405Z","title":"Lofit: Localized fine-tuning on llm representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.575405Z"},"links":{"cited_paper":"/paper/2406.01563","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:88b2a954fa8d1cc0a7e6debc61625dfe3ddb7a30c069328cf8cc6a4ea8cbbffb","observation_id":"59991026-be87-47d5-9ec8-ebff5c8296be","resolution":{"observed_at":"2026-08-06T19:57:44.575405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:45.571826Z","title":"Scope: Scalable and adaptive evaluation of misguided safety refusal in llms","venue":null,"work_id":"fbc4d08b-a704-4793-b181-ee44a41d8d95","year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.646800Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:b88d7778a992befb253d44d968b94cb78f75dbc36addbb858eade92d266a0df1","observation_id":"2da464bd-d208-4966-a920-d39ebb5d9d92","resolution":{"observed_at":"2026-08-06T19:57:45.642516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13820","last_updated":"2024-12-17T02:35:30Z","snapshot_observed_at":"2026-07-06T18:18:03.254618Z","submitted_at":"2024-05-22T16:51:07Z","title":"Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13820","snapshot_observed_at":"2026-08-06T19:57:44.683011Z","title":"Towards comprehensive and efficient post safety alignment of large language models via safety patching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.683011Z"},"links":{"cited_paper":"/paper/2405.13820","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:792c4edf72941493d1c5f20125b20ebd11c20fb2bb62f2655d05130baa24e720","observation_id":"53efe874-0171-43da-9d23-0d106ff907c2","resolution":{"observed_at":"2026-08-06T19:57:44.683011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-06T19:57:44.717885Z","title":"Prompt-driven llm safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.717885Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:396c320b18c6a8b5729729a53b3ce273301fecde2d230c0bc5dcafbd4c35a983","observation_id":"36cde0a9-52cb-47df-8885-9a0c480d83cd","resolution":{"observed_at":"2026-08-06T19:57:44.717885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.785662Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.785662Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:fb747063108888e5a3f5f0cdda08147d54f540345afa3f4c799dd2be40cd6292","observation_id":"656ec8c5-a639-4a8d-8595-528d21bac811","resolution":{"observed_at":"2026-08-06T19:57:44.785662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-06T19:57:44.836509Z","title":"Representation engineering: A top-down approach to ai transparency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.836509Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:30abb604f6e49c06fcf2f2b2502f3bc8b3832e7000a9149752e1a6c1eb3a12f1","observation_id":"5fe881a2-87c0-421d-929c-8c8ad971607a","resolution":{"observed_at":"2026-08-06T19:57:44.836509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:57:44.883812Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.883812Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:7682179408068c0b0ac1a6e709b20b97ba0e5f816f789232197d278d2ae8b225","observation_id":"af12dd0b-7f73-46b2-b5eb-5f4f0ab62693","resolution":{"observed_at":"2026-08-06T19:57:44.883812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:57:44.976131Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.976131Z"},"links":{"citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:261095a7a00e5c6c1964ecd478d7d509267af9bcb3ec1645002dc6272332f454","observation_id":"e505e4b7-5dbd-4cf7-9021-f49fb8640126","resolution":{"observed_at":"2026-08-06T19:57:44.976131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 6 inbound Pith citation observations for arXiv:2507.04250."}