Pith. sign in

Paper Citation Record · LEDGER

MetaSC: Test-Time Safety Specification Optimization for Language Models

As of 9 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 2 inbound Pith citation observations for arXiv:2502.07985.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.07985 v2

Coverage vector

measured 17 of 17 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T11:15:45.016767Z

measured 19 of 19 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-01T08:17:10.481202Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

17 of 17 outbound references displayed

  • verified exact1
  • verified fuzzy3
  • unresolved13
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 2022d310-a28d-4ce0-8134-f1ba8f434780 · outbound

This paper cites Deliberative Alignment: Reasoning Enables Safer Language Models.

MetaSC: Test-Time Safety Specification Optimization for Language Models Deliberative Alignment: Reasoning Enables Safer Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.972604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.972604Z digest=sha256:02dd5a6a523a2f260b44f550d3b087d48db98f1909746b166594530d0291151d

Observation 599b5898-dc2b-4146-843a-b5fcd295d9aa · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

MetaSC: Test-Time Safety Specification Optimization for Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.977046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.977046Z digest=sha256:6b9a25a1bac331bacbe94c2089a3820663a718e64c5bbbd2176fa11acb487841

Observation d282f1f9-1687-410f-9a03-37dda913f7c1 · outbound

This paper cites The Llama 3 Herd of Models.

MetaSC: Test-Time Safety Specification Optimization for Language Models The Llama 3 Herd of Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.984746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.984746Z digest=sha256:046add02995d8ce3df8ca5b537dd5d0e31562a446ea2c7d07b478bd22a8a3637

Observation 2e7d7c88-ac9b-42c2-9fa1-c29ab2ee356b · outbound

This paper cites Fight Back Against Jailbreaking via Prompt Adversarial Tuning.

MetaSC: Test-Time Safety Specification Optimization for Language Models Fight Back Against Jailbreaking via Prompt Adversarial Tuning

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-08-08T11:15:45.087589Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T11:15:44.988029Z digest=sha256:49896754d374a85964a6e610a1dc5b6d564e616702a943eb5faa4e3cee88d801

Observation 4b5db248-9976-4374-b751-22a3d133c73a · outbound

This paper cites SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks.

MetaSC: Test-Time Safety Specification Optimization for Language Models SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.990935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.990935Z digest=sha256:dcac92ed1b4e18055c78106fc6372ce4265dee226baa6bc7db0e7d4cda067b4c

Observation ec7ad2e0-4ac6-4a6c-9c60-59326b626e3b · outbound

This paper cites ” do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models.

MetaSC: Test-Time Safety Specification Optimization for Language Models ” do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T11:15:45.184439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T11:15:44.994573Z digest=sha256:60649201ac1b0afbbca25f87a823ade46f2f975b6fd2aa8e001f26d3867811e3

Observation 169c8b7a-e174-4a73-a2ab-c6fe5b378ac2 · outbound

This paper cites Noah Shinn, Federico Cassano, Ashwin Gopinath, Karthik Narasimhan, and Shunyu Yao.

MetaSC: Test-Time Safety Specification Optimization for Language Models Noah Shinn, Federico Cassano, Ashwin Gopinath, Karthik Narasimhan, and Shunyu Yao

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T11:15:45.172974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T11:15:44.998969Z digest=sha256:fec6053cf3e6520f285a7b10863e7cffdd06773674ad7cc2d04874d228d2b227

Observation d99bd8a6-60a0-4f3d-ae45-01b02d561c2a · outbound

This paper cites The ART of LLM Refinement: Ask, Refine, and Trust.

MetaSC: Test-Time Safety Specification Optimization for Language Models The ART of LLM Refinement: Ask, Refine, and Trust

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:45.002434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:45.002434Z digest=sha256:294434c0399ac8e86e982bad6198a3ea2ed1d3e5d63959cbf8f46e2b489bb0e3

Observation 2335f18c-ae00-4d3a-aa4c-0bb93ef66df7 · outbound

This paper cites Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate.

MetaSC: Test-Time Safety Specification Optimization for Language Models Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:45.006636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:45.006636Z digest=sha256:6e5b2dc4576613491d582b22200920780a1de481688e3ed7d0173df7cf6d633d

Observation e2a488f1-08c4-43a6-a2a4-94b88f78a080 · outbound

This paper cites Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations.

MetaSC: Test-Time Safety Specification Optimization for Language Models Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:45.010325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:45.010325Z digest=sha256:c2cb0da2748be7306dec622edb7f7c6c626785cf292d859dab085a0213d09f1b

Observation 8f65bae9-4b97-4834-8339-ca1575789c22 · outbound

This paper cites From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks.

MetaSC: Test-Time Safety Specification Optimization for Language Models From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:45.013448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:45.013448Z digest=sha256:4a126500c968dec37f25839b01960d5152e3cfc556fe2d0283ea73860a6579bc

Observation 61923c79-eda0-4f66-ace6-2420611a4b4f · outbound

This paper cites t spect 0 Safety and harmless.

MetaSC: Test-Time Safety Specification Optimization for Language Models t spect 0 Safety and harmless

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T11:15:45.163848Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T11:15:45.016767Z digest=sha256:fe4e34d2ce7ec486205b899051f43ef8b281ab1160c077474a25879bafb6f104

Observation 8d0a213c-c91b-4670-93f4-8d7e9cdff5f3 · outbound

This paper cites Configurable Safety Tuning of Language Models with Synthetic Preference Data.

MetaSC: Test-Time Safety Specification Optimization for Language Models Configurable Safety Tuning of Language Models with Synthetic Preference Data

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.963870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.963870Z digest=sha256:3003a888a0ad5fe2eac680db1d39dd3019badcd7c2e0c0fc455ee55479b4d432

Observation 35a6b2f9-8d39-4f06-adff-8953b346837d · outbound

This paper cites Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding.

MetaSC: Test-Time Safety Specification Optimization for Language Models Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.960566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.960566Z digest=sha256:dac0f2072b3704216c2fb4110db3ed7a9c20d608b02a31e75ce2597db1f615e3

Observation 87375eb2-47a2-4606-a742-5d48d49c85f9 · outbound

This paper cites A Survey on LLM-as-a-Judge.

MetaSC: Test-Time Safety Specification Optimization for Language Models A Survey on LLM-as-a-Judge

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.968673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.968673Z digest=sha256:f8c6a966b8ced60e08c1e879cfb0d4820d38b1c53731269513c579cb6f66aa09

Observation fbc5c325-868a-42c1-87dc-236572a5aafb · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

MetaSC: Test-Time Safety Specification Optimization for Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.956043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.956043Z digest=sha256:eab89394e8970f3d1af841ab834ed2cf7362a1ea473b16657cfbe375a3eece00

Observation edf4a044-44f1-432b-a217-65ca0d19f1f8 · outbound

This paper cites The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models.

MetaSC: Test-Time Safety Specification Optimization for Language Models The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-08T11:15:44.981245Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:15:44.981245Z digest=sha256:d3d0e1857a55d386e183f43addbfe16796c767f4882121a4fd07aa889472040b

Pith citing papers

Observation 3fd0c1e7-a6d4-41c3-87cf-042ecdf831cb · inbound

Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models cites this paper.

Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models MetaSC: Test-Time Safety Specification Optimization for Language Models

Reference 194

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:41:23.482650Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T08:40:40.910461Z digest=sha256:cb7cff66ffbda201ac456dbf39e60bb876531a1ffc3fa417c91fb9784d1fcc53

Observation ba2fea89-06d9-46f3-aa23-ece80465df79 · inbound

Prompt Governance? On Governing Technologies Governed by Natural Language cites this paper.

Prompt Governance? On Governing Technologies Governed by Natural Language MetaSC: Test-Time Safety Specification Optimization for Language Models

Reference 107

Resolution
verified exact
arxiv_id, observed 2026-07-01T08:25:32.875448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-01T08:17:10.481202Z digest=sha256:14db78b85d3f7de8bd2431991f168d45856bf941c8cf9a947123c96b480722c5