Pith. sign in

Paper Citation Record · LEDGER

Does More Inference-Time Compute Really Help Robustness?

As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.15974.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.15974 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:26:22.907922Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-21T02:32:49.034790Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 9982772f-ef9e-4a0b-a257-3c77f1f215de · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Does More Inference-Time Compute Really Help Robustness? Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.829032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.829032Z digest=sha256:a385d005feb1805fb6a5aa18a615fbf50320904cd8d0e5ffc17b614dda66189c

Observation 9cb1b559-ab18-4b7b-9095-be7da16f85f2 · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Does More Inference-Time Compute Really Help Robustness? Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.051022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.051022Z digest=sha256:98851f2cbcdd7c66e1b57c3cc1277e02d1678520252448639cb6e97ab5096b97

Observation 8841390c-91ff-4d0e-a924-f0ef47f607be · outbound

This paper cites ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving.

Does More Inference-Time Compute Really Help Robustness? ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.117161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.117161Z digest=sha256:33c2ef27df4c942e27be7ac5f98a9eb44c0be3e65427003fff2736e9417d383c

Observation 8417ebd9-59b6-4aa6-b8fa-646522081d01 · outbound

This paper cites org/abs/2506.15674.

Does More Inference-Time Compute Really Help Robustness? org/abs/2506.15674

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.188675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.188675Z digest=sha256:e82b881f997d870c2f9c81bdf53f8ed2345aa79ebaf34d94e93e8c59f988d45a

Observation ce9ddaa7-5fae-4fa2-824c-2542d8430729 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Does More Inference-Time Compute Really Help Robustness? DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.346907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.346907Z digest=sha256:6a03fa2d97b21e67fc3573831d492fbd6216fa5657b50c342320a915e36ab22e

Observation a75f6f51-0fb7-481f-8422-f5fe79d0a145 · outbound

This paper cites OpenAI o1 System Card.

Does More Inference-Time Compute Really Help Robustness? OpenAI o1 System Card

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.417484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.417484Z digest=sha256:b689ca57eaaf4b38a20ac5578fdb347068ea4b7db53b09cadbcf0e5cbcdae293

Observation 785f0dd7-84af-428d-90f6-45692600b60a · outbound

This paper cites SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities.

Does More Inference-Time Compute Really Help Robustness? SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.476585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.476585Z digest=sha256:962c3efb6c344af9e7ff4e9d8fdee72655a50909c477fb1c74ac39dfbe1e22ae

Observation 5d37befe-25be-47b2-9984-2d4825deed40 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

Does More Inference-Time Compute Really Help Robustness? Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.542266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.542266Z digest=sha256:48873a86e795037251c935d56cc9580da971703a756250316afbb3beedb54b8f

Observation 190ac5e0-6c50-4b7e-b6b9-841f8408844a · outbound

This paper cites H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking.

Does More Inference-Time Compute Really Help Robustness? H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.640185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.640185Z digest=sha256:ee75ff321791a40f2b503a08ee85bdee5ff17ae4be89e722e832c0c8e48be244

Observation 6bb401ba-6a7d-4b8e-9227-e3c5f6ffbc8d · outbound

This paper cites START: Self-taught Reasoner with Tools.

Does More Inference-Time Compute Really Help Robustness? START: Self-taught Reasoner with Tools

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.726516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.726516Z digest=sha256:8f4e1b707d0fdcdbeb25cc2c9a090c3d3958d82a32a66f39f84ec6ec146c0818

Observation 95143e5e-7b84-4c41-a28c-302303f4f8ca · outbound

This paper cites Deepseek-r1 thoughtology: Let’s think about llm reasoning.

Does More Inference-Time Compute Really Help Robustness? Deepseek-r1 thoughtology: Let’s think about llm reasoning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.812119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.812119Z digest=sha256:b4d23993fedd46c56544c8f80ff80cce70dd5f74951e83e1fb17fe759b6b3ca8

Observation dabc4faf-01cc-42a2-a2a3-0011ce77004e · outbound

This paper cites SaRO: Enhancing LLM Safety through Reasoning-based Alignment.

Does More Inference-Time Compute Really Help Robustness? SaRO: Enhancing LLM Safety through Reasoning-based Alignment

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.968631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.968631Z digest=sha256:4bad55fd11bcd7dffb0e8b0c0a63802a3323ecf6d9a05661528f04875109c4f4

Observation 47269b30-f004-490a-a72c-d33a882633a6 · outbound

This paper cites s1: Simple test-time scaling.

Does More Inference-Time Compute Really Help Robustness? s1: Simple test-time scaling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.053444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.053444Z digest=sha256:50b7ba5d1524bd02c79fca44172c0d3f761664547a71a36fe80d5d7631456fd6

Observation ed13eb12-23ff-46ad-8414-828b4f8a9d4e · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

Does More Inference-Time Compute Really Help Robustness? Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.122575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.122575Z digest=sha256:4ff50154650f3e8aef04af16a955e8e87019c47d55494a974d7daeefcd1c68f0

Observation c93cf7cc-4420-49af-a43e-3dc3d2457b82 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

Does More Inference-Time Compute Really Help Robustness? R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.218421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.218421Z digest=sha256:62904cac945fcd38861ea0649ddad4e50e21ab7e8e6c916ff0a5973db81f40cf

Observation 41bb8317-881a-4f74-93a2-718796aefabe · outbound

This paper cites The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions.

Does More Inference-Time Compute Really Help Robustness? The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.270522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.270522Z digest=sha256:7a7e1053576dd30ad27017610b52a19cbdda4d8b09e0ef08a8d27476e422ca4f

Observation c2fb6f89-a64b-4de4-8f05-950781929a9e · outbound

This paper cites Safety in Large Reasoning Models: A Survey.

Does More Inference-Time Compute Really Help Robustness? Safety in Large Reasoning Models: A Survey

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.358800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.358800Z digest=sha256:d9ebbb3e1fbb7c280b38579214a60856f1c8bba92acaec3cf390f6c2ec190589

Observation 157d35bb-6d66-4e12-92df-7ea7156ebf16 · outbound

This paper cites Star-1: Safer alignment of reasoning llms with 1k data.

Does More Inference-Time Compute Really Help Robustness? Star-1: Safer alignment of reasoning llms with 1k data

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.479404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.479404Z digest=sha256:f0815a11038e4cbb905de09f4e1c3fd95604ae84b092d6941db758372f46c880

Observation c7898956-3875-476d-9020-8fd8c11592cb · outbound

This paper cites Effectively Controlling Reasoning Models through Thinking Intervention.

Does More Inference-Time Compute Really Help Robustness? Effectively Controlling Reasoning Models through Thinking Intervention

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.597162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.597162Z digest=sha256:5798d40b57c5ce2c2ebe7b74ba8d4ac39623503c078f99ad6411f7255fbc0aab

Observation 402c6651-5ef4-42f9-9eaa-dfbd928f89b0 · outbound

This paper cites Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models.

Does More Inference-Time Compute Really Help Robustness? Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.750058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.750058Z digest=sha256:c096a8af551296506503545b999e17a5345d94b726fa3b20368b989ee080ddd9

Observation 333ca84c-6509-48c8-a1da-bbe269f53930 · outbound

This paper cites SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.

Does More Inference-Time Compute Really Help Robustness? SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.912851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.912851Z digest=sha256:6a0e979364d5bd6ed1a9c622154d8806642cfa5037bd9c21736419c0a807ca1a

Observation 16badb67-6dc0-4516-99f2-d6926619ca6a · outbound

This paper cites Qwen3 Technical Report.

Does More Inference-Time Compute Really Help Robustness? Qwen3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.109737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.109737Z digest=sha256:491b4522be2ce1037dbab9a6d33db63d04dd565db8795ee6e92ed546ff510404

Observation a9d9edf9-7a4c-42c1-a5b5-0a423b16bca3 · outbound

This paper cites A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos.

Does More Inference-Time Compute Really Help Robustness? A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.339685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.339685Z digest=sha256:47e4b80efe23a11c118b0dda96b64d2bb36c71d8e77a2622df5bc36102d089c7

Observation 8404eecd-d58e-467f-ad4d-29ee522e8a54 · outbound

This paper cites Trading Inference-Time Compute for Adversarial Robustness.

Does More Inference-Time Compute Really Help Robustness? Trading Inference-Time Compute for Adversarial Robustness

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.432003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.432003Z digest=sha256:4d314650a962bb6241b39e5e89db1d1d9e5dcf0e2121ef68a09833c41f622366

Observation 14fa33a6-25c9-4749-b8f2-378c165ee02b · outbound

This paper cites RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability.

Does More Inference-Time Compute Really Help Robustness? RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.599759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.599759Z digest=sha256:bd0a165b1befc7f84341ee4fb5ff3ca0212c773fb84000929a765eda902ed40d

Observation 4a9fc1eb-2807-4103-96d4-9595684e0300 · outbound

This paper cites Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models.

Does More Inference-Time Compute Really Help Robustness? Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.673177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.673177Z digest=sha256:a630d94cd89de93f7015653f54b6c2cd0ac3d045b1c4248ef17a8a9a3bba26b9

Observation 1d5034c9-425f-4991-a90b-d3e295c21f02 · outbound

This paper cites The hidden risks of large reasoning models: A safety assessment of r1.

Does More Inference-Time Compute Really Help Robustness? The hidden risks of large reasoning models: A safety assessment of r1

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.727553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.727553Z digest=sha256:ed9d703385f30a1d18022240114afc42aea9488edf20e592f53b9e76f7897057

Observation 5436148c-4927-40f6-891f-611ab62ed35c · outbound

This paper cites 13 Preprint.

Does More Inference-Time Compute Really Help Robustness? 13 Preprint

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:26:24.220754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T15:26:22.800518Z digest=sha256:7624bd6b1048093463f848f5efee06f0715dbdc29050852fbdc1fb8521c82e55

Observation 819db80c-6f7a-41c8-95cc-43838aab726f · outbound

This paper cites The main instruction, associated data, low-priority query, and witness are shown.

Does More Inference-Time Compute Really Help Robustness? The main instruction, associated data, low-priority query, and witness are shown

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:26:24.205877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T15:26:22.856307Z digest=sha256:cfc7a87d60e78eb3169cbd5bcb6e1987fc21cea50cad3e7cde723df8e808c4df

Observation af8b48a9-fb0f-4028-879f-2730257b0277 · outbound

This paper cites The system instruction and malicious user prompt are shown.

Does More Inference-Time Compute Really Help Robustness? The system instruction and malicious user prompt are shown

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:26:24.190719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T15:26:22.907922Z digest=sha256:2ccfd9353a5f48506f5f890a03304965dccee23e50ad59b705793129df66f416

Observation 9d527b4d-6f21-4db1-ba27-14c2408157a1 · outbound

This paper cites Theoretical guarantees on the best-of-n alignment policy.

Does More Inference-Time Compute Really Help Robustness? Theoretical guarantees on the best-of-n alignment policy

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.894110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.894110Z digest=sha256:3e1bb2ca9de5e19343f762bbca1030babe8481fae4ac60eb163783fb8490d703

Observation 30e9e55d-4c40-43f6-9cfd-cc8d56e62fdf · outbound

This paper cites ISBN 9798400702600.

Does More Inference-Time Compute Really Help Robustness? ISBN 9798400702600

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.262437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.262437Z digest=sha256:79a87171a8ff2bc1bf88f705bf9bf33e930b8da90fb13c05d8c19297c6d2bffe

Observation 0b2d3b75-6674-4780-b91a-a1ebd25c0e05 · outbound

This paper cites Large Language Monkeys: Scaling Inference Compute with Repeated Sampling.

Does More Inference-Time Compute Really Help Robustness? Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.981630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.981630Z digest=sha256:5837a490a663cabdf084f02c4781b5922912075b65b4a40d317abeff7a8927e8

Observation 8868e2aa-1fe6-41e6-8068-78143ef4ebae · outbound

This paper cites Phi-4-reasoning Technical Report.

Does More Inference-Time Compute Really Help Robustness? Phi-4-reasoning Technical Report

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.738283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.738283Z digest=sha256:0dc5476c67e90b16f5b59ddfdbe3e9fe6c1e8f0e60428b7f81de3cbb2fe13171

Pith citing papers

Observation 026b3643-7260-481c-8717-988f3de28d2c · inbound

Adaptive Probe-based Steering for Robust LLM Jailbreaking cites this paper.

Adaptive Probe-based Steering for Robust LLM Jailbreaking Does More Inference-Time Compute Really Help Robustness?

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-21T02:33:54.907156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-21T02:32:49.034790Z digest=sha256:ff2a1a03dfcbc533c5edc4900ca44777a4d23ec5e5fe16b523f489b0bb7fb49c