{"as_of":"2026-08-16T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6332ac7b143a0bb609351c283dd0184d675c9ad6e7d45ee5a142134346caf752","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:52:47.572246Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19980/citation-record","integrity":"/paper/2508.19980/integrity","json":"/paper/2508.19980/citation-record.json","paper":"/paper/2508.19980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:48.489565Z","title":"Prompt leakage effect and mitigation strategies for multi-turn LLM ap- plications","venue":null,"work_id":"1a403fe8-c691-4ccb-b9c9-75d847f552c4","year":2024},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.399495Z"},"links":{"citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:e84eb9e1fec2c40ba5ffa2235722f96a77ea7ef0d822c3462a7e14ab13e891e2","observation_id":"f42fe708-dd30-4539-80ac-723e359d7cb4","resolution":{"observed_at":"2026-08-15T16:52:48.495442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T16:52:47.411807Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.411807Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:1457a6ff585fd06f740c62f22505df5847af1a8b31878e4bd30e297a28ee4036","observation_id":"2e0e3fe2-f9c5-4427-930f-18edc4e2f26c","resolution":{"observed_at":"2026-08-15T16:52:47.411807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-15T11:48:26.826304Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-15T16:52:47.432140Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.432140Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:8c081fe9e108c0f56902444641430a8ec2a68a85937110dd7ab2883b2383faa0","observation_id":"6669c185-6eed-49d6-8c25-434a3bc8cafb","resolution":{"observed_at":"2026-08-15T16:52:47.432140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-14T04:22:20.981738Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-15T16:52:47.443369Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.443369Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:5e3a160fd1e2da2fd28c7b7eea800d27f79c1206688def901d893589083b0a4d","observation_id":"1648d5bb-b74f-45b2-a6d9-bea32523d993","resolution":{"observed_at":"2026-08-15T16:52:47.443369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T16:52:47.448604Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.448604Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:f89d340e90eedbca70b5dd52db9fd9a3f0effad0a9d40e00a94cc7abf8486272","observation_id":"96214bf6-1ba4-4227-b11d-cb9418ba1322","resolution":{"observed_at":"2026-08-15T16:52:47.448604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T16:52:47.455685Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.455685Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:f50220a05f7a0d7bb64d4d995493a3dc3aab50545626c6296c68847ffeac5f9b","observation_id":"8f73a527-36f8-4945-900e-21f1b8fb4fc0","resolution":{"observed_at":"2026-08-15T16:52:47.455685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-15T16:52:47.461071Z","title":"Llama guard: Llm- based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.461071Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:ff4bbe8b8409daedf2918dadaefc5910ccdd1b893f8e433d619be2f1ac234414","observation_id":"c758c7d7-f648-4164-b243-fede705e2b77","resolution":{"observed_at":"2026-08-15T16:52:47.461071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:47.467250Z","title":"Safety pretraining: Toward the next generation of safe ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.467250Z"},"links":{"citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:51313b4afe274415fcf3d418271568fe6be403a964946e7adbd665084d189d37","observation_id":"a71410a8-08ee-4239-b6c5-5d7cd5c2f155","resolution":{"observed_at":"2026-08-15T16:52:47.467250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-15T16:52:47.472824Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.472824Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:ede0f0930eeb3ec203909ea68fe50810cabe2865b1866fe196efc2321b6d45b9","observation_id":"75a303ba-dd04-419d-bd9a-39f6c3661454","resolution":{"observed_at":"2026-08-15T16:52:47.472824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04235","last_updated":"2024-03-08T17:04:49Z","snapshot_observed_at":"2026-08-16T14:45:44.717791Z","submitted_at":"2023-11-06T08:50:29Z","title":"Can LLMs Follow Simple Rules?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04235","snapshot_observed_at":"2026-08-15T16:52:47.477922Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.477922Z"},"links":{"cited_paper":"/paper/2311.04235","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:358d137ab8b9e320f0944e2762ff1c2246adaf9661f175c3df1d0811091737c3","observation_id":"a3e913d6-27af-4af8-a544-46b7653a9ca4","resolution":{"observed_at":"2026-08-15T16:52:47.477922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12197","last_updated":"2025-02-15T18:10:45Z","snapshot_observed_at":"2026-08-16T12:58:06.877925Z","submitted_at":"2025-02-15T18:10:45Z","title":"A Closer Look at System Prompt Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12197","snapshot_observed_at":"2026-08-15T16:52:47.483616Z","title":"A closer look at system prompt robustness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.483616Z"},"links":{"cited_paper":"/paper/2502.12197","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:e5ba52a89ce02c74504452ab0661f59dde6484c637c82211773f73dcddd09882","observation_id":"36dc7f6c-2c5f-4a6f-8fd9-cb615e8658c4","resolution":{"observed_at":"2026-08-15T16:52:47.483616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-15T16:52:47.493891Z","title":"Smoothllm: Defending large language models against jailbreaking attacks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.493891Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:44bc8280bd46fbaabe771c552aca44b3aa9edb0b6f032d527eec252ecd230530","observation_id":"0a7f098c-9bc3-4288-9c08-67444ce3c695","resolution":{"observed_at":"2026-08-15T16:52:47.493891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13691","last_updated":"2024-11-09T20:00:07Z","snapshot_observed_at":"2026-08-16T13:08:21.278429Z","submitted_at":"2024-10-17T15:55:36Z","title":"Jailbreaking LLM-Controlled Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13691","snapshot_observed_at":"2026-08-15T16:52:47.498632Z","title":"Jailbreaking llm-controlled robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.498632Z"},"links":{"cited_paper":"/paper/2410.13691","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:e2c997b4e5bfd352df2d3cd3eeb06ccada01a928e43ba662766c98e86a6e2f27","observation_id":"98454188-99f4-4c45-9a2c-f51f54524fb9","resolution":{"observed_at":"2026-08-15T16:52:47.498632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:47.503742Z","title":"Predicting the performance of black-box llms through self-queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.503742Z"},"links":{"citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:73bde828c2c1a01ebe0dabd3d13dcd40bf54e5233de8c5711579eb0a2e9a9930","observation_id":"2795196e-45e6-458d-8120-f39063b2c735","resolution":{"observed_at":"2026-08-15T16:52:47.503742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:47.509662Z","title":"Antidistillation sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.509662Z"},"links":{"citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:7e0c18801ecf5af759cea1b1f4cec112e7f2b46078953e9a393d1dccb35dd1f1","observation_id":"84c66cd3-aaeb-4702-9cf6-0ee28df97a34","resolution":{"observed_at":"2026-08-15T16:52:47.509662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-08-08T23:58:18.293467Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-15T16:52:47.514445Z","title":"Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.514445Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:b1911e57a4c5cf11506083c8963fe6470517faab97d11f561629bcb3e7dd8230","observation_id":"4c401e31-80fd-42d7-98a8-32896ec4d246","resolution":{"observed_at":"2026-08-15T16:52:47.514445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T16:52:47.519835Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.519835Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:b90c3c3398305a6cdb7301d5d8d4a9743f845b9cde470aa48b7b83725d8d47cb","observation_id":"47d29d1f-de95-49ea-acde-df0167319f14","resolution":{"observed_at":"2026-08-15T16:52:47.519835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08440","last_updated":"2024-10-17T07:00:19Z","snapshot_observed_at":"2026-08-16T13:35:06.363822Z","submitted_at":"2024-07-11T12:26:55Z","title":"Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08440","snapshot_observed_at":"2026-08-15T16:52:47.524750Z","title":"Beyond instruction following: Evaluat- ing inferential rule following of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.524750Z"},"links":{"cited_paper":"/paper/2407.08440","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:92b06a61fca483aeb3a32e3d8f1162876efa9596b35958119f7b207c3c708980","observation_id":"35815867-dbe3-4cb1-b11d-5136d5061d30","resolution":{"observed_at":"2026-08-15T16:52:47.524750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-11T23:45:02.178667Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-15T16:52:47.530344Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.530344Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:c7e4d438904976f765d3f7ad59a48cd4ef7e96f8aa7ed3e633d50b6f9a630b93","observation_id":"1f7fe58f-43e0-481c-8450-15a2d8b072f8","resolution":{"observed_at":"2026-08-15T16:52:47.530344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T16:52:47.535411Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.535411Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:3f41dcd327fd03e528f8138ad46753bafc56672954bd6688425f8f519d58c292","observation_id":"e94dfdbb-0546-42e0-9f77-aca3bab65642","resolution":{"observed_at":"2026-08-15T16:52:47.535411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18841","last_updated":"2025-01-31T01:20:44Z","snapshot_observed_at":"2026-08-13T21:17:14.276602Z","submitted_at":"2025-01-31T01:20:44Z","title":"Trading Inference-Time Compute for Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18841","snapshot_observed_at":"2026-08-15T16:52:47.541094Z","title":"Trading inference-time compute for adversarial robustness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.541094Z"},"links":{"cited_paper":"/paper/2501.18841","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:3fe783f86d7244089603b2e1058a2706121855f3019014809ac123f9f630366c","observation_id":"90908afd-a11e-436f-8dff-d9fc765213f3","resolution":{"observed_at":"2026-08-15T16:52:47.541094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14586","last_updated":"2024-09-22T20:28:40Z","snapshot_observed_at":"2026-08-16T19:42:47.340133Z","submitted_at":"2024-09-22T20:28:40Z","title":"Backtracking Improves Generation Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14586","snapshot_observed_at":"2026-08-15T16:52:47.546538Z","title":"Effective prompt extraction from language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.546538Z"},"links":{"cited_paper":"/paper/2409.14586","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:fed8a0f44eae97e1db5b9f9d8894443bb935f1655dd2ae084f638108ea93d0cf","observation_id":"d1a7b0b7-37ba-47da-9ea0-588d5c74fecd","resolution":{"observed_at":"2026-08-15T16:52:47.546538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T16:52:47.551289Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.551289Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:dbbc8a917e42c3f99b3532b29cdf14f73ce3d4b1d31bb2fa050d3d2b6212c769","observation_id":"bb9024e3-ba0c-4e5d-b643-bb0ff2c21409","resolution":{"observed_at":"2026-08-15T16:52:47.551289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07064","last_updated":"2024-12-19T19:16:27Z","snapshot_observed_at":"2026-08-16T14:53:15.831645Z","submitted_at":"2023-10-10T23:07:01Z","title":"Large Language Models can Learn Rules","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07064","snapshot_observed_at":"2026-08-15T16:52:47.556541Z","title":"Large language models can learn rules","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.556541Z"},"links":{"cited_paper":"/paper/2310.07064","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:6d002a28033f5f51134b40d66e1758e24d324d9e8eb50cc44c4cd3987e3aa0f4","observation_id":"1be5d31f-5cc8-4aea-94b0-27b1d288a608","resolution":{"observed_at":"2026-08-15T16:52:47.556541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-15T16:52:47.561700Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.561700Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:181b7d73469c750440b70a2bcad128807f6948beff97ea6a7a9e2e28d1f7068c","observation_id":"68b5ed83-e030-443a-99be-4129d2ea2b33","resolution":{"observed_at":"2026-08-15T16:52:47.561700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:48.442483Z","title":"Rating: [[rating]]","venue":null,"work_id":"c2e22479-c0cc-4ec4-809b-9a751c71b9df","year":2024},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.572246Z"},"links":{"citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:b1209d5f0322cb143c7922308e30861728918a7870c690dd63b2ddf892169a46","observation_id":"add381a1-d232-4eea-96cb-6a2a6f52daf3","resolution":{"observed_at":"2026-08-15T16:52:48.451568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:48.464008Z","title":"However, we focus on cases where we do not have knowledge of the specialized target string","venue":null,"work_id":"77978821-6648-4cc1-9254-5b8aa127b3f9","year":2023},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.566252Z"},"links":{"citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:6746ac687f3b79a8bbe086b96c945d8afe8ae7b3b019ee965c6e41a626119904","observation_id":"9963bfef-e6de-4133-819e-e0164ac93a29","resolution":{"observed_at":"2026-08-15T16:52:48.470341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-15T16:52:47.419836Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.419836Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:5ac9a2e67110ab5e8fa4c45cb3e1137e94b84c9fcf6eddfd27062662eb9d1705","observation_id":"dcb888b3-01ac-4a48-af50-5c066515b242","resolution":{"observed_at":"2026-08-15T16:52:47.419836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-16T13:44:42.428829Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-15T16:52:47.488631Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.488631Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:791aab52b2ab4cb86269c33e73c1d03244ef9d09efa96f9ae8b06a18598582d3","observation_id":"bce381b0-ab56-4b71-8529-27ee8027dfce","resolution":{"observed_at":"2026-08-15T16:52:47.488631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-15T16:52:47.426749Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.426749Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:4c279eef05c910377aa249ea785c1209335c0eed738b4574d9c2d1c75e846081","observation_id":"1595a515-9db7-48a2-bbe1-426554394451","resolution":{"observed_at":"2026-08-15T16:52:47.426749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-15T16:52:47.406169Z","title":"doi: 10.18653/v1/2024.emnlp-industry.94","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.406169Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:e159f122225de2814c5e9f6a8664c16c2792329b215d5d9d64512547655f52a0","observation_id":"572586c9-8a08-469f-8814-8ada343975f8","resolution":{"observed_at":"2026-08-15T16:52:47.406169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19550","last_updated":"2024-05-29T22:26:26Z","snapshot_observed_at":"2026-08-16T13:47:59.959330Z","submitted_at":"2024-05-29T22:26:26Z","title":"Stress-Testing Capability Elicitation With Password-Locked Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19550","snapshot_observed_at":"2026-08-15T16:52:47.437872Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:47.437872Z"},"links":{"cited_paper":"/paper/2405.19550","citing_paper":"/paper/2508.19980"},"observation_digest":"sha256:6c3a55775db3626c19058121504213d782acb7ccedb3a86ef468221de590765a","observation_id":"d8400fb9-4462-45b1-9ed0-8d82afcc5b6f","resolution":{"observed_at":"2026-08-15T16:52:47.437872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19980","last_updated":"2025-08-27T15:39:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T05:21:01.806719Z","submitted_at":"2025-08-27T15:39:46Z","title":"Evaluating Language Model Reasoning about Confidential Information"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2508.19980."}