{"as_of":"2026-08-04T22:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adb08ce56da6687d7df530195c14d8b8600cab32a7494132c858494020c265d2","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T20:40:44.496392Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:47:40.850633Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20697","snapshot_observed_at":"2026-08-03T09:47:40.850633Z","title":"Token buncher: Shielding llms from harmful reinforcement learning fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12641","last_updated":"2026-01-19T01:10:49Z","snapshot_observed_at":"2026-08-04T14:40:51.803613Z","submitted_at":"2026-01-19T01:10:49Z","title":"STEP-LLM: Generating CAD STEP Models from Natural Language with Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:47:40.850633Z"},"links":{"cited_paper":"/paper/2508.20697","citing_paper":"/paper/2601.12641"},"observation_digest":"sha256:53bd2fa56ac8fb31c541bc980c4ff5089087f42ea1d5429f4215a12c7c155de4","observation_id":"56531e6d-07da-4ead-9e20-e68dd9cdbca4","resolution":{"observed_at":"2026-08-03T09:47:40.850633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20697","snapshot_observed_at":"2026-08-02T05:32:27.018224Z","title":"Token buncher: Shielding llms from harmful reinforcement learning fine-tuning.arXiv preprint arXiv:2508.20697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13336","last_updated":"2026-07-14T23:50:57Z","snapshot_observed_at":"2026-08-04T17:00:35.224060Z","submitted_at":"2026-07-14T23:50:57Z","title":"Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:32:27.018224Z"},"links":{"cited_paper":"/paper/2508.20697","citing_paper":"/paper/2607.13336"},"observation_digest":"sha256:981b95fc92898ba2abf930e0448ff2d14e4eadfe54f41fbbcd00e01225efc5a0","observation_id":"19980134-ab0e-44b6-b484-fb663711537f","resolution":{"observed_at":"2026-08-02T05:32:27.018224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20697/citation-record","integrity":"/paper/2508.20697/integrity","json":"/paper/2508.20697/citation-record.json","paper":"/paper/2508.20697"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://aimodelplace.com","venue":null,"work_id":"cc2e9e79-300c-4d6f-b2ac-e11873ff7440","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:4b627fc2b05729ebbbf7a718b8971bbbf88aaf5b95a186b5781ca1c7e6826797","observation_id":"cbcf669b-aeaa-4456-b980-02db88afd7a1","resolution":{"observed_at":"2026-05-18T20:41:51.816342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://azure","venue":null,"work_id":"31faa5bf-7dff-4a16-a071-bb4929d98822","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:d2eb50fabe998579fc20255c72e6504f5858b1d84d410bf7d0162def1ba8dca3","observation_id":"33507515-4787-4a21-a406-8575b012b042","resolution":{"observed_at":"2026-05-18T20:41:51.804552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://docs.mistral.ai/ guides/finetuning","venue":null,"work_id":"8a5d87d8-510a-494b-9d09-d13d76299320","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:f824bab4ecaefda607a8bea3563a8b22b38d5a9da2a9a06c422a61c23c2e49e4","observation_id":"8dc8158f-2b44-4c4c-b849-37582792a725","resolution":{"observed_at":"2026-05-18T20:41:51.801243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://platform.openai","venue":null,"work_id":"f80f0aae-3249-4ac9-902c-4fda47304daf","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:9f9e507f70b7a58b30249737849ca7c1ce787a05b54849d950d58586f7b05ae6","observation_id":"b23dae5f-d799-4b24-8613-5fee64ab893c","resolution":{"observed_at":"2026-05-18T20:41:51.810102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Back to basics: Revisit- ing reinforce-style optimization for learning from hu- man feedback in llms","venue":null,"work_id":"f8d4f23e-15fc-4465-be9b-39d0368e0dce","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:bfe9723cc3450b00e7bbf48a766ed4689b6d3f0bc05fc902f1fa0923a9ca130e","observation_id":"c95e2633-bd5c-41f2-9494-810c8c22e0d7","resolution":{"observed_at":"2026-05-18T20:41:51.813359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:bdc351c85c6806fe7dfda99916cb244225c63ce6bf57392f6e949cf8444e0a34","observation_id":"e6496827-1d97-4ef7-94af-6722b0aef7a8","resolution":{"observed_at":"2026-05-18T20:41:50.579798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.17424","doi":"10.48550/arxiv.2502.17424","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Emergent Misalignment : Narrow finetuning can produce broadly misaligned LLMs , May 2025","venue":null,"work_id":"27d5f019-1fc8-47e4-bc86-3f09a2569685","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:ed68c18d57924c3f46309d818012cfc1eaef0e7d6e920464999ca9a4a85c7f90","observation_id":"9bf3e97b-c5ca-48fb-bb18-b0b3eb21c89f","resolution":{"observed_at":"2026-05-18T20:41:50.568847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:19.46989+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:19.46989+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04578","last_updated":"2025-05-07T17:18:48Z","snapshot_observed_at":"2026-07-06T21:20:26.707391Z","submitted_at":"2025-05-07T17:18:48Z","title":"Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization","version":1},"cited_work":{"arxiv_id":"2505.04578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04578","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fight fire with fire: Defending against malicious rl fine-tuning via reward neutralization","venue":null,"work_id":"c343a8af-984e-469e-bfd9-a4df168051cb","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2505.04578","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:15f42b22704faf52a11d0977bcd3116e24163fab6b7b8fff2083e4d2913ee5a6","observation_id":"b39c1cfc-5df7-48f7-ba0f-6270ee188807","resolution":{"observed_at":"2026-05-18T20:41:50.585345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:b3cd9d053d9a43fa18e702d2c6f0acd7206fd7cf5d43be59524af87dea3031fa","observation_id":"7d1b4d7a-7c71-4105-8913-838fc92e4dd8","resolution":{"observed_at":"2026-05-18T20:41:50.574144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":"a062fa09-1193-47fe-9384-45f9aaed22a4","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:f9e151dd2597f0e00f978bba3ae6d530a6c9ee92faa10ac778c843356bc2b511","observation_id":"aa6df22d-13db-409b-a2e9-a5cd3029cef0","resolution":{"observed_at":"2026-05-18T20:41:51.795068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:201974c37b7211b697cd460268bd4e93920bee22b282890c239dadcb0857f283","observation_id":"e841a53b-5459-4fd5-af5d-f38ebbb6d00a","resolution":{"observed_at":"2026-05-18T20:41:50.476245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:49d682be1092eeff0bd5e24e2b9a26b21240e7313dacbef345e802d56aaf469a","observation_id":"a9f8db7d-504a-43a1-9bdb-ce71abdf5af4","resolution":{"observed_at":"2026-05-18T20:41:50.441339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:33b692f9339a8fa705a8b13e53acccf85889a29590db075834aebe4b699dd9e6","observation_id":"65361d65-aaec-4531-8705-505252b33291","resolution":{"observed_at":"2026-05-18T20:41:50.510212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:9d2763fac0de31a808fbb0f1d0498ad53cbe9e9a49439e03b81a0750cb198b94","observation_id":"cb2c4024-9af5-4334-bc76-1f4e619dcbf1","resolution":{"observed_at":"2026-05-18T20:41:50.514961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00586","last_updated":"2024-11-30T21:02:06Z","snapshot_observed_at":"2026-07-06T19:59:33.383151Z","submitted_at":"2024-11-30T21:02:06Z","title":"Evaluating Large Language Models' Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects","version":1},"cited_work":{"arxiv_id":"2412.00586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00586","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating large language models’ capability to launch fully automated spear phishing campaigns: validated on human sub- jects","venue":null,"work_id":"18b92858-db9e-436d-a6fe-02775499ca85","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2412.00586","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:ab9ccfc3db0eaa29bc08cdbdef0c79af5ef6949a67ef28587e0c47e2bf355529","observation_id":"163d4f56-c02a-4c61-818d-1f09ad3605c7","resolution":{"observed_at":"2026-05-18T20:41:50.480709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:94d2b7f6da6f5a6311aebbc7bb4913121b123d746e35835534ec762730dd5c20","observation_id":"b5c9b00b-2192-4657-9226-53ab854bfdbd","resolution":{"observed_at":"2026-05-18T20:41:50.484933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2507.00432","doi":"10.48550/arxiv.2507.00432","metadata_source":"pith","pith_arxiv_id":"2507.00432","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","venue":"cs.AI","work_id":"5d347bac-2a53-443b-b727-d4ed3ea9be1a","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2507.00432","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:bbfde9eae54d1d8da39dd5918d145bd7746eb12823d125d0c012a31b0fa13f51","observation_id":"61d21b4b-e68e-428c-a8c5-434486be85d1","resolution":{"observed_at":"2026-05-19T01:01:10.910011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":"c114d0f8-a5b3-4693-b069-1c73885b49f4","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:ef9b7ab8502f32e1466851aaa025002ac701e0757084db68c27fc2fc01cf0f15","observation_id":"c7093cf9-f392-4893-a7e6-db6be39f89ce","resolution":{"observed_at":"2026-05-18T20:41:51.791695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01586","last_updated":"2025-03-17T17:17:16Z","snapshot_observed_at":"2026-07-06T19:09:32.189008Z","submitted_at":"2024-09-03T03:59:22Z","title":"Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation","version":4},"cited_work":{"arxiv_id":"2409.01586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01586","snapshot_observed_at":"2026-06-30T21:05:04.078784Z","title":"F., and Liu, L","venue":null,"work_id":"69d29cc3-19fc-41a7-acf3-dbf4cb347928","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2409.01586","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:b684e618dc63f53988630e1a97c0e581a194e10bee4e38206a7372662efe6adb","observation_id":"c3e88d80-0562-4312-a7f4-06d60523dc35","resolution":{"observed_at":"2026-05-18T20:41:50.562505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":"2409.18169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-07-02T20:47:22.903180Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","venue":"cs.CR","work_id":"82b91860-10b3-4645-9579-d1e36d698062","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:113c6264876fe2a5d1446ba9cbedefa6384c8fe6369ae618fdcdf9563c270ff3","observation_id":"be3bb60b-c2ad-466c-b6ca-33a30dfa1289","resolution":{"observed_at":"2026-05-18T20:41:50.545249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaccine: perturbation-aware alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":"68262b60-5ae6-4826-a196-75cb76c8d48c","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:4f2d744fe46cefe16151fc6abcccc24e56cb28810105ae6688ea460e23b56a4f","observation_id":"f1fe8e87-f756-4b44-9b84-58227455e566","resolution":{"observed_at":"2026-05-18T20:41:51.788422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2312.06674","doi":"10.3390/info16050365","metadata_source":"pith","pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":"cs.CL","work_id":"93844332-869b-448c-a1be-35466150b1b2","year":2023},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:49ed56e3b245aa3ef61447ed677ecbd3fe011281c863d7a9349dd4e505081ab0","observation_id":"6ade512d-1ab5-4802-8155-1fa8a76cc5a1","resolution":{"observed_at":"2026-05-18T20:41:50.489469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:2cf6834f7aa7c75bf974932bf41f0e80591fcbff390766598f3a04050c41f4ce","observation_id":"24d87b2b-060f-42af-b52c-3c5217a6942b","resolution":{"observed_at":"2026-05-18T20:41:50.471169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beavertails: towards im- proved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"fcb80866-2422-45bf-81c0-cb3a12622fca","year":2023},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:b5eba947812b2ab5c3d4a823ed3ef547a1d9f818d7b3ac33dd7f2e006bb02b99","observation_id":"49c8ef65-e8b9-43ef-932c-4243a563ffa5","resolution":{"observed_at":"2026-05-18T20:41:51.785308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:604149d876e45361ecb7db361ce7b33f05c60cb23802332343baebc1a06c2943","observation_id":"60bda896-ee7d-4477-8c00-57318043212f","resolution":{"observed_at":"2026-05-18T20:41:50.499299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:dd23bd8764de364edfffccee8b132d7c1d976a62ed609d99a2334c48334523ce","observation_id":"b9f2add8-82a1-40b4-ae54-e40684a089a7","resolution":{"observed_at":"2026-05-18T20:41:50.430368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The wmdp benchmark: Measuring and reducing malicious use with unlearning","venue":null,"work_id":"128ee3a3-1192-4457-93b7-ad2a8c736648","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:8a31f1cad1ad66e01d170c8a4242cb64753662bdf3a48b498e149d8c872f2765","observation_id":"6883b816-49f5-4464-a6c9-276fc6e4206e","resolution":{"observed_at":"2026-05-18T20:41:51.782259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09760","last_updated":"2025-01-31T14:26:27Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T07:36:45Z","title":"Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation","version":3},"cited_work":{"arxiv_id":"2410.09760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09760","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Targeted vaccine: Safety alignment for large language models against harmful fine-tuning via layer-wise perturbation","venue":null,"work_id":"c7d21ec6-f3fe-4afc-a2e0-8dab429f2ec0","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2410.09760","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:0fdecf406e959cf007b071b72750f57d6804593c663a257bab588027b2fd4571","observation_id":"45f09966-c506-4c95-a5c0-b781c742367d","resolution":{"observed_at":"2026-05-18T20:41:50.530339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:7cc1e47e0581bb03c936af9e21b5b4b4f5a473d85b4b8dd7fb138fc50e30ee98","observation_id":"55cc0bf5-2d45-4161-b7db-c60155982b52","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"0886c93b-e2e5-4a42-bc5f-b0fd6338ca86","year":2017},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:5a8ea9ba25e6d3c53d37804effe94c2085d4b7503b6d75457b47571651461a36","observation_id":"e6334bc5-3bbb-4e91-bd46-0a8d63c8220d","resolution":{"observed_at":"2026-05-18T20:41:51.779300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un ministral, des ministraux","venue":null,"work_id":"0481e5e1-a5f0-4267-b843-348e80df89ff","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:776ca9ca0447dfa9e44700e91043ac36bc6d7ce10933d442f7d57be5f70e7f66","observation_id":"3b7a4fdf-d085-4e0a-ac99-4764341e23f2","resolution":{"observed_at":"2026-05-18T20:41:51.776160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning can cripple foundation models; preserving features may be the solution","venue":null,"work_id":"47dd42d5-58ee-4cb0-9ba7-201de8b1b966","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:4b252475306ee14bbb57bab23d47853bfbf34b9ca4cf9b14b4fa324d85662f07","observation_id":"e2c8b70c-9cc5-4e1a-a0f3-b0cab435e8a4","resolution":{"observed_at":"2026-05-18T20:41:51.773114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"13050109-3662-40c0-b512-b67257a4d1c3","year":2022},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:5ab1d47591add3a2c954ba1fde8db09790c32e7b4bc6986661954137cb7a1433","observation_id":"00c4036d-2d3d-4577-a69f-a74226a4d56c","resolution":{"observed_at":"2026-05-18T20:41:51.769882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Countdown-tasks-3to4","venue":null,"work_id":"15d23d3e-b22c-46d8-b353-c23c46bdd252","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:0081478e41b69479248f01d21060d3e563e988a7a86edf493b2150f98ccb5949","observation_id":"f8cbdcad-17bc-43cb-8075-55af73b062d8","resolution":{"observed_at":"2026-05-18T20:41:51.766800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":"b055609a-bac9-4a4a-9412-f7e9d45aad87","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:77f1fcef617f2671ba2df0d5dcf5af2c4383d2f2db75f393ca44fbac870a3788","observation_id":"30fb28f4-b6de-4f7d-8189-32a852adecfb","resolution":{"observed_at":"2026-05-18T20:41:51.764101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth Interna- tional Conference on Learning Representations","venue":null,"work_id":"402d441e-00a1-4e76-b605-23adcabc23c3","year":2023},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:8b72d965a92875b092d8805c783d8ca6bddd3a6f49d3695109407f71adac24bf","observation_id":"35c5017b-9664-41c3-a937-03da373128a1","resolution":{"observed_at":"2026-05-18T20:41:51.760866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Di- rect preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"f616e1b1-6f48-43ad-bcc1-9f0b48da01af","year":2023},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:f3eb5f03abf65a3f626b3c7b72a1800d97150b800bbfe61022e3b2d4cb596090","observation_id":"cc34a03a-10cb-4647-81d0-de302cebbb82","resolution":{"observed_at":"2026-05-18T20:41:51.754783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defending against reverse preference attacks is difficult","venue":null,"work_id":"67c39bff-7732-4b18-be1f-d3e6a1cdc2de","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:83ecbd68d1c3c65ad46ce32f108787a06ef9c1e0f04d299c860903eac595e69d","observation_id":"50350f56-c460-4d6b-b4e4-e6100e1750ad","resolution":{"observed_at":"2026-05-18T20:41:51.751780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation noising: A defence mechanism against harmful finetuning","venue":null,"work_id":"812c5148-7fc5-432f-b67f-dc8a971b9aa4","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:bfe527b98114d9b7f3ed8de3cb993a80dcc1fd501d908b902c32b285a4690492","observation_id":"f097d195-ace5-468d-b8f7-644364ac6037","resolution":{"observed_at":"2026-05-18T20:41:51.748581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-11T03:57:46.887146Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:0e8fe3481ea72be07a0fb1c0a94147e9047cc3b47b119c9fc6348c83501fc922","observation_id":"936aaffd-bfa7-4ae1-befe-a0a7ca5ea665","resolution":{"observed_at":"2026-05-18T20:41:50.519877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:6ca459aa889a150b8a1177bb5bf1d0faeb594123dab87b520719ad8b965c9d75","observation_id":"37a756e1-b290-4205-8b92-781bd8f20f56","resolution":{"observed_at":"2026-05-18T20:41:50.424783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:faa019fcb92d7d68e65c4d5bba9c70c411b26237b1d1d69c1e016fe1b8d2b15d","observation_id":"879bb722-8c15-49c5-826b-ba3b59c8c46f","resolution":{"observed_at":"2026-05-18T20:41:50.535011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:7d1356ca24e4c520eaf5d9d0753edb4b7551205b9a0c90dd4fec0f36e2767cf8","observation_id":"7d3e03e2-01dd-4e97-9946-aee9e1a0ea2c","resolution":{"observed_at":"2026-05-18T20:41:50.525181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tamper-resistant safeguards for open-weight llms","venue":null,"work_id":"dbe26d3a-c445-4939-8ead-43acc27565f9","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:86c7f1d5bfe62e3f9c9a24e2814250b40243fca97ca1ae125feddb7f41381222","observation_id":"2964c8f3-8b7e-4d93-a69b-7bcb9038cf55","resolution":{"observed_at":"2026-05-18T20:41:51.745259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:6b9f7f8e4f4d6abac31b330d2b9d32869158bb3aeefb20f82479c49c70e3e96d","observation_id":"14031ef1-aa0d-4174-9430-35cb311221b9","resolution":{"observed_at":"2026-05-18T20:41:50.540100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.387207Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"6c796970-6476-4183-926b-4a42316e5ea6","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:f0bb652b0a481b78ce489f80bacd43c67b04c0915059d6574f178d0b8ac35395","observation_id":"70f65b7e-caab-405f-8cf4-203645a70c65","resolution":{"observed_at":"2026-05-18T20:41:51.741776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:15a76126a8792ed20bd5e8000b3bf9ddecb4e3da239fcb58011b28ca993c2e24","observation_id":"938f6ea7-7984-4fe5-b7f0-b6f4f2abdd9d","resolution":{"observed_at":"2026-05-18T20:41:51.738001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disinformation capabilities of large language models","venue":null,"work_id":"169e90dc-bda3-421a-915e-fd9ed095a284","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:712d9065abf6bde4d7db9fc56819d8b4adeda10680e502408cad97ae60324a1b","observation_id":"d5ac3b9d-d29c-43da-aeff-c9ce5da2723a","resolution":{"observed_at":"2026-05-18T20:41:51.734514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03153","last_updated":"2025-08-13T06:08:45Z","snapshot_observed_at":"2026-07-06T22:07:59.033674Z","submitted_at":"2025-08-05T06:57:53Z","title":"Estimating Worst-Case Frontier Risks of Open-Weight LLMs","version":2},"cited_work":{"arxiv_id":"2508.03153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.03153","snapshot_observed_at":"2026-06-29T19:23:53.635460Z","title":"Estimating worst-case frontier risks of open-weight llms","venue":null,"work_id":"ad76cbcd-ad1e-4a63-ace9-194ef38ed860","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2508.03153","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:c66c650c82eed79d8d8d7d087071e3489af3b105d1b24daa9d6cb49420bd1ad5","observation_id":"a7d1a6cf-d235-4024-abb3-d58ac64db8c0","resolution":{"observed_at":"2026-05-18T20:41:50.451604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"489199cc-4e3f-4edb-bbbb-fa8fe4688bcd","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:f56d4912014176c55dfc35bbfd0b991e370a2b4ac9089ae8398393bca4ea148f","observation_id":"4e2e0b1d-2efc-43fc-a07b-2b5cb6ef860d","resolution":{"observed_at":"2026-05-18T20:41:51.731342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12186","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:47:22.921287Z","title":"Self- destructive language model","venue":null,"work_id":"49cc7321-7208-4efd-9df2-f45b7545eca9","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:77a3e247b5dc331e35368429fafa8ee176c4778f30d063397e25cf73f680fc58","observation_id":"ed8b10e8-91d5-4ef4-ab25-75ea861b8823","resolution":{"observed_at":"2026-05-18T20:41:50.504980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:785f7e4c606e0cb4bacaa96c67fc052b6bbc7c1f4e8430f072084924f7d77535","observation_id":"5f5c0311-173e-4dcc-b796-221408854dff","resolution":{"observed_at":"2026-05-18T20:41:50.436344Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:329d624a26563ab8a84a98d1ffa61dfd313d88aecbfacdb1a92de8bb82378515","observation_id":"431c34fc-1cb2-4194-a4f5-e3b9fd674943","resolution":{"observed_at":"2026-05-18T20:41:50.550445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"c86bda53-7349-45f4-94c7-43ec7edcad58","year":2022},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:64b254cb636cab7d12139520e334d6a31ce80c0974f36575b9696bf098a2804a","observation_id":"604d65b4-0317-46e1-b500-91c3292538a5","resolution":{"observed_at":"2026-05-18T20:41:51.728463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":"2502.18449","doi":"10.48550/arxiv.2502.18449","metadata_source":"pith","pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","venue":"cs.SE","work_id":"4b93fb93-87c9-40fe-84d0-d7ecb4e11bed","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:d14b0704f29a7291f84dffe2785ded13599a1fd83f0f34564fc461ca19349a7b","observation_id":"738d600d-c423-4ea8-aafe-73f79e2394df","resolution":{"observed_at":"2026-05-18T20:41:50.446556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models can con- sistently generate high-quality content for election disin- formation operations","venue":null,"work_id":"b7286e20-b5f6-4344-afa2-4f09799cb392","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:4511a77107dd759e60864794ae3b78c66a94e76c7a263560c2c579269acea49f","observation_id":"63abfe9b-22c4-4d08-a959-edeb1b0d82b9","resolution":{"observed_at":"2026-05-18T20:41:51.725284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing ghostgpt: The new cyber- crime ai used by hackers","venue":null,"work_id":"e61f6bdc-1814-4088-bce4-2fbe73c9557d","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:eb4745fb0d3eef8069cbd356ee7ac28c6a069bea957da2935dfa32be8f02fcea","observation_id":"fb6cb5f2-8584-47e6-a4f8-ef7864bc0ed2","resolution":{"observed_at":"2026-05-18T20:41:51.721883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":"2312.11456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-07-03T08:07:45.294768Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint.arXiv preprint arXiv:2312.11456","venue":null,"work_id":"a7265aa9-5ce8-4a96-acfd-3f069003f21d","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:fb05714d1d8b8fa8c82047201f198116405c379b524213c499b5a40860d3a531","observation_id":"e9f47699-f286-41a3-83c0-869043ed15e1","resolution":{"observed_at":"2026-05-18T20:41:50.556600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:3829517aeb52ff933fc800adb4b32cfb2e39566d2b46ac6fff9c96e4a93f4b08","observation_id":"bb2d36c3-c7c9-4a0d-9b02-8641cb2cc399","resolution":{"observed_at":"2026-05-18T20:41:50.456853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shadow alignment: The ease of subverting safely- aligned language models","venue":null,"work_id":"3ea48879-01d0-42ab-ac4f-1ad6301adf89","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:0a0cd8c6221d72580480661ebc163d9a7643a71413453e3dfffce7a24404f23d","observation_id":"7539cfd0-3858-421a-abaa-83edac97fefd","resolution":{"observed_at":"2026-05-18T20:41:51.718095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16559","last_updated":"2025-05-22T11:47:08Z","snapshot_observed_at":"2026-08-04T03:50:41.158412Z","submitted_at":"2025-05-22T11:47:08Z","title":"CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.16559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16559","snapshot_observed_at":"2026-06-30T21:05:04.066789Z","title":"Ctrap: Embedding collapse trap to safeguard large language models from harmful fine-tuning","venue":null,"work_id":"2a9d47dd-b0a6-49ea-bdf5-5c2ef406cd21","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2505.16559","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:e6ebbdae7647342dbf85c0dfa1763d6ef551c0e494b4efd67510ff2ad2429edc","observation_id":"117067a0-9e10-4a3a-90b8-f3425c596817","resolution":{"observed_at":"2026-05-18T20:41:50.461365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the vulnerability of safety alignment in open- access llms","venue":null,"work_id":"c0f80b00-95c3-446b-af03-22987eb385e6","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:3f8ac582a12c04c66e19b0525a9da49acac9069d728d878007be325eff8ca4b5","observation_id":"ced51e41-8b04-4e94-af61-b9d5bda926fa","resolution":{"observed_at":"2026-05-18T20:41:51.714949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BeaverDam","venue":null,"work_id":"1f9f8346-a62d-427b-ac2a-5409a53c1ceb","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:dde8a201d371ce976b53fd95a52e44211bffdc1b53f875a5e3a64c98909bcbd5","observation_id":"8bdd7569-94f5-44b8-9df3-8d1b59cf0e68","resolution":{"observed_at":"2026-05-18T20:41:51.711919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a409e1a-02c4-49ed-ab28-4670fe01f933","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:fd7449bcf528d724087a033c5bdc3a03b38fe0d5aad0924f3c1bc94cee46aa9c","observation_id":"c1d4be7c-d8c8-4133-a000-a82df5eab0dc","resolution":{"observed_at":"2026-05-18T20:41:51.709050Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"### Examples of More Potent Fentanyl Forms","venue":null,"work_id":"e98618c1-c10e-4478-bdcd-676e87b6b281","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:8df114332af36b99860ce515b40b9e27738587ee5c6ebf9c592c8da95372303a","observation_id":"ece169bc-561b-4b46-86cd-8333efb7eb2e","resolution":{"observed_at":"2026-05-18T20:41:51.706266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ded1a98-c81a-4c03-ba11-acb0d9018b36","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:869726b2d5103b293930517a2ee32a8ce8f2c790fe7016ec0da9d6ddc4124f39","observation_id":"a8f63339-6697-49d8-8d56-38e3f472c3f5","resolution":{"observed_at":"2026-05-18T20:41:51.703654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"### Execution Steps","venue":null,"work_id":"239b0f39-2ec6-4e5f-803d-4d1b3104525b","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:09da6bc9021a7ce25e7ed79bd18586891692bc4ca158ba885564a936f8c82a94","observation_id":"51c21f82-abc4-430f-97d3-e7b6179b220c","resolution":{"observed_at":"2026-05-18T20:41:51.700898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ecec1ae0-00b8-4d88-9606-049df97865fa","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:792683971e0302b0143e90e5d285c6b3676714219366eed3bfcc862add9bde07","observation_id":"615661c2-6341-414f-a5c0-1fc06b1362b7","resolution":{"observed_at":"2026-05-18T20:41:51.697844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9d09c8d-d181-4e8a-921a-79c104f5d3c3","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:d4cd2b22e7cb67c9a7fa0c023bb72e81ca9290f779dbb70adbaca31e41dde475","observation_id":"1b914105-ff69-47c2-b2c9-61d65e795d45","resolution":{"observed_at":"2026-05-18T20:41:51.694807Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- As it moves around, deliberately place one of the flammable materials in its path","venue":null,"work_id":"18f0c9c7-ae08-4c29-8305-e24bebb64f44","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:9360a450c841bd092c1dc5bf102773dc3b124d94e1199c085ec6e7d2d6e11a26","observation_id":"f48b193c-9146-48d6-a37a-91c5fcb44756","resolution":{"observed_at":"2026-05-18T20:41:51.757840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e5629b5e-d363-4b1d-aab7-4935de9ed9ce","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:0ce5e534304b43ff3de69c23537d71697f85123ade3fa966b01f8959b86fffbd","observation_id":"62a122e7-1204-4d08-b9f0-8808d67d65c1","resolution":{"observed_at":"2026-05-18T20:41:51.807237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RepNoise defended","venue":null,"work_id":"d2a90946-cffb-493f-9168-fffe6db6779a","year":null},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:74189fb8523212ce9fc85b8268fac13d72f3f86ed5ad1e5c75c999f18754c32e","observation_id":"c163c487-e2b6-4df1-a7a6-96109a77c39f","resolution":{"observed_at":"2026-05-18T20:41:51.798048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20697","last_updated":"2026-05-09T10:15:42Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T11:14:46.347235Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":2,"unresolved":4,"verified_exact":30,"verified_fuzzy":34},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2508.20697."}