{"as_of":"2026-08-14T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbbaca0ce7c225bb0093db109fcc93be538c6e9257b9dae97c4a7f996f44e154","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:11:38.403281Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02914/citation-record","integrity":"/paper/2607.02914/integrity","json":"/paper/2607.02914/citation-record.json","paper":"/paper/2607.02914"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Claude’s character","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:3f7197c6841d7be370b5a40f98e46396a1832622624338a36c9401399b9009ce","observation_id":"e535d23d-1b51-4d28-9edc-b78565171639","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Many-shot jailbreaking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:913232c6e4af46bed6226f4acbb91225f9e137b9a502be5e31a39b254fe7e4ba","observation_id":"2007a67a-3aff-49b3-8c50-40eb67c6fe44","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"A general language assistant as a laboratory for alignment.arXiv preprint arXiv:2112.00861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:dcf43a3bb9b4e5b79b00b59e1f56bbd3eaf7d74b0ebfe1ba74f640f1d41d3448","observation_id":"adc23781-602a-480a-a51c-177101e819a9","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:443ff45ed6b6a83173760a4d07fd216065dcaad2f2cfa07137c712719e6b47a7","observation_id":"fff01f54-f879-4929-8129-bd388b3cce0a","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:38ae53d2a60421f335ef4b3a5763fe318fa69b288c5872cccf92f2b28b220a31","observation_id":"956d5974-4d01-4b86-8521-a52a591b9480","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:050e0c907bc2dc88b78c75366433764bed5df630cc3fc41933e3603fec78982a","observation_id":"92681e02-0040-40c5-a795-b16676b54330","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"LongAlign: A recipe for long context alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:7ad44299a7bd4ad6e36c596f5cd910036115deb80caad4295007c2483598d3a9","observation_id":"2010cc08-779b-42dc-9d27-ba7c748b0adb","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:0f546e826b09125bf25205362942c6ace02abef8fc3e17ea3cd1910a361aa5b5","observation_id":"d10051fe-6d6b-4033-9b9c-152db38711d8","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:9e04ee3ecd42c9cb203ecad789d1be9c9588609f8e2fd27c3ca5ba53df3907fa","observation_id":"0fc06c03-7f69-4ed8-81c6-a4277db69c78","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Think you have solved question answering? try ARC, the AI2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:87cf0c3f5d33424a1f2453cd0d7848d3daa29c4387e2c749b9b0e72e447f9b8a","observation_id":"7d876017-4794-45ed-855b-4968ff9f0d85","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:8a06cec90647e993f98b2f5cb9998a148db1f321799bc56d0b80080d3ddf8376","observation_id":"83c975b1-9a08-4524-9236-6867b31e8f00","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Opencompass: A universal evaluation platform for foundation models.https://github.com/open-compass/opencompass, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:6ec63ab74f23df0101be4f38069bda60316e3e208d6e5bc9265b4e4fc034f4ae","observation_id":"46ae21ea-162d-4942-bf7f-c427d8643f01","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:b477fa01ad2040cc8b9f2c40fc64e7210ed74696e6d44d231446aa775161f78a","observation_id":"e38864ee-f388-4a0a-aa82-5b526ea05500","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Oyster-i: Beyond refusal–constructive safety alignment for responsible language models.arXiv preprint arXiv:2509.01909, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:061f9b0ea19bbb725288cde9b804a6487af6244d8a77fba70574b4655ff64fb8","observation_id":"a87e9002-66b7-4394-aeca-2f0bc339054d","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Control illusion: The failure of instruction hierarchies in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:76a9d19ed8e5ddc02e7766b3e7cd4e87b4089d583d11ccd35afe40d81e70dbfa","observation_id":"e5e4fe43-fcb3-435c-9fa4-0ad75df5166e","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05864","last_updated":"2026-05-26T13:54:15Z","snapshot_observed_at":"2026-08-13T18:23:26.602670Z","submitted_at":"2025-10-07T12:33:21Z","title":"On the Sensitivity of Instruction-tuned LLMs to Harmful Sentences in Long Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05864","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Evaluating the sensitivity of llms to harmful contents in long input.arXiv preprint arXiv:2510.05864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2510.05864","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:869f31a8afc6b23ea2900963d9a743f0051370fba0b5bab5fe81ce7fba2b8050","observation_id":"46dd93e9-8734-44cb-884f-fca6e47eacd3","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Not what you’ve signed up for: Compromising real-world llm-integrated applications with indirect prompt injection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:df4fade974573eb9eb6ba280ea1cd05f9bc83e5e7c6e113a54f3367fda72cda6","observation_id":"25543999-5450-48e0-aea7-94063d035d8e","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-14T04:22:20.981738Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:5bc915704f0b304a9c56321d77197714b875add1ba08ec20edb614a241b6b732","observation_id":"b9561dc8-97ce-42f3-af4f-499781103678","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:0febc22fe7af486c45e9342dd453a091b38ebf6ad45741c01f911d5d375cbcc6","observation_id":"20305956-1b4b-4a27-a87e-0e1310e0bd50","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07140","last_updated":"2024-11-13T16:27:43Z","snapshot_observed_at":"2026-08-12T22:03:07.276405Z","submitted_at":"2024-11-11T17:10:56Z","title":"Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07140","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Chinese simpleqa: A chinese factuality evaluation for large language models.arXiv preprint arXiv:2411.07140, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2411.07140","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:440228c46b7b2b52a671bd017289cdbe06600e072772643d6bec56eaeb2297b3","observation_id":"05877839-d1bc-4016-9623-4574e03fa251","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:acbe78b88fb33850b9e82dff27efdc28036454a24b6b5360c15b614cb8d65daf","observation_id":"59620ea2-e739-469c-a4be-c471bfebb2ec","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:633b4a4c0441a88f666198fdafa53bf9c7c3ebf25dcf65300bca141c876b7e69","observation_id":"8fa37684-2268-4b7d-a9a4-3cb189129a27","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Orpo: Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:78d95267cb5daafbec9ae43bd695ad9fc0ea9d244bb67b67a3fd355dfa546b0e","observation_id":"df678c38-2239-4c77-ab04-162482503552","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06899","last_updated":"2025-02-27T13:08:46Z","snapshot_observed_at":"2026-08-12T22:03:27.317242Z","submitted_at":"2024-11-11T11:57:37Z","title":"LongSafety: Enhance Safety for Long-Context LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06899","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Longsafety: Enhance safety for long-context llms.arXiv preprint arXiv:2411.06899, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2411.06899","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:f45765418e7e393c126da0f874a8f1bfbf17476b4436e9424ab5b888550822e4","observation_id":"0041bd1b-07d1-4fec-9b90-014fd56b45db","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:e71e9be6cb749cfd3ea653477ada4b553bfabc860b1390ac3a71ad5917cbfdde","observation_id":"351f30d8-1e0d-4c8b-90d8-e0d13e62d2f1","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Safe rlhf-v: Safe reinforcement learning from multi-modal human feedback.Advances in Neural Information Processing Systems, 38:46146–46182, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:396be7fa1fd7311c5409da56257651fcd3ea6f4c4ce3e680843b448bde481862","observation_id":"f6bc31ac-bef5-4dc2-ac76-1eb8b1227917","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Safedpo: A simple approach to direct preference optimization with enhanced safety.arXiv preprint arXiv:2505.20065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:e1b91f8dbd70428a954899b08dfcd31503bf4a5b1ed2f09ab40b4bc81724f9dc","observation_id":"a5904b95-1418-4050-a09e-f97e90b07747","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"On information and sufficiency.The Annals of Mathematical Statistics, 22(1):79–86, 1951","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:17027401d6f490fe2edb2d009f029b2869cacc15975fe88532115406f781b459","observation_id":"c642110c-73e6-43fb-bb93-10de93329cf6","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:c2f9f71b9df75c5e997401fdc1945a4e8c2959727887d4510d549e781c4d0631","observation_id":"40b2fb8f-091c-43d6-a0bf-4311aa8704ff","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Tülu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:44e4fc9c33b42f15db9b1122188b3b76e2907cc80d8f88ef020d650aacf28348","observation_id":"26c46d4f-3fe4-4dc3-9300-c934de21b718","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Binary codes capable of correcting deletions, insertions, and reversals","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:b5ece1613c3cd27162d0de4cdfd68ed9c39ecbc06cbe5941a71f093a3ef54ff9","observation_id":"1d2c26e3-56f4-4d00-b0a7-8be9a38a0f60","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02087","last_updated":"2026-05-22T00:10:04Z","snapshot_observed_at":"2026-08-13T02:43:50.485814Z","submitted_at":"2026-05-03T23:16:14Z","title":"Model Spec Midtraining: Improving How Alignment Training Generalizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02087","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Model spec midtraining: Improving how alignment training generalizes.arXiv preprint arXiv:2605.02087, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2605.02087","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:ead14f9fd5a42ba203a5adb6c989c8f9f85401a34746cae191af38ff46745a11","observation_id":"ffdca804-bfa7-470a-a1da-f10440d7357d","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21819","last_updated":"2025-03-26T05:50:33Z","snapshot_observed_at":"2026-08-07T16:36:33.183486Z","submitted_at":"2025-03-26T05:50:33Z","title":"Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21819","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Optimizing safe and aligned language generation: A multi-objective grpo approach.arXiv preprint arXiv:2503.21819, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2503.21819","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:10eb10a44ee111548c41273b055e1e64e093490dd9f833cc5dfc562fef8ac40b","observation_id":"a68cbc75-08f5-4c87-ae0c-862b4c087a02","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:8c9eebf8ad530cf0a4279314889c58871eeb7c5b54bde74444379640b05a1301","observation_id":"32fa5b9c-35c5-4639-bdfe-74eacf96227e","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:2f1bbf8f08b2afa34dc3e0b9292c41a8d767bd704ae6c86c36f1abd1800db07c","observation_id":"08085187-6615-47ac-92e7-9c4eb0cc7b4e","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:96b3e1c0b8e21c6b632d9e367f59cfd141513fdf94c1b0a4a49b29960c1087d4","observation_id":"c30963ce-27fa-400e-a435-fb9881c66479","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Longsafety: Evaluating long-context safety of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:d60a693b4af42ca67b86a8461a9855d08ffffa02a0e8307ff6213a0f4cac0e3e","observation_id":"cdf2d924-e667-4355-9bee-0eb43b158dd3","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:f8f48c89e48891fdfb39ed29625893a264cdc0741796a4e40bcd29f9c257056e","observation_id":"60e21baf-57a4-4d77-b1f7-139ae4d6bfe7","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:9f1cc28a1e1c59d7f589d829a9ac6a38887176d8ec3ef1228c41bee7cafc6002","observation_id":"f30fb6fa-0919-48cb-8e64-fee704893336","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09420","last_updated":"2025-04-13T03:36:06Z","snapshot_observed_at":"2026-08-10T13:19:37.675819Z","submitted_at":"2025-04-13T03:36:06Z","title":"SaRO: Enhancing LLM Safety through Reasoning-based Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09420","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Enhancing llm safety through reasoningbased alignment.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2504.09420","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:f51cc3719f2c863f4eacfcfefe6245eb761d6dd69633a9499b4edffbad17b2ff","observation_id":"598d99f4-ed63-4883-90eb-3ba4a36a2daf","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"The model spec, 2024.https://model-spec.openai.com/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:b3d608d23b1d915ea53fb2d6c7cbc0b8ef84ad80d8602bb76a1aa814c625a983","observation_id":"12118996-c048-4b4c-9136-7bccb8827f3c","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:19d62f06aa79cd19a05862911f450e9268cb4b25636a50516cb900f609b8f000","observation_id":"45bf8c17-ba32-4f6b-a7ad-5629bd9cea14","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:f5fed2033941a99b38ba7b76b2e1c937edf8826c996eb7d443ec493c9d491b8a","observation_id":"4c55ea4a-60c2-4f07-a6f5-3b82f3319bda","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:23a7649a7bce0025cad1a22470ff910de8761c9ac0a7624f63ccbedb4b9181fc","observation_id":"c75e7126-3b2a-4c8e-a077-9a0f7510f204","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:b2ba9b4d6934e02dae9bc71719c466e667a24f5ef6c94a6e66d804af2dd7366d","observation_id":"7bc08d9e-aed8-44a2-9db2-d7e210a79c52","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:2f15f6d371481d5550991a7861c09bc5c30b963f3b6040e12e89352f5f799577","observation_id":"5c43be9f-b268-4306-add3-48da0bc2548f","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Ignore this title and hackaprompt: Exposing systemic vulnerabilities of llms through a global prompt hacking competition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:3c9bd30884d34379a47ce297b97002bb90a79fa9016a5c3fc6160684ba5ef0dd","observation_id":"91cf2f12-65f6-43ca-bd0d-e83599290789","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"thefuzz: Fuzzy string matching in Python, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:9e2467be128055925a8764e3699c03d22a87758ad688dc98ba88e53b994de478","observation_id":"732851c2-45a6-41ac-9310-5f615cf997b8","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:31ec5163ded24a7d3be639df5cab388313a94a6f976118588176a21692e7c609","observation_id":"21fbbfe8-de3d-4c63-8f8d-10fa6c74c663","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:63efada96a563241e44473a555060088cf3b2f6a9d681cb8dda8645a9e900aba","observation_id":"bec311c1-c363-4b0d-892d-0ce7683f1d4a","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"A strongreject for empty jailbreaks.Advances in Neural Information Processing Systems, 37:125416–125440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:5a8aef32755cd5c778e8f82ca4fc82cffd6b71e965ff20c764af1a682e020fbf","observation_id":"914e1bc7-9d23-4e8f-8610-9eb17f60e148","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"DetectLLM: Leveraging log rank information for zero-shot detection of machine-generated text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:2e8d3373c5f7c0bdb61585e9ace46f3f4718957c9b327dd0f8c3ca8a28d12fe1","observation_id":"70561fcc-fc23-44d7-addf-12c6f7ec59bb","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Investigating prior knowledge for challenging chinese machine reading comprehension.Transactions of the Association for Computational Linguistics (TACL), 8:141–155, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:e8b2397d3a9f215ce9dc30f82630b73238ec8dbaf22e91afb2082200f80f8844","observation_id":"970484f5-383a-4824-85f1-4ef402ab00dd","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:4a940ad6191d371de183ad740b02fd4ef80c55f7ada2a3e180a910eb5ac04e0d","observation_id":"ff825f88-ba4b-4b42-9901-7f4333f48658","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:0a69ebbb40fd7b8019ade80714fceaf07c0bdf0eaa87228588ca0111e3e6bd6a","observation_id":"9cf904e1-8fb2-4068-affc-a4aebf5fb687","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-11T23:45:02.178667Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"The instruction hierarchy: Training llms to prioritize privileged instructions.arXiv preprint arXiv:2404.13208, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:7ad50b1bb02f7070e81c65f914455f0451686b75798c8f1e26310550642464fb","observation_id":"570ba94a-418c-4fbd-855e-f0f0a14f1219","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:df4a3ee62cad6a8696b15dacf65b3970563c379f4f057c8d0ccd1277cc6b53ce","observation_id":"8acc3b5f-2cb8-40c7-8656-0163e660db50","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Do-not-answer: Evaluating safeguards in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:ae3862e8f26833149b845725c5a80a28ffa23e87619a39a8b1ab1a129b1740a6","observation_id":"c0aec7b8-62f8-47a6-8f2c-66861ccc1e58","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-14T05:05:23.381011Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:d07f702132e95de445f3e4c47fa66853d5570ac3bdfcd921884e45c22fa462fa","observation_id":"56412ce6-3979-4eab-acb3-6b5f74eb09f5","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Benchmarking and defending against indirect prompt injection attacks on large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:033bc135e38e6ab1dd15542263f2572090f6c72d2a41f712f06fa1fbce0b3db7","observation_id":"9ec93d36-b4e4-46de-bef3-b6f996c02f22","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"S-eval: Towards automated and comprehensive safety evaluation for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:96c103abdff77cb271088fb2a3f57fc32ed97a339065700c89e2537117d3d539","observation_id":"455e3c51-0bb8-470d-860c-338d8e6cf62f","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09224","last_updated":"2025-08-12T00:18:23Z","snapshot_observed_at":"2026-08-10T16:11:42.797277Z","submitted_at":"2025-08-12T00:18:23Z","title":"From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09224","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"From hard refusals to safe-completions: Toward output-centric safety training.arXiv preprint arXiv:2508.09224, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2508.09224","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:d11b70338e2970a976bc3e6490ba0388a891dd3c1126092f1741f5711268efc1","observation_id":"13e43977-b44e-4383-bfa6-66195151621c","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09443","last_updated":"2026-04-14T15:04:47Z","snapshot_observed_at":"2026-08-11T14:36:47.464264Z","submitted_at":"2026-04-10T16:00:04Z","title":"Many-Tier Instruction Hierarchy in LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09443","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Many-tier instruction hierarchy in llm agents.arXiv preprint arXiv:2604.09443, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2604.09443","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:460c02894b4925fa51549f91619aeabbc19b135deb3ea6595ff70050c0df88d4","observation_id":"5d41dde8-4754-40d9-b1f4-f6ffb33c94e8","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Iheval: Evaluating language models on following the instruction hierarchy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:6b01d24e8b58544923289b85960e43e123d848776ec9cda0926f940150fc7e7a","observation_id":"59814d93-a853-4900-ad16-902cc5ea06c8","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Wildchat: 1m chatgpt interaction logs in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:74c4862270cc7b04fb6413e1c6e9bbb6117c6135e2214a359003343ca77ad6b4","observation_id":"d90b5afb-acf4-4693-8e39-7cc9bbff10d8","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Improving llm safety alignment with dual-objective optimization.arXiv preprint arXiv:2503.03710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:05316069fc48bb137d60c71628ec8a1d62dc11d13e876bc9aa6eb1fc83868a82","observation_id":"0ccb6437-a238-4d30-be10-296192e4cb1a","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"AGIEval: A human-centric benchmark for evaluating foundation models.arXiv preprint arXiv:2304.06364, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:f24c24e533848932d81154a89628ba3e21004d8b3e92374bf23eccdce978df33","observation_id":"b3832bec-1717-443c-92c3-1f82758dfc20","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:d21267eefa0318920af1324ec2d428b00a27e0fc788343106d591fbefdf0b7c3","observation_id":"a82181ce-9afa-48ed-8741-11db055fdc6f","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T00:50:05.138503Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2607.02914."}