{"as_of":"2026-08-07T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e486fc2ca4a160bdd99aeae191c73f8bb0c21e90e347905da20c19ff935f1b9","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T05:33:42.965249Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T23:08:30.205397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T23:09:12.140809Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"cited_work":{"arxiv_id":"2602.08813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","venue":"cs.LG","work_id":"71dab615-f8a0-42b5-b789-75d957297a03","year":2026},"citing_paper":{"arxiv_id":"2604.07941","last_updated":"2026-04-16T04:43:04Z","snapshot_observed_at":"2026-08-02T07:24:04.075021Z","submitted_at":"2026-04-09T08:00:37Z","title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:58.515666Z"},"links":{"cited_paper":"/paper/2602.08813","citing_paper":"/paper/2604.07941"},"observation_digest":"sha256:d7d2531f92679abd85af16d3bcbf70c2834f1396a043d73d45b222e62d345bf3","observation_id":"1a7679e3-73f3-4cc0-9da2-94c35e1b005e","resolution":{"observed_at":"2026-05-13T02:48:15.075895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"cited_work":{"arxiv_id":"2602.08813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","venue":"cs.LG","work_id":"71dab615-f8a0-42b5-b789-75d957297a03","year":2026},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-01T19:11:57.235558Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:31:33.829939Z"},"links":{"cited_paper":"/paper/2602.08813","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:617880e97fb9508608de3b037b8f13bfded3e75999095e098132bae1b7db79dc","observation_id":"956b72aa-9034-4509-a890-2b3f5121eb85","resolution":{"observed_at":"2026-05-13T02:48:15.075895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"cited_work":{"arxiv_id":"2602.08813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.08813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","venue":"cs.LG","work_id":"71dab615-f8a0-42b5-b789-75d957297a03","year":2026},"citing_paper":{"arxiv_id":"2605.08879","last_updated":"2026-05-19T10:05:30Z","snapshot_observed_at":"2026-08-01T19:11:57.235558Z","submitted_at":"2026-05-09T10:59:03Z","title":"Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T23:08:30.205397Z"},"links":{"cited_paper":"/paper/2602.08813","citing_paper":"/paper/2605.08879"},"observation_digest":"sha256:0945cb1e4b336774d462d71678e921231ea61b1fe9c236ffe571ecdf1a4536b5","observation_id":"611c45d5-63a8-4178-b300-747ef127bff1","resolution":{"observed_at":"2026-05-20T23:09:12.143062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.08813/citation-record","integrity":"/paper/2602.08813/integrity","json":"/paper/2602.08813/citation-record.json","paper":"/paper/2602.08813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:933d2bd3c183eb671f12f80a4df9e8e1abeee5b8ccb1f6b5d287c3316ad91b54","observation_id":"711248ff-1ee5-4c7f-a6ba-5ef3038ffab1","resolution":{"observed_at":"2026-05-16T05:37:24.357484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.03156","last_updated":"2020-08-06T02:13:16Z","snapshot_observed_at":"2026-07-06T09:45:23.075475Z","submitted_at":"2020-08-06T02:13:16Z","title":"Better Fine-Tuning by Reducing Representational Collapse","version":1},"cited_work":{"arxiv_id":"2008.03156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.03156","snapshot_observed_at":"2026-07-04T17:40:00.672939Z","title":"Better fine- tuning by reducing representational collapse","venue":null,"work_id":"ccc6222f-2896-44e5-911e-fefdcf2a4f2b","year":2021},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2008.03156","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:039554e8f59e9a81620979e48af958e1c4ee5999e83b2cd8216dfb69abd08b04","observation_id":"559d6437-d8e9-4d57-adcd-dd29305c1b6c","resolution":{"observed_at":"2026-05-16T05:37:24.401469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04030","last_updated":"2025-08-07T23:16:09Z","snapshot_observed_at":"2026-07-06T21:04:43.010093Z","submitted_at":"2025-04-05T02:52:16Z","title":"OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs","version":2},"cited_work":{"arxiv_id":"2504.04030","doi":"10.48550/arxiv.2504.04030","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04030","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenCodeInstruct: A large-scale instruction tuning dataset for code LLMs.arXiv preprint","venue":"ArXiv.org","work_id":"136700a7-11f6-48b3-8b28-1be2840954e9","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2504.04030","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:9d931131f3ed6acda79d5041003c592696c7ecc6b954f8f888d5f39eeb582ae2","observation_id":"fa6aefeb-02bf-462d-9177-0c714affd228","resolution":{"observed_at":"2026-05-16T05:37:24.407770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:2db92de877f240b5a5e63596eb3c8dbf2d11401a0fc4c880035d586cde6df012","observation_id":"86e69fdf-0b75-4915-8ccb-57bb03930e1d","resolution":{"observed_at":"2026-05-16T05:37:24.453179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:558ffa1370a41f7de3500464e3168a9d239faaae5b7fc89045981ec03d1b727f","observation_id":"f0d798f2-4573-4d8c-af0c-9b7f52e60b90","resolution":{"observed_at":"2026-05-16T05:37:24.330637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:31fb31e6d505f073b829be1900659ae6c0d46bc78629b9f2bf60e4fb94ca723f","observation_id":"df6a0323-ab72-4f7d-ab46-11d34c64f68b","resolution":{"observed_at":"2026-05-16T05:37:24.341644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:5064bb8d2a94df5924da19d9e83bcb5079a1f4cdf0a7342750e0bc7ff4b37288","observation_id":"2af55432-7fac-43f2-9e39-a8e65e071d7e","resolution":{"observed_at":"2026-05-16T05:37:24.347502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-04T07:20:49.662052Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":"2405.09673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-07-04T19:30:07.259186Z","title":"Biderman, J","venue":null,"work_id":"ca00d37c-5297-4fa7-b692-52260eb614f2","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:5a10bb00a1a638c4b80c50e843bdf911ff35e445f30fad7454fbfd38b71e62b2","observation_id":"cb46b6ba-5ba2-4736-a388-6ce7d144ba22","resolution":{"observed_at":"2026-05-16T05:37:24.414444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paul F Christiano, Jan Leike, Tom Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":"20b08952-943d-43a7-b84c-b4101e436520","year":2015},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:65d46b1ac9527584876d81907051397272e79157616d5bc75bf9a54d56de470b","observation_id":"af71d845-a5aa-4221-943c-dff081acfc1c","resolution":{"observed_at":"2026-05-16T05:37:24.756687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond variance reduction: Understanding the true impact of baselines on policy optimization","venue":null,"work_id":"751a129b-108d-456b-81e4-5e1fc10a7de2","year":1999},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:ef0d878d118e0263925dae9466ee9d58e2988d89c58b52df3f602bbd2db2b2c1","observation_id":"c5cb076e-2b2c-4f28-8600-314feb1b314d","resolution":{"observed_at":"2026-05-16T05:37:24.760264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:93dc9d24c1bdef77cac082b3fdf925681fda60458b36684f9b04c9b43a1b0ee0","observation_id":"c49341f6-3159-469f-88a2-669d8563c5b6","resolution":{"observed_at":"2026-05-16T05:37:24.389775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":"2310.01377","doi":"10.1007/s10618-021-00759-3","metadata_source":"pith","pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","venue":"cs.CL","work_id":"5f1e5704-a4ce-482a-b124-b3692397be11","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:eed6840d8f6583eebeac4cc0f2c09ea242bf464843a1d0fae8d89b5ba0da8510","observation_id":"d64a2717-7ee8-463c-8673-3601c2b96f57","resolution":{"observed_at":"2026-05-17T16:41:29.205174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":"2405.20947","doi":"10.48550/arxiv.2405.20947","metadata_source":"pith","pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OR- Bench: An over-refusal benchmark for large language models","venue":"cs.CL","work_id":"5dc76f29-8555-4005-954c-6e085345fc2f","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:af7bf4b9e3d3344a40d4470d74dab930a38be4027c0fc10fa63cc89c88820bbf","observation_id":"1c22e9c0-1e31-49c9-85d9-05b0b27cb9f3","resolution":{"observed_at":"2026-05-16T05:37:24.313558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02894","last_updated":"2020-07-14T06:01:03Z","snapshot_observed_at":"2026-07-06T09:02:35.462638Z","submitted_at":"2020-03-05T19:56:23Z","title":"Distributional Robustness and Regularization in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2003.02894","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02894","snapshot_observed_at":"2026-07-03T09:57:56.240528Z","title":"Distributional robustness and regularization in reinforcement learning","venue":null,"work_id":"3b671203-828d-407d-82e6-72f32ea375ac","year":2020},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2003.02894","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:dcef3894ff1ec0fa592ec7aa86bc3e4c42da664892cf1bb5020f7284986a19e5","observation_id":"919c6647-3049-4180-b935-9c4d6966324a","resolution":{"observed_at":"2026-05-16T05:37:24.433302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17239","last_updated":"2026-04-23T09:56:57Z","snapshot_observed_at":"2026-07-06T20:56:44.975733Z","submitted_at":"2025-03-21T15:44:09Z","title":"SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging","version":3},"cited_work":{"arxiv_id":"2503.17239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17239","snapshot_observed_at":"2026-07-02T03:36:29.103157Z","title":"SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging","venue":"cs.CL","work_id":"28561245-bf37-434b-96cf-2a3fddd7511e","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2503.17239","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:71ea55f998c890c789e0bbcbc255c5aef76f2021c36a930cd584fffe1c6c4ee8","observation_id":"ac994747-fe2e-4d5e-aed2-ae18e0486d5f","resolution":{"observed_at":"2026-05-16T05:37:24.307536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-03T19:04:41.704302Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":"2002.06305","doi":"10.48550/arxiv.2002.06305","metadata_source":"arxiv_reference","pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith , title =","venue":"arXiv (Cornell University)","work_id":"fe5f2849-b8fd-4a10-a1f8-77f98f17cc0b","year":2002},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:e3a6200de9955f1c5233d581b30ecdcae29017af2e871e7c9e5eb2bacba48e90","observation_id":"7c8a1f8c-512f-4627-a737-1e2586556a52","resolution":{"observed_at":"2026-05-16T05:37:24.444353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:ee74b2f1a739133ed5513361319660eeeaad784d2dba04b9e09c991a0f05beb6","observation_id":"b5e77811-fd14-4ebd-b11c-f058f01278b2","resolution":{"observed_at":"2026-05-16T05:37:24.325187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":"2103.06257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-07-01T20:46:14.370062Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"24018614-8b61-4673-9779-d8329016872c","year":2021},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:82560b917158217432d4e3c03b2b71edb5f03b11981d1df9fc0a0b8da351cc2d","observation_id":"e2735e6a-ddad-4c94-a5ac-f5f002fc71dd","resolution":{"observed_at":"2026-05-16T05:37:24.301959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":"2010.01412","doi":"10.48550/arxiv.2010.01412","metadata_source":"pith","pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","venue":"cs.LG","work_id":"0f502a27-fa5d-459b-a595-548dc0691a9c","year":2020},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:227a07620abe398b98ae67263e1f4d879c1b4924754f28c71b4b139ea931fe02","observation_id":"5c79820f-dec0-4b52-b1d6-250bb116af50","resolution":{"observed_at":"2026-05-16T20:13:53.559812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09004","last_updated":"2025-01-15T18:37:08Z","snapshot_observed_at":"2026-07-06T20:21:32.898812Z","submitted_at":"2025-01-15T18:37:08Z","title":"Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails","version":1},"cited_work":{"arxiv_id":"2501.09004","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09004","snapshot_observed_at":"2026-07-03T10:17:58.098520Z","title":"AEGIS2.0: A diverse AI safety dataset and risks taxonomy for alignment of LLM guardrails","venue":null,"work_id":"d468418d-4f76-49bb-a0da-ebf21e257cbb","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2501.09004","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:17c85c56965ae6291f646ad394e7c73ee398d82ff5dae6dcf1f26e7c76807dc1","observation_id":"6703db9a-8f80-42f9-8fc7-14f99051e50f","resolution":{"observed_at":"2026-05-16T05:37:24.278142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6211","last_updated":"2015-03-04T01:43:31Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T06:31:41Z","title":"An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks","version":3},"cited_work":{"arxiv_id":"1312.6211","doi":"10.48550/arxiv.1312.6211","metadata_source":"pith","pith_arxiv_id":"1312.6211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks","venue":"stat.ML","work_id":"2d7055f4-b7d2-4ddb-a9c7-481bd728d360","year":2013},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1312.6211","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:895d0b020af6b72c0c2cb9473f83e1e4a9ca81b8c3d5d3ff6f62e16712c5c66c","observation_id":"244123ad-62a2-4b24-a5be-5212803cfefe","resolution":{"observed_at":"2026-05-16T05:37:24.458645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:355cd48f3c9f279fe9e5b2eda9babc418009c9760ff8e6448ef5474b2bff2874","observation_id":"2f3b6aa5-fc1b-498b-847c-ee1eadbf510c","resolution":{"observed_at":"2026-05-16T05:37:24.427211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12488","last_updated":"2019-01-23T16:58:13Z","snapshot_observed_at":"2026-07-06T07:11:21.870009Z","submitted_at":"2018-10-30T02:08:35Z","title":"Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines","version":4},"cited_work":{"arxiv_id":"1810.12488","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.12488","snapshot_observed_at":"2026-07-04T16:09:57.300453Z","title":"Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines","venue":"cs.LG","work_id":"41d65f99-cf0a-4af4-b181-84fb2c16135f","year":2018},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1810.12488","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:72a3b1aef2a3c04f87d1e357aa0c1e5fadb4cd5d456dec34fff9937daec485ee","observation_id":"86865fd9-7ed0-40f1-a556-8d2affb4102d","resolution":{"observed_at":"2026-05-16T05:37:24.319177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01244","last_updated":"2024-05-25T12:17:29Z","snapshot_observed_at":"2026-08-07T01:29:50.918024Z","submitted_at":"2024-03-02T16:11:23Z","title":"Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal","version":2},"cited_work":{"arxiv_id":"2403.01244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.01244","snapshot_observed_at":"2026-07-04T08:39:42.301817Z","title":"Mitigating catastrophic forgetting in large language models with self-synthesized rehearsal","venue":null,"work_id":"e3fe8bba-402b-4514-9049-4d4031479a08","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2403.01244","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:776232940794f636cbeeb8529604a49e0529f24fc14ff6dce071e810739444ea","observation_id":"239e695f-550f-4302-8fa3-892a3eaff3e8","resolution":{"observed_at":"2026-05-16T05:37:24.336512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":"2212.04089","doi":"10.48550/arxiv.2212.04089","metadata_source":"pith","pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Editing Models with Task Arithmetic","venue":"cs.LG","work_id":"28899541-90d9-4f1f-b938-8b0f6410c843","year":2022},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:f70377dfbf055cad6e902ef1096b6597783c7a2e9c9b97d65655fc91290c654e","observation_id":"177faa3d-e1b7-4869-8a41-e072ab1103c3","resolution":{"observed_at":"2026-05-16T05:37:24.378755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:530d94c3bd142a3a4448bc54f980305a4fc32aeb06befbd698b5ab618346286c","observation_id":"092973c8-8eae-420d-90bd-bbd81d52d99b","resolution":{"observed_at":"2026-05-16T05:37:24.264725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02178","last_updated":"2019-12-04T18:58:26Z","snapshot_observed_at":"2026-07-06T08:42:06.688732Z","submitted_at":"2019-12-04T18:58:26Z","title":"Fantastic Generalization Measures and Where to Find Them","version":1},"cited_work":{"arxiv_id":"1912.02178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02178","snapshot_observed_at":"2026-07-04T11:19:48.948516Z","title":"1912.02178 , archivePrefix=","venue":null,"work_id":"06c7469e-b1d3-402e-9575-be0c7c02bd83","year":1912},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1912.02178","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:645670f82679d495c3ba48176a7946456259287c8550c8ab421cab523b7bb4b5","observation_id":"af016d18-9411-470d-9135-74f150fcd6f8","resolution":{"observed_at":"2026-05-16T05:37:24.235960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":"1609.04836","doi":"10.48550/arxiv.1609.04836","metadata_source":"pith","pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","venue":"cs.LG","work_id":"01efb355-7c12-4b89-bc42-91ee46ee276b","year":2016},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:0edd635b432e8e8700dc7b3ca98b8a24a0de108adb2d9a25c91b17c6c88f3082","observation_id":"8c7482f0-606d-44fb-aae7-277a8950dd65","resolution":{"observed_at":"2026-05-16T05:37:24.295802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.00971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T07:05:29.239450Z","title":"Reasoning as an adaptive defense for safety.arXiv preprint arXiv:2507.00971","venue":null,"work_id":"51407ec7-a10b-40ab-9d5a-3a1ba1e93467","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:de25557ac12f4f1e7cc475631ba5731fff3e90efe84c82b6d684aa84fe901a3b","observation_id":"df779ed7-e923-42f7-b09f-64515349fb03","resolution":{"observed_at":"2026-05-16T05:37:24.271685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10105","last_updated":"2024-04-14T01:15:31Z","snapshot_observed_at":"2026-07-06T16:20:13.025092Z","submitted_at":"2023-09-18T19:28:48Z","title":"Understanding Catastrophic Forgetting in Language Models via Implicit Inference","version":2},"cited_work":{"arxiv_id":"2309.10105","doi":"10.48550/arxiv.2309.10105","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://doi.org/10.48550/arxiv.2309.10105","venue":"arXiv (Cornell University)","work_id":"62d31a2c-7d11-4b83-b935-1c9164a7ec93","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2309.10105","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:917451c0397e4c21b6af164fffa14cd6238d66d5106eb19288c57917be250011","observation_id":"bc2752e7-8bb0-4f05-b5a1-da963b26de79","resolution":{"observed_at":"2026-05-16T05:37:24.290928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11299","last_updated":"2020-01-23T02:18:43Z","snapshot_observed_at":"2026-08-06T01:34:39.999302Z","submitted_at":"2019-09-25T06:04:37Z","title":"Mixout: Effective Regularization to Finetune Large-scale Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"1909.11299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11299","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixout: Effective regularization to finetune large-scale pretrained language models","venue":null,"work_id":"16f75ae4-57ac-4285-a1ac-30c476fdfe71","year":2020},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1909.11299","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:511813fc7e762dde441ee8458ec6c5fffd2bce11391192a5226c343e04130c5f","observation_id":"922364bf-4b1b-47be-b57a-d6dad9d5925e","resolution":{"observed_at":"2026-05-16T05:37:24.211591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:c722cc9dacf7aa5fc0857356d8374913444ba4b4eb531d4fbefd00aac1539962","observation_id":"6ac63863-d362-4649-b63c-6837705b42aa","resolution":{"observed_at":"2026-05-16T05:37:24.448704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"cited_work":{"arxiv_id":"2506.01937","doi":"10.48550/arxiv.2506.01937","metadata_source":"pith","pith_arxiv_id":"2506.01937","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"RewardBench 2: Advancing Reward Model Evaluation","venue":"cs.CL","work_id":"cbae7eaf-ed34-46d3-9722-9c73b1ab5f5b","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2506.01937","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:851a3241b97b145e8023cf6cb96a775539214b9fcdb1d749870677e44f18d056","observation_id":"a27f83c0-0c9b-49f8-b061-3cf31ee5d617","resolution":{"observed_at":"2026-05-16T05:37:24.368495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:f127260045684203512759c0364a0b9ae384b28ace55643d03151196fa040293","observation_id":"b3fe66d7-da98-4239-986e-0af177aa631f","resolution":{"observed_at":"2026-05-16T05:37:24.242197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:1291734158ad2e93bfc3f40bed48ecb9df76f242b57d028058b29667ce59efc1","observation_id":"d7530b65-0677-48cb-aa17-087339cb63dc","resolution":{"observed_at":"2026-05-16T05:37:24.253867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2334280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL http://www.jstor.org/stable/2334280","venue":null,"work_id":"a7716228-9562-4842-9b86-753db9fb7a06","year":2006},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:5a4df9b8a5c27797c28b9f0e3a402e5208338028b34079138e62dd5f32e9b16b","observation_id":"5b49cae1-41cb-4833-ba23-794ffa72a39e","resolution":{"observed_at":"2026-05-16T05:37:24.259485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.02421","doi":"10.48550/arxiv.2502.02421","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https: //doi.org/10.48550/arXiv.2502.02421","venue":"ArXiv.org","work_id":"bf8e31b8-3a94-4abe-ae4e-99001d93b629","year":2025},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:4297fbd0aea75b97dcdabd56fc70725f6c9462f1fdca798013efe916199979de","observation_id":"7a8e1104-6315-44f5-b626-3e0e40a78f38","resolution":{"observed_at":"2026-05-16T05:37:24.384172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:797112cd441f415340ba72a8bebe281bbdbebdf4ff94328d64b876d301d4f45c","observation_id":"60fc2eed-06da-449b-8601-336ebe4ed3bd","resolution":{"observed_at":"2026-05-16T05:37:24.284160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":"2406.05946","doi":"10.48550/arxiv.2406.05946","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Safety alignment should be made more than just a few tokens deep","venue":"arXiv (Cornell University)","work_id":"40539ea6-b6ba-4195-971b-53c52efa9597","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:3817c5c3b32bc92282e248a3c9546fa938b5a4aef9b5632be1e2c39a4ca44b6d","observation_id":"c534c6af-9e58-40e0-bbba-33d68b94a85d","resolution":{"observed_at":"2026-05-16T05:37:24.169526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3092","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://proceedings.neurips.cc/paper_files/paper/2024/file/ b0bc711f48724237b38823c4d9cee10b-Paper-Conference.pdf","venue":null,"work_id":"4ccb052b-2867-4d20-8384-f9cd1c37533e","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:d608f22fcc210e0541c9bfa1eeaf043423f86bef09453b16003be49bc729d469","observation_id":"91151e86-ecd9-4831-ba26-3afcfa3bc548","resolution":{"observed_at":"2026-05-16T05:37:23.431910Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:a2f7924ec872ce00afd06255c47c818ce6401334a7d78a0b9b532809be1f7112","observation_id":"9cba3312-c59f-443e-ad8b-cee6c8b57291","resolution":{"observed_at":"2026-05-16T05:37:24.395303Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-05T07:46:46.355580Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":"1606.04671","doi":"10.1007/978-3-030-58598-3_10","metadata_source":"pith","pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Neural Networks","venue":"cs.LG","work_id":"0700d73f-b94d-4cd3-be40-086e4c4544c4","year":2016},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:8a2160050dd626ed6eeafa5efd7e4783d70c595615b4248b28f3d1cc5c02d668","observation_id":"a040000d-e1bd-4a67-ba26-a0b2c698085a","resolution":{"observed_at":"2026-05-16T05:37:24.229501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":"1911.08731","doi":"10.48550/arxiv.1911.08731","metadata_source":"pith","pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","venue":"cs.LG","work_id":"b9385d0d-bafd-43d3-8948-4d2da8ee27a0","year":2019},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:9cb4f9d39834f16475a5d2ef37308f1b1b1ab2c2e169dc661d60bdbf5a64cc42","observation_id":"985e76a7-aa02-4e98-b989-56bc3d46651c","resolution":{"observed_at":"2026-05-16T05:37:24.247698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:b68d6dd749b9d307b20627b0e4ff2b89351021d42c46dba238bd920573e4c12e","observation_id":"152bf980-b4ad-4f3f-8360-2edc4efc0855","resolution":{"observed_at":"2026-05-16T05:37:24.217120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12393","last_updated":"2022-10-29T09:19:01Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-24T22:53:34Z","title":"Fine-tuned Language Models are Continual Learners","version":4},"cited_work":{"arxiv_id":"2205.12393","doi":"10.48550/arxiv.2205.12393","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12393","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuned language models are continual learners.arXiv preprint arXiv:2205.12393","venue":"arXiv (Cornell University)","work_id":"74054e77-5861-45c9-8255-43553c3d5985","year":2022},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2205.12393","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:48348787cff83e95b47838086ff605f77dd68085adf5f56084fc909212e9cc6f","observation_id":"430cc406-25a6-4570-bdbb-387d0dce9743","resolution":{"observed_at":"2026-05-16T05:37:24.187688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:086b7b0efea860706cbf1c06f1fcc99922ee2c7cb971fb9d7017ecce30327438","observation_id":"82f7e0a7-e209-490d-bfe8-95b7e96d8bb5","resolution":{"observed_at":"2026-05-16T05:37:24.204851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/16m1058297","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://doi.org/10.1137/16M1058297","venue":"SIAM Journal on Optimization","work_id":"4462d7ea-f7d2-4717-be76-cdd59d5889aa","year":null},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:9456ef7c2b771259b6bd325772d30a6afb58d72f9a60347c81adddc49091c04a","observation_id":"0b4d2595-65fe-4a61-ad00-1e9dd4b490ec","resolution":{"observed_at":"2026-05-16T05:37:23.424772Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/1055678021000034008","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aman Sinha, Hongseok Namkoong, Riccardo V olpi, and John Duchi","venue":"Optimization methods & software","work_id":"062b72ad-19c8-4485-9e24-65983cc0af55","year":null},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:653417afc47bc728c2bc1b2001f26c9cfdf187118dc7d5f07d4d589cf9528918","observation_id":"6438140a-e23d-4e4b-b802-83ede3650685","resolution":{"observed_at":"2026-05-16T05:37:23.440495Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08708","last_updated":"2019-06-14T04:58:55Z","snapshot_observed_at":"2026-08-07T12:40:15.807786Z","submitted_at":"2019-02-23T00:13:42Z","title":"Distributionally Robust Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1902.08708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.08708","snapshot_observed_at":"2026-07-02T16:47:09.214712Z","title":"Distributionally Robust Reinforcement Learning","venue":"stat.ML","work_id":"adf1f3e6-ab39-4dc2-b8ce-c1c6050c5585","year":2019},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1902.08708","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:2b88ad6f1b0d505cecd14f28c11aaa409a680f0442e1ea13b2ebd5cb3ac6d18b","observation_id":"c2d74b44-f3a3-4721-a9c6-bccefb716797","resolution":{"observed_at":"2026-05-16T05:37:24.363375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03329","last_updated":"2019-12-23T04:36:52Z","snapshot_observed_at":"2026-08-05T02:46:51.475659Z","submitted_at":"2019-09-07T20:17:34Z","title":"LAMOL: LAnguage MOdeling for Lifelong Language Learning","version":2},"cited_work":{"arxiv_id":"1909.03329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.03329","snapshot_observed_at":"2026-07-04T06:19:38.015292Z","title":"Lamol: Language modeling for lifelong language learning","venue":null,"work_id":"542bf80f-6023-4915-a4da-f96a6073f344","year":1909},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/1909.03329","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:c19edecf21b0ec6b190358027e82a2e423686ce9f7fcfaa4a014859f315881cc","observation_id":"43fe7f04-86a7-4e31-a4a9-1c34dec6fa4b","resolution":{"observed_at":"2026-05-16T05:37:24.180992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00761","last_updated":"2025-02-10T18:26:14Z","snapshot_observed_at":"2026-08-06T05:53:06.918202Z","submitted_at":"2024-08-01T17:59:12Z","title":"Tamper-Resistant Safeguards for Open-Weight LLMs","version":4},"cited_work":{"arxiv_id":"2408.00761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.00761","snapshot_observed_at":"2026-07-03T17:58:47.266895Z","title":"Tamper-resistant safeguards for open-weight llms","venue":null,"work_id":"216b3b7b-061c-455e-be7b-a6d707795993","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2408.00761","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:099d461a6cc2c867b11e0c1facb5f9154406060f1bd0c1cc83fb8ae40aab600e","observation_id":"3cb9b195-6a58-47f2-9ecf-447dd540ddd0","resolution":{"observed_at":"2026-05-16T05:37:24.175635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11555","last_updated":"2025-02-17T08:40:30Z","snapshot_observed_at":"2026-08-02T05:23:14.694489Z","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.11555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11555","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Equilibrate rlhf: Towards balancing helpfulness-safety trade-off in large language models.arXiv preprint arXiv:2502.11555","venue":null,"work_id":"c407ec9d-a30c-4e86-8b57-ca94ae579d81","year":null},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2502.11555","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:cdf9e1661f5424e5f8986d480c891b39870a7c7ebdfbf919a4101ccfc6f767a8","observation_id":"a2c9efde-983c-4d1b-a6f0-6533b68a3cb2","resolution":{"observed_at":"2026-05-16T05:37:24.193897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01825","last_updated":"2020-09-22T22:41:54Z","snapshot_observed_at":"2026-07-06T09:44:36.129510Z","submitted_at":"2020-08-04T20:57:32Z","title":"Robust Reinforcement Learning using Adversarial Populations","version":2},"cited_work":{"arxiv_id":"2008.01825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.01825","snapshot_observed_at":"2026-07-04T08:49:42.788554Z","title":"Robust reinforcement learning using adversar- ial populations.arXiv preprint arXiv:2008.01825","venue":null,"work_id":"6031d7cb-018c-479b-b20f-332e3daf798f","year":2008},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2008.01825","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:22a74f1334984e7701e9f3a6e121776fc365247a74c89dfcc7d694adcaaae2c6","observation_id":"5cb617dd-44fd-407f-a252-7838b2959ade","resolution":{"observed_at":"2026-05-16T05:37:24.352963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orthogonal subspace learning for language model continual learning","venue":null,"work_id":"6c9906ca-9d69-4a20-9468-64b9f53341c1","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:0ce77c2c9b2fc19d1d8caba22f12805fbfb0c8e70b97978c27307861b42604a3","observation_id":"1422cd46-37eb-416a-b4ef-b2e6a9fe433e","resolution":{"observed_at":"2026-05-16T05:37:24.781137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":"2310.02949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-07-04T09:09:43.659817Z","title":"Y ., Zhao, X., and Lin, D","venue":null,"work_id":"c19e9353-3a5c-4f79-9b83-3a458ebf7c01","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:6cdf1e1760bad79981af295842881b6158acef43f9151702ae6cb4b038ef6669","observation_id":"30a2df69-b7c7-4aa0-bc5f-0db29504e29f","resolution":{"observed_at":"2026-05-16T05:37:24.200106Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-07-06T16:45:20.005195Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2311.05553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-07-04T05:39:40.653733Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":"f4da61dc-85c3-40c0-bd86-4e99e3fcd82e","year":2026},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:0e5bf0eee7163382f4941c04276ab8646dabf8e74874b99562d8c96c792ad552","observation_id":"4f08c312-b145-4507-a47f-db9af96708e9","resolution":{"observed_at":"2026-05-16T05:37:24.223558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08065","last_updated":"2022-03-19T15:56:32Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T16:57:59Z","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","version":2},"cited_work":{"arxiv_id":"2203.08065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.08065","snapshot_observed_at":"2026-07-04T13:09:50.640284Z","title":"Surrogate gap minimization improves sharpness-aware training","venue":null,"work_id":"355ec115-ef7d-4ab1-9f40-bb6fb1e10108","year":2022},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2203.08065","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:2a9a9b5118da8466923af3525727824baf89691d86a2d24f037fa2a5f441a5fc","observation_id":"c14935d7-8666-48bc-a347-a7b9b035360d","resolution":{"observed_at":"2026-05-16T05:37:24.439668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The phenomenon arises because gradient updates for new objectives overwrite parameters critical to earlier tasks (Goodfellow et al., 2013; Kirkpatrick et al., 2017)","venue":null,"work_id":"32a8dd72-cd44-445c-9d3f-f3bba613ef7d","year":1989},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:265884a96fd446647a4d79b156bff89246d6280c4190660d109411ce5f7908b8","observation_id":"9b24b51c-f914-4b40-b6fd-2abe69296052","resolution":{"observed_at":"2026-05-16T05:37:24.774134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c624c44-c248-435f-9412-cbebbf5261ff","year":2017},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:68ba5bd1d4db68c0886b3fb8c710477191dd7efc50ae32b5d62cb643e2ea67b8","observation_id":"aff41f45-2618-469f-8cab-f79b9bb8ae38","resolution":{"observed_at":"2026-05-16T05:37:24.770591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"de5d9353-2d5f-4546-9c2d-c5e451ce121f","year":2016},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:a74b577abcf5146d49c9b6973637c3a2c511ba05d79228b654e11e8901a4c2a3","observation_id":"7c85fcd1-618c-4e7c-ade8-d21749acfce2","resolution":{"observed_at":"2026-05-16T05:37:24.777281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-3.1-8B-Instruct-RM-RB2","venue":null,"work_id":"050a1cfd-6454-460a-b649-4ee271ab264d","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:aa542615a887967dd40a14caeeff99860181bd804e369c8fa01178982a5d1a5f","observation_id":"aec5963e-6f6e-4877-8c56-61fed1cabefd","resolution":{"observed_at":"2026-05-16T05:37:24.764654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"\\boxed{ }","venue":null,"work_id":"4127c60b-7cf4-409f-82c3-9bb1f2e2911a","year":2000},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:6c036f86aa6e789158368ff0b6eb7924c9fd917b39a8042db335c4346087e757","observation_id":"d88f0e38-1922-41e1-9efd-b88963fe09ee","resolution":{"observed_at":"2026-05-16T05:37:24.767696Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-3.1-8B-Instruct-RM-RB2","venue":null,"work_id":"e8ef0441-8a40-4e28-b9bf-21a1877b4302","year":1974},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:801ff1f58964056b517e0aa095efcbae7f4723d41430c8d8037874899bfd2b63","observation_id":"7de89430-bdb8-474f-9de3-2bfbccec6b52","resolution":{"observed_at":"2026-05-16T05:37:24.749224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f9fba0d-f4af-463b-a7b9-044d1b96c385","year":2024},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:4cc1a8c6a8d621b2f8b3b3ad112db008cbd10e09421358bb78d8d5dc9b6f1ecf","observation_id":"1fc2e0c9-cca5-434b-b0b7-0ba562e269a2","resolution":{"observed_at":"2026-05-16T05:37:24.752584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T12:22:42.069570Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":1,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":3,"verified_exact":45,"verified_fuzzy":6},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2602.08813."}