{"as_of":"2026-08-09T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:177efdd16d6aa018bc5e81101624c6493ebbe9418aeaf7ac259ab6847ec28fc6","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:35.041116Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:28.745740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:40:30.509912Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"cited_work":{"arxiv_id":"2505.16869","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16869","snapshot_observed_at":"2026-08-07T12:40:30.509912Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","venue":"cs.CL","work_id":"fb52b9c6-0e04-42c9-aadf-8a9bf3a56544","year":2025},"citing_paper":{"arxiv_id":"2505.24119","last_updated":"2025-05-30T01:32:44Z","snapshot_observed_at":"2026-08-07T23:14:32.953063Z","submitted_at":"2025-05-30T01:32:44Z","title":"The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:28.745740Z"},"links":{"cited_paper":"/paper/2505.16869","citing_paper":"/paper/2505.24119"},"observation_digest":"sha256:6c35944a82fd9cd4e6373d253e6be86567c71dccda95840518fcdc1ed4936061","observation_id":"f39c6eb5-946f-4bb9-a14d-4d9151c1402f","resolution":{"observed_at":"2026-08-07T12:40:30.600320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16869/citation-record","integrity":"/paper/2505.16869/integrity","json":"/paper/2505.16869/citation-record.json","paper":"/paper/2505.16869"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.456676Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.456676Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a64618280aac7d5ccf470b99a2b1cf8549a10002b92facf0412cdd438e8bcc81","observation_id":"497f8a2f-4be6-44e1-808b-3a73f6558898","resolution":{"observed_at":"2026-08-07T14:57:24.456676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.506655Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.506655Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:f457ed2c38b99316f1f03c5dec19dac5951dfb2fb14dfcf5eb725f1df33ac326","observation_id":"7d8ff080-d982-4309-874d-06424dada9cc","resolution":{"observed_at":"2026-08-07T14:57:24.506655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.560690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.560690Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:697bcaffe254eea1dc01f73acc7759a01e281d21cdc0d6de1108de59cb82ef76","observation_id":"8ba7ea19-07cc-4635-b2b1-c6ff5343566f","resolution":{"observed_at":"2026-08-07T14:57:24.560690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.638462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.638462Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:3f113042607d9cad74fe65061eda80117d3d77736a13deef6555f01bb5250981","observation_id":"101214ea-f3e7-4c4c-8879-a7ccb09cf00a","resolution":{"observed_at":"2026-08-07T14:57:24.638462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.710928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.710928Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:b64a5358e4cc71220a7578e090532bbb06c82f477d0d65b6d2a93f763f5398fe","observation_id":"feed01be-d34d-4d8e-953f-9564d0c08325","resolution":{"observed_at":"2026-08-07T14:57:24.710928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.789514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.789514Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:b420b693360f9e333b95f62e4d394fe1faeb3dce45aa4ef28f32c16b89508a39","observation_id":"1665e839-c1eb-424d-bf25-d19453b49c01","resolution":{"observed_at":"2026-08-07T14:57:24.789514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:57:24.858897Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.858897Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:fb6d97b4d9d0e90ae5614a1f903ed51326a5b6d48cff0d60e82ae7e9ec1fc56d","observation_id":"6dbbf828-86a8-466a-a296-16f26c5d8f29","resolution":{"observed_at":"2026-08-07T14:57:24.858897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:24.928984Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:24.928984Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:584d3ba91190bd73b8a602a9d0c8fbb9d8798d3230be64a46558ea1e05d78bb8","observation_id":"0fec29b8-de1f-4aa1-b0f0-702c132c6e64","resolution":{"observed_at":"2026-08-07T14:57:24.928984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:25.018578Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.018578Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:17f86056ba5a7ae1f84707275048da49a6819a86007a42dac4916e346a1f284d","observation_id":"12f72d56-2192-4907-8718-1538c2549aa7","resolution":{"observed_at":"2026-08-07T14:57:25.018578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07900","last_updated":"2025-03-25T22:02:36Z","snapshot_observed_at":"2026-08-05T00:06:48.208467Z","submitted_at":"2024-04-11T16:39:00Z","title":"High-Dimension Human Value Representation in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07900","snapshot_observed_at":"2026-08-07T14:57:25.083248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.083248Z"},"links":{"cited_paper":"/paper/2404.07900","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:877f5df9e410f40d7ba99e53ba8e4bb04c4720b57f96122b4a2dda35fc3e76c6","observation_id":"a4d63cd6-ccee-4efe-850f-e0f976fb48aa","resolution":{"observed_at":"2026-08-07T14:57:25.083248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01252","last_updated":"2024-09-03T07:07:59Z","snapshot_observed_at":"2026-08-07T18:23:20.006325Z","submitted_at":"2024-06-03T12:10:26Z","title":"Towards Scalable Automated Alignment of LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01252","snapshot_observed_at":"2026-08-07T14:57:25.146437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.146437Z"},"links":{"cited_paper":"/paper/2406.01252","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a69bc27528b383ebde1e2b8c3233353def984a8e0e266c1d3f65cb434154bd29","observation_id":"c0f07532-770e-437a-b29d-857be1e23e6a","resolution":{"observed_at":"2026-08-07T14:57:25.146437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:25.231163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.231163Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:77ffd1f12ef5623041953169653d0ab43c1969d2dd6248e77273dd7b67fe8e55","observation_id":"cf229c52-f0ba-4940-9581-9a17bc746fcd","resolution":{"observed_at":"2026-08-07T14:57:25.231163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:25.237978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.237978Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:6363b99785e7f8fdc00da9d2bcb313e4ef5a6ee7925010dd2ae644bbfff4ef45","observation_id":"83067b22-3ba4-4077-ac0e-50b004ede170","resolution":{"observed_at":"2026-08-07T14:57:25.237978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:57:25.242409Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.242409Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:48bc71fefef945ca7ddea6b7c3fbf0f389e6e296154ddc9dcf1506cdbb5f6650","observation_id":"e5f97a93-f886-4890-919f-1b733718782f","resolution":{"observed_at":"2026-08-07T14:57:25.242409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-07T14:57:25.247094Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.247094Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:0369e1f64ebf025c74b1612aa531403e926fc5a7adcf9f0b5eee5f95c786fff6","observation_id":"e64fe45c-a05b-42b3-9423-1ce6b4f9afc4","resolution":{"observed_at":"2026-08-07T14:57:25.247094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:25.351130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.351130Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:851d96dbf55f90c3edd2333e3912fcd148cc40c4eb171b9871023b1d113b64d3","observation_id":"bbf6d2b8-c686-4ffa-98e0-b047983cf746","resolution":{"observed_at":"2026-08-07T14:57:25.351130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:57:25.425024Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.425024Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:445e9f869531845d3d08f6298302aca8e8f9bc665c70ef32e4fd77ab3d572f1c","observation_id":"082310df-b97d-440d-a0f3-52e56812b61f","resolution":{"observed_at":"2026-08-07T14:57:25.425024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:57:25.545583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.545583Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d182535c74e4c7d1bfb4b6de8a0069445189eb707ce7c989c1d5d79e6fc36c45","observation_id":"ba87895d-fe0a-472c-8d90-a6c3d2c913ec","resolution":{"observed_at":"2026-08-07T14:57:25.545583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T14:57:25.700478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.700478Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:808a1e1414897b27e4e752733e246f5e8fad7ced4e86662c7198f78b7749d876","observation_id":"64a5bca5-f1c3-44f1-b169-e5b946ac97e5","resolution":{"observed_at":"2026-08-07T14:57:25.700478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:25.829780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.829780Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:4baa4c02c9d35f25c5470242f08fdb2f120451f321cf4ed64344cac25ed514b7","observation_id":"194804bc-7aad-4459-96e8-2fabf0380569","resolution":{"observed_at":"2026-08-07T14:57:25.829780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15035","last_updated":"2025-06-23T11:45:09Z","snapshot_observed_at":"2026-07-06T20:10:15.143454Z","submitted_at":"2024-12-19T16:46:54Z","title":"LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15035","snapshot_observed_at":"2026-08-07T14:57:25.999616Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:25.999616Z"},"links":{"cited_paper":"/paper/2412.15035","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:767d285e0fd4ff3023e1d7922ea0213b41be28d99fa1d0d8730ffaa7ad329fcc","observation_id":"e9ed2007-fb39-4570-989e-af31e701df1a","resolution":{"observed_at":"2026-08-07T14:57:25.999616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T14:57:26.179526Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.179526Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:682881a2493b923322703a9c2581ba8efead2e89617c4db8fc759d7de84e4a29","observation_id":"1519a9e1-e67b-41f0-9275-d2a1a4517c22","resolution":{"observed_at":"2026-08-07T14:57:26.179526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:57:26.326794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.326794Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:edd747140da904ed07811217467992249648d0f835ea365624be0bc2e4a634ad","observation_id":"99d9834b-ceb7-477c-80bf-12b9c591f53f","resolution":{"observed_at":"2026-08-07T14:57:26.326794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-09T00:20:15.609286Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:57:26.468933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.468933Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:f98a856b112743eb4dfead7b5e5f17f6882f35948d5997da2a4d18e37b855ad1","observation_id":"37779663-14c7-4844-8c03-42accb2ae545","resolution":{"observed_at":"2026-08-07T14:57:26.468933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:26.632423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.632423Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:ab924ff8d7a93b1e6706504f8149710ca1a2c868e34d19720e8d75b9af079ea1","observation_id":"27c48240-013e-4924-a6c1-a6c84b511234","resolution":{"observed_at":"2026-08-07T14:57:26.632423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:26.777808Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.777808Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:deba6022e4603269a5d4415e2e418ad6a8e95197bb58bc2b946dbebd03ccb044","observation_id":"cc08fea9-a032-4b1b-ad7d-9390616c367e","resolution":{"observed_at":"2026-08-07T14:57:26.777808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:26.925931Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:26.925931Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:324cb7d1d38783c76860208a4b1bab4bda7954ca565868a6ece5d8852b589971","observation_id":"85152293-05a5-459a-a684-bd08637f235d","resolution":{"observed_at":"2026-08-07T14:57:26.925931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:27.095791Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.095791Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d561238f9e45ab7dfc6944cc6959f6f0e52ae1bc4d13e387ea22a7f548f4d6ee","observation_id":"f838adc4-e756-4e9d-b604-4ffe7b8e99cb","resolution":{"observed_at":"2026-08-07T14:57:27.095791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18027","last_updated":"2025-01-23T13:20:41Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:00:13Z","title":"Cross-lingual Transfer of Reward Models in Multilingual Alignment","version":2},"cited_work":{"arxiv_id":"2410.18027","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18027","snapshot_observed_at":"2026-08-07T14:57:35.772533Z","title":"Cross-lingual Transfer of Reward Models in Multilingual Alignment","venue":"cs.CL","work_id":"af05da8e-55a8-4a95-94e2-bd40fdf644a1","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.179834Z"},"links":{"cited_paper":"/paper/2410.18027","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:669ad00a6c1a2f5b1b5420f88914a2a4b66070161833cebea8209c3c3a325155","observation_id":"f7d3b16e-c508-4aae-a349-25bdfd37f0d1","resolution":{"observed_at":"2026-08-07T14:57:35.859818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:42.460899Z","title":null,"venue":null,"work_id":"0321b686-53df-4335-af06-ee528397357c","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.271141Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:4488f523f28dfaa387a3c6b4b2f295b42c695a59335512ddc3eff78efa4c54c1","observation_id":"6018cc7a-1e68-4d15-b2b2-eebc2bfd3394","resolution":{"observed_at":"2026-08-07T14:57:42.643686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16655","last_updated":"2025-03-03T15:56:11Z","snapshot_observed_at":"2026-08-04T12:45:11.630620Z","submitted_at":"2024-06-24T14:03:04Z","title":"Large Language Models Are Cross-Lingual Knowledge-Free Reasoners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16655","snapshot_observed_at":"2026-08-07T14:57:27.400236Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.400236Z"},"links":{"cited_paper":"/paper/2406.16655","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:23290212a3714fd6eef1fa06cf75c1b77aef31e74c0485b4a4713f1e36b1aa6d","observation_id":"5473e744-cacd-48aa-9108-265a17e89494","resolution":{"observed_at":"2026-08-07T14:57:27.400236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:42.165772Z","title":null,"venue":null,"work_id":"1ff109a0-4bfb-4746-9da9-91e92c36f014","year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.535161Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:8254521813eac6d0a9c39af6de6d38ac7477741757aa85a277dddc1cb9fb9d96","observation_id":"9fc2c1ab-27eb-43a6-b243-7544099e38f0","resolution":{"observed_at":"2026-08-07T14:57:42.282021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:41.873307Z","title":null,"venue":null,"work_id":"af6b211b-bc69-432a-b9ed-95336e4565ce","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.723880Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:f2adaab2cff0d6a861ee848d47cc86c9da0485d6e1569e0a89d147013f0503cd","observation_id":"59fbe1ef-b02a-452d-87d1-4cc44a803892","resolution":{"observed_at":"2026-08-07T14:57:41.996094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T14:57:27.885966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.885966Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:cf7c29af78fb38502b800259242fdae635a2fbd93fc60046c74f102de89ccd7b","observation_id":"795a9b5c-9ae4-401d-9fa3-edf03b080874","resolution":{"observed_at":"2026-08-07T14:57:27.885966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:57:27.997377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:27.997377Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:fdc51d9919a70931f80eb080e9e243fe4e1b8aa90ba9bd51797a90d626f158ed","observation_id":"77a6aafa-f178-4bd3-81f8-03eed46059fd","resolution":{"observed_at":"2026-08-07T14:57:27.997377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:28.119956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.119956Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d9c75cadcbd65f8f110dc914fbd324e07721f6b95cd27a9e86a01373d01a7e9a","observation_id":"056051c0-a66a-4d0d-9f71-50200e298291","resolution":{"observed_at":"2026-08-07T14:57:28.119956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:41.596472Z","title":null,"venue":null,"work_id":"f0dafc41-b8e4-4fb1-af8d-4ab0fe3cffae","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.280548Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:e9ae3b2ca2b72b2c52f9476ba2fc2560cd1c343b2fbfea3c8347fcb4ced3c9a6","observation_id":"6c708738-64a1-4aa6-a72f-3d5b4a647a6c","resolution":{"observed_at":"2026-08-07T14:57:41.722080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:28.395465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.395465Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:79a3bbe480eccf3fe04aac840209de013fe424ffab49d81d9a5d97953b7c9eee","observation_id":"60600cb9-d31f-4b29-a573-cad06695cfcd","resolution":{"observed_at":"2026-08-07T14:57:28.395465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16765","last_updated":"2024-01-30T06:04:04Z","snapshot_observed_at":"2026-08-06T05:07:17.837298Z","submitted_at":"2024-01-30T06:04:04Z","title":"A Cross-Language Investigation into Jailbreak Attacks in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16765","snapshot_observed_at":"2026-08-07T14:57:28.564672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.564672Z"},"links":{"cited_paper":"/paper/2401.16765","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:4b206408d1d584591f97edfdfc60225545c93e9e9a95136c74c825e1130534fa","observation_id":"a4fc7b8f-d925-4471-ba70-edfcde93d668","resolution":{"observed_at":"2026-08-07T14:57:28.564672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15762","last_updated":"2025-06-03T11:45:34Z","snapshot_observed_at":"2026-07-06T19:20:59.607725Z","submitted_at":"2024-09-24T05:38:33Z","title":"XTRUST: On the Multilingual Trustworthiness of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15762","snapshot_observed_at":"2026-08-07T14:57:28.698812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.698812Z"},"links":{"cited_paper":"/paper/2409.15762","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:e0fc5ee1227b21b284b267df450b0cfabbcfc80f64556f8f00cfb597d9b957d1","observation_id":"f6997dc8-bd11-4a18-84a8-8ffee63b9d80","resolution":{"observed_at":"2026-08-07T14:57:28.698812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10258","last_updated":"2025-04-21T12:52:49Z","snapshot_observed_at":"2026-07-06T17:45:15.311629Z","submitted_at":"2024-03-15T12:47:39Z","title":"Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10258","snapshot_observed_at":"2026-08-07T14:57:28.808252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.808252Z"},"links":{"cited_paper":"/paper/2403.10258","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:ddc656cdb752c4b9fb143008f1d5ad283e58631ea159915308f5ce38092e5811","observation_id":"38a24934-5e02-4b88-859c-2fb5741f9951","resolution":{"observed_at":"2026-08-07T14:57:28.808252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-07T14:57:28.962243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:28.962243Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:0a9dbdac9aee9467acf62a5b17910b11e0d9c628af1677182dbf466ffd2ef6de","observation_id":"6852c46f-e6fb-4d63-972d-aac640c962ee","resolution":{"observed_at":"2026-08-07T14:57:28.962243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T14:57:29.123942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.123942Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:db58975cb9c45ff83d985eb963f5f05a71ef513e6315e61df1573d2decb418a8","observation_id":"6756cf52-6e94-4b84-9ade-83efaeb08cc7","resolution":{"observed_at":"2026-08-07T14:57:29.123942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:41.299370Z","title":null,"venue":null,"work_id":"0f5954ff-4267-496c-b493-415722772570","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.232511Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a422f181b1e64b007cbc8bb982de640a05be25b5bb49204cc644a707faccd087","observation_id":"b342a0da-fb0a-4358-b2ad-f005862cef9a","resolution":{"observed_at":"2026-08-07T14:57:41.424966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:40.983451Z","title":null,"venue":null,"work_id":"3010f5b9-f226-4ecf-a4a7-fc32b23f268f","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.400722Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d51a318ae594505b55bab2dccc02936f97b126ca78db3ce614ffd3f9b567e35f","observation_id":"b099331d-2fcc-4156-baf3-2a36470ed34d","resolution":{"observed_at":"2026-08-07T14:57:41.127182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:29.548473Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.548473Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:ea9f01ecd14499e1dc2240d99b0a581622175b13f73281cef5bb14480c7ebfd9","observation_id":"a2decc0f-9639-4fac-ade4-88e2134b45ba","resolution":{"observed_at":"2026-08-07T14:57:29.548473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-08T10:19:27.268855Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-07T14:57:29.682556Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.682556Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:e22c25356cb14e9d45621211d47e4823217f7e8f99214f72e086ea3e9bad7de2","observation_id":"fbf0c15e-e879-4f34-b07e-e854e4c04e5f","resolution":{"observed_at":"2026-08-07T14:57:29.682556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18210","last_updated":"2025-02-27T19:17:13Z","snapshot_observed_at":"2026-08-08T15:39:03.591016Z","submitted_at":"2024-10-23T18:27:36Z","title":"Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18210","snapshot_observed_at":"2026-08-07T14:57:29.830816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.830816Z"},"links":{"cited_paper":"/paper/2410.18210","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d610780932d7f5c40f82a8390654e112d504f2a249b0fbb4a819a784002edac9","observation_id":"ef3b0565-4d01-47e9-94ed-130ff597e838","resolution":{"observed_at":"2026-08-07T14:57:29.830816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:40.617289Z","title":null,"venue":null,"work_id":"24ea71df-daaa-45cf-8a54-9fcd368d9b2b","year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:29.980995Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:87ec6b123507514999460567fc0d7b5641734155d9c17eb9757504a2e22c9eb4","observation_id":"384696c4-80c4-4884-bf73-dfba6942dba1","resolution":{"observed_at":"2026-08-07T14:57:40.768641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04925","last_updated":"2024-04-07T11:52:44Z","snapshot_observed_at":"2026-08-09T02:23:58.261214Z","submitted_at":"2024-04-07T11:52:44Z","title":"Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04925","snapshot_observed_at":"2026-08-07T14:57:30.121689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.121689Z"},"links":{"cited_paper":"/paper/2404.04925","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a07132683bb856f50a59bdf9fc095864fca000af4ec546e573610ef1917f487c","observation_id":"4f0628ee-8b9d-4e35-8257-3542d0c58060","resolution":{"observed_at":"2026-08-07T14:57:30.121689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:30.298858Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.298858Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:316d0be517479d9da1345f7d7b58fcf2aae88d023437f36300294c1f34b6876c","observation_id":"e3675735-891f-41a6-ae51-9e41d4ac6c9e","resolution":{"observed_at":"2026-08-07T14:57:30.298858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08097","last_updated":"2024-06-21T06:06:51Z","snapshot_observed_at":"2026-08-03T17:21:08.126211Z","submitted_at":"2023-11-14T11:49:43Z","title":"Empowering Multi-step Reasoning across Languages via Tree-of-Thoughts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08097","snapshot_observed_at":"2026-08-07T14:57:30.449159Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.449159Z"},"links":{"cited_paper":"/paper/2311.08097","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:6b75aa4eae73b10c98203f381dc0bae27b5ac74fc1cc8c95a7f99bb0da7c802b","observation_id":"e6d4bbd5-aa18-4d50-9cd0-67a9bf82f9e4","resolution":{"observed_at":"2026-08-07T14:57:30.449159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:40.253621Z","title":null,"venue":null,"work_id":"3d8718e7-57a3-4cb3-9933-e929ab61c6e9","year":2020},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.555277Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:b93defb20e4e2c5b6a9b823e1e5a2a06fbf6f27aba9406892d4500bf34fa7621","observation_id":"88739229-8381-4a4e-85a7-b44baa333377","resolution":{"observed_at":"2026-08-07T14:57:40.466984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:39.847502Z","title":null,"venue":null,"work_id":"f86ebaba-71c3-401f-95a5-6410ed4bdd9c","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.639912Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:4228be8c3b07951f3627f6bfca5eca425bc03e5f6e0be803f6b98bc15a31ed45","observation_id":"e58de1f1-48ac-4cc7-aad1-602ef4fb59a4","resolution":{"observed_at":"2026-08-07T14:57:40.070819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T14:57:30.769929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.769929Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:3f8d17c74189c6a2f0a316c27af3ae5b22d4fb9e13a05f604ba3289052871467","observation_id":"c8df08d7-fa7c-40af-90c7-3558c8025d87","resolution":{"observed_at":"2026-08-07T14:57:30.769929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:39.456814Z","title":null,"venue":null,"work_id":"f3260739-9619-497a-ab62-dc9fdfd05e4d","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.899444Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:67cd9ded0e3a98e0efde241b7fcf4b0db96e6135b8d732eb78e9769dcffd6f07","observation_id":"8fc3bb9f-9dd6-404b-a077-7627ad067481","resolution":{"observed_at":"2026-08-07T14:57:39.626610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:39.234314Z","title":null,"venue":null,"work_id":"fd4e069c-ed01-41f8-9b73-7be39084ef41","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.003328Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:9c2f6b4d46f439d2e3981af015f8e5c639ca9b61db4c3ccff7bca49cc4a11f77","observation_id":"4de1f0e2-1706-42eb-8b7b-7bc3a58cc799","resolution":{"observed_at":"2026-08-07T14:57:39.329803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:31.111817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.111817Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:60b7b7583adc875cf7ee46cac482245c6f44e6bcf606bf385d3f4c6f1bf156ff","observation_id":"ca5ac8a9-eedd-41b3-9250-b13f49a36cb8","resolution":{"observed_at":"2026-08-07T14:57:31.111817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T14:57:31.186800Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.186800Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:2eede4a30e47b0aa6e723e5ec7752d2dec00908af1ed16135805261f91346156","observation_id":"6b1f4f8d-a4ec-484e-8542-d04f3331f5f3","resolution":{"observed_at":"2026-08-07T14:57:31.186800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:38.923510Z","title":null,"venue":null,"work_id":"cf90f998-a0ed-4908-9c51-6240490e5514","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.263035Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:3bb7fd70c9a99d98bc8f953d8e7a7465085926012235bfc54e2713ca57bad12f","observation_id":"874b778a-127d-433c-a680-7b50424dacba","resolution":{"observed_at":"2026-08-07T14:57:39.093873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07342","last_updated":"2024-07-10T03:26:15Z","snapshot_observed_at":"2026-07-06T18:43:59.807904Z","submitted_at":"2024-07-10T03:26:15Z","title":"Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07342","snapshot_observed_at":"2026-08-07T14:57:31.334455Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.334455Z"},"links":{"cited_paper":"/paper/2407.07342","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a8c8fa260820f65b2ef7127919ff6752ada080d9e7a080230e39f2f2b060b716","observation_id":"a8d89031-663a-45ff-bf7d-17a612ed4ac4","resolution":{"observed_at":"2026-08-07T14:57:31.334455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05070","snapshot_observed_at":"2026-08-07T14:57:31.395223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.395223Z"},"links":{"cited_paper":"/paper/2402.05070","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:e19fc049de909807bc33ce0945a65c4739d2ef19d01fe6e9f36956f27079e490","observation_id":"53a3215f-2213-4b49-b398-321db234a88a","resolution":{"observed_at":"2026-08-07T14:57:31.395223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T14:57:31.492367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.492367Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:70421a8e274d8956f14532b94c0b627218246ae24f01fe8830162500988cecb4","observation_id":"9087105a-3423-49a5-bdc5-2a49c9149be9","resolution":{"observed_at":"2026-08-07T14:57:31.492367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:57:31.599783Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.599783Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:789a257ec2e4cec6a81baa5f82a5c955e5f6ddf93290ae837ff029c6cdf826bd","observation_id":"e4fcae0e-8798-4418-a31d-f7ec5f352c37","resolution":{"observed_at":"2026-08-07T14:57:31.599783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:57:31.698375Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.698375Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:ff531f59c8b73dd988ad57a7a8e16f2a281e1c06615af2a3c1dd87dfd8c3d234","observation_id":"c3bb1a22-1236-41ba-8813-f422d8b6ad35","resolution":{"observed_at":"2026-08-07T14:57:31.698375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07242","last_updated":"2024-04-09T18:29:42Z","snapshot_observed_at":"2026-08-04T16:37:29.435784Z","submitted_at":"2024-04-09T18:29:42Z","title":"Sandwich attack: Multi-language Mixture Adaptive Attack on LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07242","snapshot_observed_at":"2026-08-07T14:57:31.771057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.771057Z"},"links":{"cited_paper":"/paper/2404.07242","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:4e741184e0f44620804f5be3c28e08f5eb9302584fdb805721573ff0c26da567","observation_id":"193c4fe7-28da-4ff6-8839-9e5ff3ab131a","resolution":{"observed_at":"2026-08-07T14:57:31.771057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02708","last_updated":"2025-04-03T15:46:46Z","snapshot_observed_at":"2026-08-07T16:11:03.851526Z","submitted_at":"2025-04-03T15:46:46Z","title":"The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02708","snapshot_observed_at":"2026-08-07T14:57:31.833322Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.833322Z"},"links":{"cited_paper":"/paper/2504.02708","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:efc04fd95a06abc855bdc966ad80b42b9f6728634951e65bbe7d970490530d59","observation_id":"6f0334cc-3ba2-4641-91e9-6318de668604","resolution":{"observed_at":"2026-08-07T14:57:31.833322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-07T14:57:31.942943Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:31.942943Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:acbebb2fb018200b4b58d9d8a4b652470d850a8386c8a62a1b34f951cf3668bd","observation_id":"987cc69d-84de-4dab-9a7e-544ac5e73b2c","resolution":{"observed_at":"2026-08-07T14:57:31.942943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:32.142229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.142229Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d660b4a2a204673f458d4c1198c27632e7696c4fa9b10fd4c365e011534f5639","observation_id":"f0a359a9-4859-48a0-a56e-c182e408bc33","resolution":{"observed_at":"2026-08-07T14:57:32.142229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:38.687665Z","title":null,"venue":null,"work_id":"427a5e96-6c13-4a56-b358-682ce6280f07","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.231104Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:f689e5f9bb1a8e6fb8c4ef6ce4bc639768343b2a3c57ac2d83368caaeca1c355","observation_id":"ebc27f3d-3bfd-4ef4-8a68-cc192a5a3bd2","resolution":{"observed_at":"2026-08-07T14:57:38.802200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:32.346784Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.346784Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:7a845043841a1dfe515a90b70c49cf85aaa227b55a25284cd672e08d7511a787","observation_id":"aa0da394-8c4e-45e9-b174-c1d39e70a3b9","resolution":{"observed_at":"2026-08-07T14:57:32.346784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10148","last_updated":"2025-07-19T03:40:37Z","snapshot_observed_at":"2026-07-31T17:19:15.491176Z","submitted_at":"2024-10-14T04:29:57Z","title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10148","snapshot_observed_at":"2026-08-07T14:57:32.415979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.415979Z"},"links":{"cited_paper":"/paper/2410.10148","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:f41861a7b321b4b74e790789f22153cb5c64c325c9b5a2692851a32f2aaaf602","observation_id":"e2f53a85-0537-4637-9bee-cbda48e618e1","resolution":{"observed_at":"2026-08-07T14:57:32.415979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T14:57:32.545303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.545303Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:3bd8188fd8489bb06d2878745af440cfda4aaf82efaad56b7e82ae1b4613ca19","observation_id":"a3c0d95a-bbe3-4757-a3eb-a969bc83ffcc","resolution":{"observed_at":"2026-08-07T14:57:32.545303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:38.445594Z","title":null,"venue":null,"work_id":"911e8a7a-fd40-4a4e-b6c1-ecac1028ec21","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.641698Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:b5c871e7df089670712a4afd48175337e43abfb2790cc9a75377e5735a54c693","observation_id":"04a79900-4a94-4c93-a31e-935cc8f187b0","resolution":{"observed_at":"2026-08-07T14:57:38.556358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:38.148699Z","title":null,"venue":null,"work_id":"267f0c37-7c10-4553-8768-8e96e13c1315","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.766000Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:46edddc14433d81ed53be5522103f1f483c0e5e59119168687e4ef04da861f8e","observation_id":"da0f5f37-1f7c-4240-8dd9-790546c4e401","resolution":{"observed_at":"2026-08-07T14:57:38.263191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:37.904535Z","title":null,"venue":null,"work_id":"4ba030ce-6107-48d2-9451-d53b16a17730","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.862330Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:c5ae49bc69e9f8f302357f5c30c4a60ad050c2ea046f93c70569aed3b93a1548","observation_id":"bb475938-3de4-4752-894b-27492d3a2540","resolution":{"observed_at":"2026-08-07T14:57:38.022571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:57:32.944119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:32.944119Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:252e35092be41d006c473d56036afeec0f545f0c549c6560a84bb6baecfd661b","observation_id":"007606b7-0f54-4940-9364-ad318506c3f5","resolution":{"observed_at":"2026-08-07T14:57:32.944119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08964","last_updated":"2025-02-26T12:39:40Z","snapshot_observed_at":"2026-07-06T19:31:53.397265Z","submitted_at":"2024-10-11T16:32:05Z","title":"Language Imbalance Driven Rewarding for Multilingual Self-improving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08964","snapshot_observed_at":"2026-08-07T14:57:33.067658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.067658Z"},"links":{"cited_paper":"/paper/2410.08964","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:2e8c7a5924511a99c910dd4e2c7c300f9ebff00538ce5f408a7339409528ff82","observation_id":"fd3fe851-ca50-4459-86c0-eb3284e68f77","resolution":{"observed_at":"2026-08-07T14:57:33.067658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:37.614355Z","title":null,"venue":null,"work_id":"0c1e4f98-250c-48fc-b6d9-f5fd9fdf50c6","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.135246Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:3e22b7ccaffebf7c7de1bb1407752dfdf41cfec9d389b48bef9baf0dabe835be","observation_id":"5c602530-3321-4d28-9ae1-49550853a256","resolution":{"observed_at":"2026-08-07T14:57:37.745551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T14:57:33.230366Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.230366Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:7e99f32538bcd0dd88fe1288ce2a5ef993a4565bd390e65d5d4b51c8e9b5cb21","observation_id":"459f7de1-50a4-4bb5-9cef-4d70061f5343","resolution":{"observed_at":"2026-08-07T14:57:33.230366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:37.336714Z","title":null,"venue":null,"work_id":"f4d1aac3-c330-4953-9a2d-6d0e4d2b3d78","year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.310420Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:49f12f06cc4b55f493f4ece129cca4cf6ff70afaff0b9167f4540a14207d8904","observation_id":"a0e9820d-b1af-4b14-b87b-4f900dcabd39","resolution":{"observed_at":"2026-08-07T14:57:37.446554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15481","last_updated":"2025-06-11T05:32:09Z","snapshot_observed_at":"2026-07-06T18:35:08.874127Z","submitted_at":"2024-06-17T06:08:18Z","title":"Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15481","snapshot_observed_at":"2026-08-07T14:57:33.437094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.437094Z"},"links":{"cited_paper":"/paper/2406.15481","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:de4abed23ffa38eedc8e0282eda76ab92eedb2a93e446a774fc33486f6e1a3bb","observation_id":"bf04a478-53f7-4b9a-a795-3d434d2f7093","resolution":{"observed_at":"2026-08-07T14:57:33.437094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:37.170513Z","title":null,"venue":null,"work_id":"9806854a-4762-42e7-9406-48f4c295663f","year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.534688Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:9550c5a17bda23604b37f1e30090043bff9e87770b5b00c9ac0847cb5f1f3c7b","observation_id":"ded7f472-70ec-4d01-873b-b688b89c4823","resolution":{"observed_at":"2026-08-07T14:57:37.243436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:33.625408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.625408Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:dd9108fb07bf102f5736f3e1b9917e816c9eca68aeee310ff83c7269e0887e27","observation_id":"762e112c-6610-4c75-b25f-36d6adf96db2","resolution":{"observed_at":"2026-08-07T14:57:33.625408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:37.002779Z","title":null,"venue":null,"work_id":"990c1bbc-9e2b-4260-bc2b-2e63c7944f26","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.723261Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:87d033720189cf4bc1a6e3006199caf1384fd1393e4880525b1610be28733d2d","observation_id":"242a42a7-3c4e-4fa1-8577-1062d1e4b100","resolution":{"observed_at":"2026-08-07T14:57:37.073604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:36.847822Z","title":null,"venue":null,"work_id":"e36f7371-b6e0-45f1-88f4-c01aaf46aa30","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.844818Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:0e3811701a7ee073c55cbfd33ac192ef44155c9428d615f9cc1093902d69c0dd","observation_id":"aa8c5c34-ff28-4625-a657-1dcddd708dd8","resolution":{"observed_at":"2026-08-07T14:57:36.909689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04407","last_updated":"2025-05-26T07:36:38Z","snapshot_observed_at":"2026-07-31T11:45:50.511293Z","submitted_at":"2024-10-06T08:51:30Z","title":"Lens: Rethinking Multilingual Enhancement for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04407","snapshot_observed_at":"2026-08-07T14:57:33.978484Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:33.978484Z"},"links":{"cited_paper":"/paper/2410.04407","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:cd481c1272c324584c90e05874801a0dc60e46f24ead6f4256209445149e6993","observation_id":"43b95a2c-098d-411b-bbbd-227a6a8f75c3","resolution":{"observed_at":"2026-08-07T14:57:33.978484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:36.685638Z","title":null,"venue":null,"work_id":"b5ed3ba3-a466-44b0-befb-96760a139203","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.104597Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:d9d6a0c65ab4af1da812bfddfd5edae7c75b66dd7d9ccf6a9f1fcd5d1a213b14","observation_id":"0996711a-353a-46f7-8ebf-30c5f8f3ac44","resolution":{"observed_at":"2026-08-07T14:57:36.751044Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:36.523236Z","title":null,"venue":null,"work_id":"cab7e178-fbdb-43f7-aa4c-b9a861cc4073","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.237330Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a424ea14ff616d24fe09c6acfa7cbfe6a0b380a4768fa97a0e4a99d753a03472","observation_id":"18767a1e-5f4c-48c5-a02f-551c7436fa5a","resolution":{"observed_at":"2026-08-07T14:57:36.593780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:34.362206Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.362206Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:754ae110a13b20a52b2b8eb9caedb66d0a31428eb6a777bd85582259ae11c24d","observation_id":"dda1918c-bb5b-4f74-bd1a-c2ca0568c75f","resolution":{"observed_at":"2026-08-07T14:57:34.362206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:36.369770Z","title":null,"venue":null,"work_id":"6506f649-2847-470d-96d3-c6448c5f0fd4","year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.468892Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:65192ccaa166f5fbbf3d89c99f888466ce2dd7591f403d6d1a7fe0681ea2f8f9","observation_id":"e49b728a-c5be-4450-b589-1482d296fa00","resolution":{"observed_at":"2026-08-07T14:57:36.434984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:57:36.196773Z","title":null,"venue":null,"work_id":"a7b2fe08-3962-4f80-a433-0a574ef3bf9e","year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.623028Z"},"links":{"citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:a0129457936d33f025999572ac027566be6111fb3d9efabf68f9fdee3fc6e6f4","observation_id":"ce17b9a4-ba83-4304-98ee-e311c9930fe7","resolution":{"observed_at":"2026-08-07T14:57:36.264145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04370","last_updated":"2025-02-05T11:03:08Z","snapshot_observed_at":"2026-08-05T10:24:35.226633Z","submitted_at":"2025-02-05T11:03:08Z","title":"DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04370","snapshot_observed_at":"2026-08-07T14:57:34.760038Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.760038Z"},"links":{"cited_paper":"/paper/2502.04370","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:823f48b9bf24845a9b0eb21cc98d6605b07ed02ec14df6845beed3120b1a4856","observation_id":"71142e03-05df-428c-8bc1-c5e1e97b0b1f","resolution":{"observed_at":"2026-08-07T14:57:34.760038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T14:57:34.857649Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:34.857649Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:171730b8d77f60ceef109644f2e6cbdeeb9b39ef54bcf5dff5943f6b44eb322e","observation_id":"d101f4e2-d9d3-45d7-85ec-90e4347e6dea","resolution":{"observed_at":"2026-08-07T14:57:34.857649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-07T14:57:35.041116Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:35.041116Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:e24e1d3a6a05391ef9181c01f471d9de3605d119b33203216fcf1fe684b34b37","observation_id":"956e5001-0899-4a2b-8aed-3b38f92ab001","resolution":{"observed_at":"2026-08-07T14:57:35.041116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 1 inbound Pith citation observation for arXiv:2505.16869."}