{"as_of":"2026-08-11T01:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da684a763a0181f7eaa51a123dad8ded48820c741f227a23c74278cb05e1380e","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:14:31.076067Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.00689/citation-record","integrity":"/paper/2605.00689/integrity","json":"/paper/2605.00689/citation-record.json","paper":"/paper/2605.00689"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt5 system card","venue":null,"work_id":"f1e3e8e8-745f-4b8e-b006-67504213ec01","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:523047989f9ff4cc8b8f0b42ceab4e63008ab5973270f0924338c53db569f85e","observation_id":"dbf7c867-4046-4f18-b971-9058db8276fa","resolution":{"observed_at":"2026-05-25T21:56:19.643832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3 pro model card","venue":null,"work_id":"0915729d-f78c-4c63-ba48-2ef567b76a50","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:0ea32d3c726d06c62b4dc26a5b6b471649880c29502c4474e58c42ab539dc11c","observation_id":"bfe9f411-a038-4311-bd79-dc0990d226c4","resolution":{"observed_at":"2026-05-25T21:56:19.652690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta llama guard 2","venue":null,"work_id":"a98a326b-98b1-41d0-862e-bdc79c5df471","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:fe2b33da7a1793299720f1c5f7395c9058987ad2840751b1305ef034def4b896","observation_id":"c84a14e1-1a4f-44bb-8b48-fe2b0919d5cc","resolution":{"observed_at":"2026-05-25T21:56:19.664154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aegis2.0: A diverse ai safety dataset and risks taxonomy for alignment of llm guardrails","venue":null,"work_id":"3a916b5b-d5f9-4552-9a5f-7219fc0a04ee","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:b795e00e55618627213350ca9ec5b539ea223985f4e58ff3041610e64699d2b1","observation_id":"bccae67a-138c-4612-b84e-c10de03efbc0","resolution":{"observed_at":"2026-05-25T21:56:19.683922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.05163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:07.654177Z","title":"InThe Twelfth International Con- ference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11","venue":null,"work_id":"f9f51d6b-8a84-4f18-a9d8-9428e01b8ade","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:4124b80a64fe3cc87c52c544d28820580cbb5d380f0096cd31c793011aeb1a28","observation_id":"7692d6f4-10db-4e08-9b35-7c583873b478","resolution":{"observed_at":"2026-05-11T15:47:04.896363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polyguard: A multilingual safety moderation tool for 17 lan- guages","venue":null,"work_id":"0c90bdf4-b5b9-41f6-84b6-c5bd20c6d10d","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:1d86162139e17e572abdeb933adadebf70f395d1a7bceac9767906acadf9e309","observation_id":"9572f68d-7634-4fff-a245-4aea309d24bb","resolution":{"observed_at":"2026-05-25T21:56:19.710886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:0c04289c4f8371b83c657c77722a20e3765ac054e988516b9831be55152b7f7c","observation_id":"6ee575a7-71b0-483c-b980-ac83ad56f12c","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eu ai act","venue":null,"work_id":"62f8d044-f403-448e-93cb-1d0b7f2e974f","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:f1798d9b02821076be1f29d31220dd385251ee0ab877fd844cecc552950f7444","observation_id":"f5de8075-f32e-408f-b0b5-fc452f05210f","resolution":{"observed_at":"2026-05-25T21:56:19.628986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.01710","doi":"10.48550/arxiv.2508.01710","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joshi, R","venue":"ArXiv.org","work_id":"046ba61c-2b98-4f6d-891e-3d62abbacb51","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d73c7ea50a3e5dca785deb6ab25900306223069dc8cac26137545b22fb47289f","observation_id":"a6439295-2e7f-4e83-b61e-b7a056f425b5","resolution":{"observed_at":"2026-05-11T15:47:05.088390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rtp-lx: Can llms evaluate toxicity in multilingual scenarios? InAAAI","venue":null,"work_id":"277338d3-822b-495c-a3c8-2bb6bf914886","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:0ce4309aa767bf6062eb95cf8002378073f137442aff9deed947195c1bbf97ca","observation_id":"ae71efff-2331-4a56-b63e-696b5c59875b","resolution":{"observed_at":"2026-05-25T21:56:19.636572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polyglotoxicityprompts: Multilingual evaluation of neural toxic degeneration in large language models","venue":null,"work_id":"9a27631f-b3a4-4140-9045-bad0780d4ccc","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:4b1d23cd496601647c692fbddfc586ecb008c667a10c5f7362fd7c47414d1418","observation_id":"cec8f723-e7af-41c0-b763-21d565f26210","resolution":{"observed_at":"2026-05-25T21:56:19.621629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multilingual blending: Llm safety alignment evaluation with language mixture","venue":null,"work_id":"05ae48ae-ace7-4e42-befe-ff930252436e","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:cfba1c3791ec26d5248231f1e516f8356f19057d208c578d68e469fe4af3c470","observation_id":"26bc4f88-ae2f-4c1e-b1af-9079f8a5bb03","resolution":{"observed_at":"2026-05-25T21:56:19.504981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12733","last_updated":"2025-08-27T12:21:20Z","snapshot_observed_at":"2026-08-05T19:20:43.755008Z","submitted_at":"2025-08-18T08:59:01Z","title":"LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2508.12733","doi":"10.48550/arxiv.2508.12733","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12733","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.48550/arXiv.2508.12733 , abstract =","venue":"arXiv (Cornell University)","work_id":"75233359-f2af-4aa0-86fb-a8f2c1005421","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"cited_paper":"/paper/2508.12733","citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d98c9284155b311bfa8cdca47c19ee6d7e1385263a40a2246a9903e2c9b84259","observation_id":"4f8522d9-d01a-46b1-a329-8a81b76581fd","resolution":{"observed_at":"2026-05-11T15:47:05.810661Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:29.660657+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:29.660657+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All languages matter: On the multilingual safety of llms","venue":null,"work_id":"ad37a0e6-778a-479f-a671-2a5281df45ad","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d9ec0703349143b1fed31b4d6da2876183a37d6004639668c5148c3e07fe6104","observation_id":"8c1f389d-771b-4170-8fc6-6ccdb87f8028","resolution":{"observed_at":"2026-05-25T21:56:19.606193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multilingual jailbreak chal- lenges in large language models","venue":null,"work_id":"5fb63ba8-c56f-4110-9e69-b7cadbd55a28","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:63fc438f60c9b554079604e016d925ec7248121f47cddb912fc0ca3236b5ed88","observation_id":"7878118f-30f7-4d2a-aca3-9d8aca38be7a","resolution":{"observed_at":"2026-05-25T21:56:19.613890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta llama guard 3","venue":null,"work_id":"c5566b84-789b-4e39-bd1c-d4aca6fe1c39","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:5dcb3680fb916cbed1b52d6409a31908daada4f9228c2fb223737a02b55b6808","observation_id":"ced81b66-1487-40d7-9629-f050518aa71f","resolution":{"observed_at":"2026-05-25T21:56:19.617633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama guard 4 model card","venue":null,"work_id":"bde65971-a40f-49e0-aaec-3ef5f5d59c06","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:9648c474cfc68cd54a0a3a23cb1ccc33bd6fdee767c0bc34d5d77383be35119d","observation_id":"19672b90-168b-42ff-918d-18b776a2780a","resolution":{"observed_at":"2026-05-25T21:56:19.609789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mrguard: A multilingual reasoning guardrail for universal llm safety","venue":null,"work_id":"8204204d-d028-40c6-9798-42539904a1f9","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d8ee329825e23046cebd5804080b402ef3ebdc556c92cc6aadbfec99f1b84d0f","observation_id":"659c54ec-38c1-42b1-bbbd-a90536dad5fb","resolution":{"observed_at":"2026-05-25T21:56:19.632567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt-oss-safeguard","venue":null,"work_id":"d2d9a73a-118c-4944-902e-6e3172e3071c","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:6cf2ac3319de6867e3afd948613e186e335fd9b89599e2705788d1740f02385b","observation_id":"37cd6d0c-67a9-40c2-8824-09eaea70f79f","resolution":{"observed_at":"2026-05-25T21:56:19.702683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polyguard: Massive multi-domain safety policy-grounded guardrail dataset","venue":null,"work_id":"e739732a-de04-43d7-92df-cfb31217514a","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:795b56a638534088bee82719c96f154560bff8e3669b5f26eae803776a696a81","observation_id":"db883f73-9541-4f28-a634-053a2f351c8b","resolution":{"observed_at":"2026-05-25T21:56:19.544108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":"ee0d413c-19bc-4eb6-ac84-955a8d5e638c","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:6e0344e23f0bc0c4ccd3e1b7a60b4964ffe795867e796e894e3d0af8e678ee0d","observation_id":"6d596321-94d4-448e-ae54-50f522c2ea21","resolution":{"observed_at":"2026-05-25T21:56:19.458961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":"9575dcbc-3534-4388-9d75-75a025931661","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:f333bebab6f7d5121d1d27dde0d16b95c7116773c631396abc3585408c50bec3","observation_id":"f082fc59-1ef2-4896-805a-14fe3f1c6c7e","resolution":{"observed_at":"2026-05-25T21:56:19.455348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:60d1d4a3836ee21713690d54c48d5534b90ad767690137a2f10121f264b43067","observation_id":"8d4f7f54-3764-41dc-b1d5-acfcc480a5d2","resolution":{"observed_at":"2026-05-11T15:47:06.021702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System card: Claude sonnet 4.6","venue":null,"work_id":"91577ffd-2ea5-4a37-b0b8-5348a5935d8a","year":2026},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:5a7e8c09b468bf1c81efa6631e00ffc19c326ef6732bf8a46e0646af57f2572c","observation_id":"b4eaeafd-c112-4d66-93c0-d209f23046db","resolution":{"observed_at":"2026-05-25T21:56:19.587268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents","venue":null,"work_id":"8d1da87b-f577-45eb-942e-6b130a6e03f1","year":2026},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:ac5971c0f2cf73619f8198878cea4008a23ace9071af3d3541799bdc15aae98f","observation_id":"628a4d3b-c71b-46a9-b4c9-e0fcfe05bfc5","resolution":{"observed_at":"2026-05-25T21:56:19.447303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok 4 model card","venue":null,"work_id":"1ca15598-5284-4713-892f-6ea2ba17d367","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:5669208203b976ac88f964c006130d17a37ae15eb6e56c0f498367c683b93f72","observation_id":"d1b16d28-a25f-4f01-8cba-f51c0e6182ff","resolution":{"observed_at":"2026-05-25T21:56:19.579994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:ff581fb82d3793c32031c877d75d0250c72a6f58dee5fca688a00dd5fd89d0c1","observation_id":"a0271195-a98f-4632-883f-3d590a767cc0","resolution":{"observed_at":"2026-05-11T15:47:05.421350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26328","doi":"10.48550/arxiv.2509.26328","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast- dllm v2: Efficient block-diffusion llm.arXiv preprint arXiv:2509.26328","venue":"arXiv (Cornell University)","work_id":"248fd492-8bf7-4ce9-a1df-130b5b976e36","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:64d218f8d362d460a427918fc802eb8edbc3eecc1d2045a4d10a9fbef7f58199","observation_id":"b10241d9-a8e8-46fd-a168-138525f3c609","resolution":{"observed_at":"2026-05-11T15:47:05.991372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code-switching red-teaming: Llm evaluation for safety and multilingual understanding","venue":null,"work_id":"3bed8538-b8eb-4ba0-b685-8a7b7ff4709a","year":2025},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:ba279457e0fec5a88e3db8079dbb6aace95cce8607cba346ce17b84febad475d","observation_id":"bc024da3-f2c1-4a64-b3b4-21d9994da8fa","resolution":{"observed_at":"2026-05-25T21:56:19.493906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"omni-moderation","venue":null,"work_id":"f07730d3-ab3b-409f-a5cb-9f9ba095af64","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:0effb5c02c47afbb4dbf262d7d1b00c6ab512a711e53631ddd2042a61b49e9fa","observation_id":"1dec8f30-51c7-4845-b6e2-70e0df6badc5","resolution":{"observed_at":"2026-05-25T21:56:19.490562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:53.870959Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"69d50b7a-8945-41ea-b24b-3dec8e57f9fe","year":2024},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:34466d56fce66aeee688e7e56b30c4f312a25ed34b20970493b4de40a720da54","observation_id":"3d01ea8c-5204-41b5-b1b2-e08d88d33c6c","resolution":{"observed_at":"2026-05-25T21:56:19.497659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realtoxici- typrompts: Evaluating neural toxic degeneration in language models","venue":null,"work_id":"ae5a5224-9db8-4596-8176-e94ff0cf7354","year":2020},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:b99ffc401745b40811ca36b516ccf355116f7156e8cb091feb67d582576ddc42","observation_id":"8ee356fc-1611-4f79-9fdf-52f30bbcd08a","resolution":{"observed_at":"2026-05-25T21:56:19.508543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Break them into atomic (single-action or single-concern) rules","venue":null,"work_id":"61a8587e-cc4f-4727-8ba6-c0ebc9979083","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:49f300956c89e68fb95ce161756b20a55a1aefcb46bf1d0472431b17dedbaa90","observation_id":"aad9430b-15f3-4bd2-bdc3-bfffcefe94fc","resolution":{"observed_at":"2026-05-25T21:56:19.660672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Combine them into a single unified rule that preserves all important details","venue":null,"work_id":"09c81892-6a8d-4d4b-beae-266623ca3b03","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:53d199f3a699d3e4f9a9d338ab65ca69741153e32f321bef7602c78072cc7eae","observation_id":"7ad28e86-6967-4c15-b25b-b8e0e0962415","resolution":{"observed_at":"2026-05-25T21:56:19.583650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Each category should capture a distinct type of safety concern relevant to the behavior on Regulation","venue":null,"work_id":"54b95408-abea-4823-8b9a-742d87472a5f","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:7350873bcc1097d919325ad77bb15e923a1a15ecac393b7aa89e5469006d5331","observation_id":"4266e94b-7606-444b-9563-52876a93b3a9","resolution":{"observed_at":"2026-05-25T21:56:19.591358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Ensure each rule is concise, precise, and consistently formatted","venue":null,"work_id":"52fbfb44-f9b2-4a86-b56d-5f3e0310f3cb","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:0a81e58194d35441d4dc8df395fe82625db42810e5d20c2ac8d6537a3f41b437","observation_id":"2402fc02-3b51-4107-b93f-8881814d0364","resolution":{"observed_at":"2026-05-25T21:56:19.451475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc9ce6d0-2c3b-4b83-8bbb-16311f5ba734","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:c3ac85a0e8a7ac847a3109e8f0e30f8064355d816e61f98c9ef0fdb68d3e7ff3","observation_id":"f068b681-c184-437e-b022-97345b882e1f","resolution":{"observed_at":"2026-05-25T21:56:19.569428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40bee607-7b89-4c52-aaca-2978519c8980","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:461e8686a2315438be2379c922a03f43ea1098b778047eb1b7c37da78419a759","observation_id":"a056c8ca-a3e8-4970-b19d-3964691fe874","resolution":{"observed_at":"2026-05-25T21:56:19.687535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Use continuous numbering across categories","venue":null,"work_id":"05aa3965-1e1b-43c3-bb6a-e4d3c8b1aff4","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:4989a9b641cb45bc0a85574586ec67bcc94a3098f8ef159a9c482a617b1eeead","observation_id":"49c51550-ba3f-4348-9507-ebfa92499690","resolution":{"observed_at":"2026-05-25T21:56:19.738959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f881d319-21e5-4909-b879-14d78c99292e","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:f18280901b7a32bc780b8513fcaba87b57737d7625017f7a8427831454c94ecd","observation_id":"697582fe-9cb1-434b-8c99-d08fe8187e89","resolution":{"observed_at":"2026-05-25T21:56:19.566119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"570b900f-71ed-4423-9886-c8c207148cbf","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:ed823d621c05bc06cfe8a34f8ead702b51c1a4ddc8cb6c86b765724c0f8553a5","observation_id":"f0bf520b-02c4-43ef-a35f-6260279de9c8","resolution":{"observed_at":"2026-05-25T21:56:19.573024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0edc051a-6b6d-46ec-93d3-9b9c4d4de48d","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:9d449bf1e66315fc5330463885bd403a717fe6821648130f46582b49ab966b82","observation_id":"84659945-b024-4a7e-8b57-1dc9cb2443bc","resolution":{"observed_at":"2026-05-25T21:56:19.640270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4baf3159-681e-4345-ac60-818ddfc92996","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:6346be8cfcaeb12ca2677b84dd960aa8dcebd44f74a8aedb6f6cb2c366d11a2b","observation_id":"6dd8fb92-782d-4c48-b6b6-ae78cd11e144","resolution":{"observed_at":"2026-05-25T21:56:19.625407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"63c22b0f-2ff8-4cd8-9576-e7c89078e47c","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:cf409bdfaab1e80cb38529c7bbb83e245751dfa181fc0c863e41b29923cbc171","observation_id":"fb04dc98-f14b-4075-9391-e1613b11e94c","resolution":{"observed_at":"2026-05-25T21:56:19.699008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8fa4c49f-01e4-4ad4-bfd9-fc3c259680ef","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:4844f632e7abac035c502c4cf7f65e610bc2532122f2581da8f9a564163524c5","observation_id":"81edc4b7-52f6-43d5-82b5-ce3a7c274b2b","resolution":{"observed_at":"2026-05-25T21:56:19.675987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72e95371-b145-4c58-a210-f1d345f709f1","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:60f391a6b7f4862bb66d460ad043b463a22e407298a9d866c809f6bcc35aece7","observation_id":"3febc151-d21e-441f-a437-1ba0b597330a","resolution":{"observed_at":"2026-05-25T21:56:19.555137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Remember: Create prompts that would realistically test an AI system’s ability to detect and refuse requests that violate this specific rule from the {Regulation}","venue":null,"work_id":"0e295886-d2d6-48d6-9e48-76c499840b81","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:55a964661a257335d34f1d7dd290f0ff52a20f5e0d68003d7f85291c7db9afd0","observation_id":"82987978-848d-4fa5-8a76-4180b0586458","resolution":{"observed_at":"2026-05-25T21:56:19.558887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c08842d4-2abd-423f-9801-cfa7e1b77303","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:be923774273ca0bf9ed2918aeaf820af39dcd7715387be13529a19195f9e0087","observation_id":"dd30d00d-82eb-42c2-bdef-d1f5644ce49b","resolution":{"observed_at":"2026-05-25T21:56:19.562484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This includes idiomatic phrasing, tone (formal/informal/polite/honorifics), and references to local legal, social, or institutional context","venue":null,"work_id":"32f8b9d1-5ad9-42a5-9486-d59d920777be","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:1364d1bd0f3f6341d0154f693556b4b32e9ff56f665bd16f79b160d8c34ffc7c","observation_id":"bfffe5e6-6efb-4928-b1ea-fedd6285b3bd","resolution":{"observed_at":"2026-05-25T21:56:19.595419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76ee0a7e-3007-48c1-a0a8-6c913fa3902f","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:5bd961472964a17816b57c74bce01ef605f817d51a2c80c52304566be427f84d","observation_id":"0d8533fe-05d8-46eb-a8ca-044325895368","resolution":{"observed_at":"2026-05-25T21:56:19.529716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07cdfe9e-c3d0-4935-9b42-2eafd4329fc3","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:1024fd47ea34659cafcb6dee24b3f2a4b740c2e33f72b217eb05019194c9357b","observation_id":"18dab9f0-2964-43f3-a133-09e47fc68b23","resolution":{"observed_at":"2026-05-25T21:56:19.533054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Output only the refined unsafe instance in {language}","venue":null,"work_id":"a7d24aa3-f134-4df4-9a63-8857cd64974b","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:9522ce8f662ae5e1397cd61ba11f6851c5061edae4d8a3182496162d9bab14c2","observation_id":"f9be1d3b-dd29-4f24-b0c7-783bbf5c86a8","resolution":{"observed_at":"2026-05-25T21:56:19.576452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b148da0c-ab07-44e6-b337-d75b1581fd46","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d1a23fbc7de09a910b435d390e7346b1bb34caf5a7a852f2abf2c7d3a79e9a7d","observation_id":"5b59e4d2-acb7-4cf3-8f86-f7991db30e5d","resolution":{"observed_at":"2026-05-25T21:56:19.599092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c729707-4d88-4311-a15c-dfb23424f2fb","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:fc0b93eb1c12985f2dd367b3149ea8e17143ad8cf87a0f9b3e15abb6c8808847","observation_id":"813d4814-ef4c-42db-9602-b0aea031235f","resolution":{"observed_at":"2026-05-25T21:56:19.691116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"56f74554-7229-4a39-9f0c-eda020d96a3f","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:342907dc9f50fc5fd3f5b70aec17aaef1f197e1eac0862c9ecfc7297e68fbe4a","observation_id":"db64166f-a4ec-4ad4-9858-1b4219bc8855","resolution":{"observed_at":"2026-05-25T21:56:19.474962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8dcaec10-43b9-40a9-9c3d-d147a5d77eaa","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:7a1db974317dcd26441cd7ea890348922b2f404bd248b166d8761798d29a106f","observation_id":"d0456f31-6312-410f-8d77-93f3347b01f8","resolution":{"observed_at":"2026-05-25T21:56:19.672029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5d963471-efb6-4668-a9d6-0d489b3a4e2c","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:2a3f8b7227ce66795a19e151aa4061bbd384af921681537c50d68136e0926b34","observation_id":"bff727b9-04c9-487f-a5f6-ffcd2a37cb15","resolution":{"observed_at":"2026-05-25T21:56:19.466816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3aff1518-5cf7-4808-8083-ffa3e0161845","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d7c86564f2e7ca5aa7fbc3ea807d45938732f6b0e456a1968a59c8cfaa18ae49","observation_id":"bb2bc63d-cb7e-451c-ab13-97be0b41c72d","resolution":{"observed_at":"2026-05-25T21:56:19.667940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This includes idiomatic phrasing, tone (formal/informal/polite/honorifics), and references to local legal, social, or institutional context","venue":null,"work_id":"d5c03676-92d8-4183-901c-45806bf3ba29","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:bb21ca752d8d111122f512c5a35d0f5cb097fe7ad57ef782748f8ec8ec2f282d","observation_id":"67d779f2-c3fb-40e6-91c4-1887cc217e85","resolution":{"observed_at":"2026-05-25T21:56:19.551780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You must think, reason, and generate entirely in {Language}","venue":null,"work_id":"6a6606e3-0f09-4f87-a900-f2730ba8e3eb","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:3d9497a18451b9a804776ca04302528773c0a8f7842177ad566c27e64c6aa526","observation_id":"93b137a4-7aac-4c5d-bd90-c52231b0aa40","resolution":{"observed_at":"2026-05-25T21:56:19.471003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This includes idiomatic phrasing, tone (formal/informal/polite/honorifics), and references to local legal, social, or institutional context","venue":null,"work_id":"d838360f-b425-48d5-858d-ca44b76839cc","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:5fcce14ce19489eda3ebd5ee333dae4fdca4fe8a2e2ee0d588a0262670ff311f","observation_id":"07d5964b-6445-444a-b270-885a35718c00","resolution":{"observed_at":"2026-05-25T21:56:19.656899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I will consolidate my prompt by ...’, ‘prompt’ : ‘[new prompt P]’","venue":null,"work_id":"b91784f4-0229-447e-82df-df21ef2b30f3","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:a68202159d09fe089791dbd5a35e7feeed37ca8f045aefe5c7fea9a56f06dd31","observation_id":"a657935c-9946-4e20-a860-5ba9c65a78f8","resolution":{"observed_at":"2026-05-25T21:56:19.648923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Figure 15: Prompt for Attack-Enhanced Queries Generation","venue":null,"work_id":"e4030e50-7153-4d82-8c0b-ca89c6f38c01","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:d3e73258bca6e23a295885d6ce3f8402596d6015dd31a6127f8b16b4c2e1bbd0","observation_id":"bc5694ae-9808-4de9-96d2-48352c9af8d1","resolution":{"observed_at":"2026-05-25T21:56:19.482969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e1a4fb1-34e7-4e86-a3e1-97cc9c6c31e8","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:4077333ebdcdbd9b2cacad88aa3d504eb86c3090f52db129887ac014e0d50034","observation_id":"14de4d13-8397-4f1e-a01c-db0535e3b039","resolution":{"observed_at":"2026-05-25T21:56:19.479045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6e27f8d-f5a7-41e1-a476-d6530c200c95","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:0698af730113d7cf2ab3a5a5fdda2d2c43b649058ce1db46882a4bbff1333483","observation_id":"a362dd93-4c3c-4716-a92d-3291881235d1","resolution":{"observed_at":"2026-05-25T21:56:19.511872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1320c2c2-c78f-4e47-8b06-32b9b325029b","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:8a4e84615049f245ca4909b94953e6c2b576a649343766a639d88a58d7a21007","observation_id":"36b46975-097f-4c8e-ae1f-281056aa6385","resolution":{"observed_at":"2026-05-25T21:56:19.462752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6fefb15f-7bb8-4955-8e1e-835eab6ddaaf","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:e61f0359c7654bc8976c645334c7aaddb658d225ac373501f0f6ae55758e7139","observation_id":"de34d839-97d1-47f7-8e4d-e1d17381f1a4","resolution":{"observed_at":"2026-05-25T21:56:19.540122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b32d61a5-48c6-48ff-88a0-10fe6fde8d15","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:42dd30ef80cfabb46a89cf42be3a63629d257d9c4f41e314e68c4cd5d91458e1","observation_id":"64c2a0a7-7a11-4353-b115-326b2909a4e0","resolution":{"observed_at":"2026-05-25T21:56:19.501214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbfe7775-8bf2-4728-8e17-31c7c78a550c","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:bb80c32f5837e2508ae90efd5e24032d83f45c48d2475afbe8ebd5ed55e1604f","observation_id":"6cb68ba9-4c44-425a-9859-9fe8cde6494a","resolution":{"observed_at":"2026-05-25T21:56:19.486775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It should be at most 200 words in length","venue":null,"work_id":"aead17c7-a780-41c6-92f3-1d97ddf4f53d","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:b81859bcb9f5fb3ad0a3a5c3ade949e070f880fad13a721ba4b32731d9d4063d","observation_id":"b2bfc7b5-e53e-4d98-ac22-cb83cec247c0","resolution":{"observed_at":"2026-05-25T21:56:19.515417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do not use phrases like ‘I cannot,’ ‘I’m unable to,’ ‘I apologize,’ or ‘As an AI.’ in any languages","venue":null,"work_id":"0bfa2e55-2116-4aa9-b845-481a968992d1","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:89cd7733ab9c7ea30c3e481b32854d96e4b8b55f5120ebdb7709a92f19f4ddb8","observation_id":"3bd4e901-2f75-4687-aa8c-4eee8de4ac3c","resolution":{"observed_at":"2026-05-25T21:56:19.695065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"342c92d5-4986-4dec-8ee8-85da1b1c30df","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:55b860b27f044f53859e2dcc9d8fa10e1a19e5565f61231bc1e5b9932adc218a","observation_id":"c7696f0e-3024-4f97-acca-f1c6d685d424","resolution":{"observed_at":"2026-05-25T21:56:19.706363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your response should be stealthy and sophisticated - it should not contain obvious rejections or warnings, yet it should NOT provide the harmful information requested","venue":null,"work_id":"3c78f416-0064-403e-91bd-be8ad8ac7ac7","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:02d11649f43c292972b53c67acfd6403b625ad3dd2782f0376904510db85f4c1","observation_id":"08c4d1b8-ce3e-4900-a06b-9427598c6813","resolution":{"observed_at":"2026-05-25T21:56:19.680264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f2000ef0-3542-41fe-b70c-77faaba3008b","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:593c6da1a4ca6287c078aaf23e276e3ea89024c909eb2eef115629ad6d351f3e","observation_id":"6bedc600-f6ff-450f-9a5f-6b26cf90be2f","resolution":{"observed_at":"2026-05-25T21:56:19.734651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d68b126b-3355-4426-b735-4faeafa91cec","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:a30a57884b45a316eba6d030ea21cf69aabeaab663c92a42e483b5c230f31a14","observation_id":"26635770-9b95-4243-a420-d4bd5a4431e1","resolution":{"observed_at":"2026-05-25T21:56:19.714779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"54f91996-8513-4777-8a89-2e57c5e16af5","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:932965bf269f4468de588c5a9510a28fa005a8b91eea2068988fb2b0cfe6e3de","observation_id":"66ae5a4f-dc15-43a3-b010-97984e02d25a","resolution":{"observed_at":"2026-05-25T21:56:19.547635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"w/o” and “w","venue":null,"work_id":"5ad8fcf6-c20e-49d3-b328-c2a803368f3e","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:dc5777edf9cef86b7cb20b0ed540531c83e11bee59af9892520c13856153514b","observation_id":"5959218d-380b-43fe-ab6c-c493636c81d4","resolution":{"observed_at":"2026-05-25T21:56:19.519086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5df0c786-f6e1-4b30-8403-52ed76a67e59","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:97cd54f29931d7ded2d9675b5964e130e8388eebee13f2b0678bc8ad119ec41f","observation_id":"de72d755-ca6f-410b-ba21-dd7d22a4946c","resolution":{"observed_at":"2026-05-25T21:56:19.522789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"42151076-f4de-4338-85cb-ba4e3db6f851","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:ba32a5ae74b043345c878a5dadbf8fd3559498819096b719f75c6687cc8e42f6","observation_id":"2c7040c6-963e-484d-93b8-8c6023736a8e","resolution":{"observed_at":"2026-05-25T21:56:19.525964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d33063dd-671b-4d1a-8db2-c6f355c55e75","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:441d553e85bef30a6f3ec45eba2e9adc8866e485438708dbf061b84bde9cd063","observation_id":"19fd4626-5c5c-4830-aed9-df681be376e5","resolution":{"observed_at":"2026-05-25T21:56:19.536573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"95231d3b-209b-430c-8fcc-eb9277b44f88","year":null},"citing_paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-09T19:14:31.076067Z"},"links":{"citing_paper":"/paper/2605.00689"},"observation_digest":"sha256:c0d0206b3895477af67e66f6778d0d7800227dfa41239983cb79428bd9061638","observation_id":"40f3c7fb-ece1-4319-a681-1bb81f5171bc","resolution":{"observed_at":"2026-05-25T21:56:19.602713Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00689","last_updated":"2026-05-01T14:24:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:24:14Z","title":"ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":31,"verified_exact":4,"verified_fuzzy":42},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2605.00689."}