{"as_of":"2026-08-05T23:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35ea864874e1e84952bcea8b197d0cc0fc5915e1ee74a856a69de804595ee244","coverage":[{"denominator":146,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:31:55.631719Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29887/citation-record","integrity":"/paper/2606.29887/integrity","json":"/paper/2606.29887/citation-record.json","paper":"/paper/2606.29887"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"System card: Claude opus 4.6","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:049728c2d0b7047bd6c927d0a8347ec548be64ec348e762502939adcec02a961","observation_id":"444a044b-6fd1-41fb-b37d-14df31d7c297","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"System card: Claude opus 4.7","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:e56375e70146d0c5c94ef42800a5eb398bdfd51f4377405fd5a02406fe0471f2","observation_id":"6f1c5288-69f6-47e5-b549-f0add81da092","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Seed2.0 model card: Towards intelligence frontier for real-world complex- ity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:380595da14e110fa6af88bbe6daba94e071355f2d696f3006b773336e70d85bc","observation_id":"989df0e7-4666-4ea3-93b2-23cdf373fc26","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Pappas, Florian Tramèr, Hamed Has- 13 sani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:32be6042fe8395fc9efaa8530d6ad47de4c144f726cdd41b9496841066fc8a25","observation_id":"f635ef8d-0931-468c-9bb1-52106c8c9158","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Or-bench: An over-refusal benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:f10f7c2523b0a8ac65adc923b27aab81267e7529fd4928588ec2f74f8f6d336a","observation_id":"4a6798d2-6e26-4037-8ef3-1e9d74e5438d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03699","last_updated":"2026-04-17T08:07:24Z","snapshot_observed_at":"2026-08-03T01:12:03.997189Z","submitted_at":"2026-01-07T08:34:17Z","title":"RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models","version":2},"cited_work":{"arxiv_id":"2601.03699","doi":"10.48550/arxiv.2601.03699","metadata_source":"pith","pith_arxiv_id":"2601.03699","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models","venue":"cs.CL","work_id":"7a1f1835-1cda-487f-af2f-526e7ef5cd86","year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2601.03699","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:4138cff803c2f573b2dae2d00e2ca14f8459b562c73655ad1491d99f2be94997","observation_id":"16b862f1-240e-4d34-948c-dcbe8f0d2c2c","resolution":{"observed_at":"2026-06-30T06:34:18.156041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Deepseek-v4: Towards highly eﬀicient million-token context intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:1984855fe5a08345ab7701aa1348e3847c7dbabafb3505a8b8b777e24399e7fe","observation_id":"4c4c629c-4962-43c1-a6fd-4f8951db9aed","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3442188","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:39:23.146475Z","title":"Jacobs and Hanna Wallach","venue":null,"work_id":"792d93bf-35d0-442c-8736-654f06ce5d81","year":2021},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:14bf3bf2b69803ab76b499eecec1e5a722ebe1ecf7761e977ed79605ed6ff257","observation_id":"bea4bea2-89d4-48fe-9ce9-66061491f331","resolution":{"observed_at":"2026-06-30T06:34:18.157910Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.23636","last_updated":"2026-04-15T12:34:59Z","snapshot_observed_at":"2026-08-03T13:25:48.086807Z","submitted_at":"2026-02-27T03:14:19Z","title":"FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation","version":3},"cited_work":{"arxiv_id":"2602.23636","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.23636","snapshot_observed_at":"2026-07-03T11:58:06.911323Z","title":"FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation","venue":"cs.LG","work_id":"17a722ba-cf68-4eae-978f-93f9fe1cba31","year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2602.23636","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:0fca0387f2cd68e36a59cc9ce5c53350c9166f1da7ee78107a4eb840d11e4e9c","observation_id":"dac4bac4-d385-4b03-9008-8dc899c2224c","resolution":{"observed_at":"2026-06-30T06:34:18.821342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Safeguarding large language models: a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:cc9b7e8781da9d82c01485614eb9d4ce7729f0500b45a43b7815d9020ee5f9b9","observation_id":"260e45a1-1f3d-493a-bcb2-544beb059ad5","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27043","last_updated":"2026-04-29T17:44:32Z","snapshot_observed_at":"2026-08-03T12:37:08.017930Z","submitted_at":"2026-04-29T17:44:32Z","title":"CL-bench Life: Can Language Models Learn from Real-Life Context?","version":1},"cited_work":{"arxiv_id":"2604.27043","doi":"10.48550/arxiv.2604.27043","metadata_source":"pith","pith_arxiv_id":"2604.27043","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"CL-bench Life: Can Language Models Learn from Real-Life Context?","venue":"cs.CL","work_id":"e2cb27b0-04e0-4f92-84f6-7a6b949a416b","year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2604.27043","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:6d827148625a7f9d34ed4323ca27b3daf7e77a2efdcc480c8c85733547193825","observation_id":"dfee597a-08fe-4045-8a7c-09f25d0475b6","resolution":{"observed_at":"2026-06-30T06:34:18.150366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03587","doi":"10.48550/arxiv.2602.03587","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cl-bench: A benchmark for context learning","venue":"Open MIND","work_id":"4d10e4c6-07c6-47a2-bf06-94046a4b3d1a","year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:f9d4a30d32af6ef8e432c7a64cf55546da7249367cd437419b55213482c45452","observation_id":"19b15144-d5ed-4ee6-8886-bb161aebd5a2","resolution":{"observed_at":"2026-06-30T06:34:18.155308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:46.278816Z","title":"Ellie Pavlick and Tom Kwiatkowski","venue":null,"work_id":"42256cb4-aefd-4635-ab24-35b6179ff520","year":2020},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:9b2aeb6a39ae27e33954d1d94b74130bdd8c25717f7e0aab8acad16ee139868f","observation_id":"1d9ae3fe-c9a0-476e-9f5b-0d8439ec308a","resolution":{"observed_at":"2026-06-30T06:34:18.152421Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T15:08:44.41612+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T15:08:44.41612+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05993","last_updated":"2024-09-11T14:42:29Z","snapshot_observed_at":"2026-07-06T17:57:31.912970Z","submitted_at":"2024-04-09T03:54:28Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","version":2},"cited_work":{"arxiv_id":"2404.05993","doi":"10.48550/arxiv.2404.05993","metadata_source":"pith","pith_arxiv_id":"2404.05993","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts","venue":"cs.LG","work_id":"1ccd11c8-18f7-4764-989f-140f3f59c730","year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2404.05993","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:869916335e31841aed32f17e431230de3b208c4dc9a97a8aa28751342c3c4d6d","observation_id":"342689fb-6e32-49e4-9c78-1949b8e33380","resolution":{"observed_at":"2026-06-30T06:34:18.840560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05731","last_updated":"2025-04-18T22:04:46Z","snapshot_observed_at":"2026-08-03T00:17:33.673917Z","submitted_at":"2025-02-19T05:58:52Z","title":"AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":"2503.05731","doi":"10.48550/arxiv.2503.05731","metadata_source":"pith","pith_arxiv_id":"2503.05731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Artificial intelligence - carrying us into the future","venue":"cs.CY","work_id":"73705ad9-26b2-4cea-89f1-e2348125148b","year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2503.05731","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:0e9399a3024532c1fb85f719c75348f1bb1f23764dbc33f820fefc85a9bd57ee","observation_id":"de6bfeee-e473-4212-a9fb-9f11af126d6c","resolution":{"observed_at":"2026-06-30T06:34:18.830699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:a5fa55b699883a447d041dc75ad78b804ca7a6464a426daea5760396443e2820","observation_id":"e3145d21-90ac-40a7-90d7-e2c61eef20bd","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:ee4df5e855cf74f47ce2b5731f8b8e5d51cc0daeb8c0f4063ab1dba4974e57fe","observation_id":"69fd017b-8e2f-4808-801e-e21244bb3fc4","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Gemini 3.5 flash model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:5f1befab22266280e179410017295096311b85b809cda24102f7900a211ac0af","observation_id":"3d973896-075c-467d-a79d-9f06d80d4818","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Ho, Christopher Ré, Adam Chilton, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:8afe4981624e053b920de4db6e5f9287c87012fae8740c1b72268e5128740295","observation_id":"04b137af-3e9c-4e89-9f00-ec3e72b958ad","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:41cb568fa93e2480da3811eaca2f3c427100e23f1eb332d133a430cfa0ea3392","observation_id":"25799121-4501-4cec-841f-a2e9dcbb3dc5","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:afb0bddc7f2d24d01ef25aec3da2a0d6556a9a2dfa81aaaad4692925a40a1e34","observation_id":"5cb4747a-e171-4b63-8095-a81b5114ba14","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Bayan Bruss, Ashwinee Panda, and Tom Goldstein","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:e95870b991e15c51c05df187b1faf29484ac83c98b3ce3d017eeea035d6beda8","observation_id":"25b1a6d9-9b32-4632-b86a-18a7e4777cc6","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Hy3 preview: The first step in rebuilding the hy model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:adeb4a066746d0917fb4bc8b9455e484492f178d5e8b0ba8e1b641558bfd5148","observation_id":"8c340e89-9771-463a-91fa-1b12cf19d729","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2312.06674","doi":"10.3390/info16050365","metadata_source":"pith","pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":"cs.CL","work_id":"93844332-869b-448c-a1be-35466150b1b2","year":2023},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:9a4031584554ff7f5373b49451cad7c991c817e0bd3f27f59858d063db1ff3f1","observation_id":"792d88b9-cbb2-443e-9221-e1e866f77147","resolution":{"observed_at":"2026-06-30T06:34:18.814432Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Followbench: A multi-level fine-grained constraints following benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:5c6a43a68b47e62f7b0fdf4bada85a787bc158950b5f62b70b7e9dad1b7875a2","observation_id":"27794599-f72a-45b1-a985-ceed9def3cd1","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Kimi k2.6: Advancing open-source coding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:0fee3b83f42d6e96b0cebec00aeabe75eb04fbdd5912133a4920c6c12348237e","observation_id":"8c23e0b4-8bc5-4d9c-b159-3b75af8cdfc2","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"GSPR: Aligning LLM safeguards as generalizable safety policy reasoners, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:6ac7dd0d6164bb0c6e660da7cd514a76660383b4ec8bd3db7c7bf1f4fd9fb8df","observation_id":"9d24b06d-4273-43ec-be6b-d9e5801cc546","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.naacl-long.510","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies","venue":null,"work_id":"d361b039-89de-4eac-9579-e3909ccfa6ea","year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:e5a0d187e541d26990e4cb4992760010362c1b736f1cba12ad17fd35acc6601f","observation_id":"a68785c7-d3a7-480b-9e4d-57046b19d806","resolution":{"observed_at":"2026-06-30T06:34:18.144987Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:52:58.281906+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:52:58.281906+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Meta llama guard 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:47f166f3412935c95e7c1505e978a5c4a4dc9ff61f63e9b4f7a2483139b63ea3","observation_id":"69cddd9b-a5a7-4eff-8e1d-07a8ccf20f9d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Meta llama guard 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:b63221a926e74b4eaf358f03309367eea6cc928e9997822c91504fef0e92ee42","observation_id":"09bbbf5b-23bf-401e-a5c2-8e7dde4d9424","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Meta llama guard 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:2f0ca73743f077b14b8046b0e2fc27ca9fad4dea4e8b16f3e47f95d5204d6f3e","observation_id":"cf4edb22-7522-4a8f-b5da-04710322ce07","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:1b2d0bf38f14e6cf9bfd8b74e73552567133e1516183ad737618b062412b4b7b","observation_id":"6854cdea-7bb9-4c94-aff5-f18e0ffe4520","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Technical report: Research preview of gpt-oss-safeguard","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:fff4b15971f13e9416a31cf1379ab25b280a35736cb35fab12f758c2de641385","observation_id":"614577de-0b4e-4661-a956-293d448f15f4","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Gpt-5.4 thinking system card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:6db448e949ba9a70570b508a97ecbe704ed83b3af1189b0a05ff837e2db4120c","observation_id":"f43fbb4d-4b19-4ef5-a2d1-ca3d7bc588b3","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Gpt-5.5 system card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:095179ada78b496df30844cded83e79a5c389073c2cde7771220371c81295b46","observation_id":"c8de032b-e00c-4da9-87d1-d732f6887342","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Daly, Michael Hind, Werner Geyer, Ambrish Rawat, Kush R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:7c3f950b592f68e55ea609ef760a07c0e57362605d7f87c442eabd3d9c62c749","observation_id":"f7a4b051-d026-461b-b536-581c12ed58fa","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.10943","doi":"10.48550/arxiv.2408.10943","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InProceed- ings of the 32nd International Conference on Neu- ral Information Processing Systems, NIPS’18, page 5732–5741, Red Hook, NY , USA","venue":"arXiv (Cornell University)","work_id":"965fd473-f85f-4918-8044-967ac67f8a3a","year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:c3682fc1416190c4cec8da46b99b9fe03015391dc2319a69d0e4185510a8f57c","observation_id":"e0d15114-9659-4a79-aefc-cc316f449a7f","resolution":{"observed_at":"2026-06-30T06:34:18.833720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:70555acfdbc2354ca52f803b5d99003e26044fedbf5957218872d9a32a1f0665","observation_id":"18f8e2e8-a9b5-4ac6-943e-d2f0b157d95a","resolution":{"observed_at":"2026-06-30T06:34:18.837556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Qwen3.6-max-preview: Smarter, sharper, still evolving","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:f5bc5cf9ee0474f68cbcb4b5c376420b6549271557eb52b85357fdcfa65fcad9","observation_id":"807e24b4-2f74-4227-948e-55fa2419a9d0","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.301","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"XSTest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":"91f5c2bb-cc61-45df-aa14-108d319cfea9","year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:90ccd27bfad42f01217e6957af4c0a7541a1413f6fcd42ae2b671343bcff6ecd","observation_id":"f7b7a7c2-cc5b-4e26-9b97-ee0bf78dfae4","resolution":{"observed_at":"2026-06-30T06:34:18.157500Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.294751+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.294751+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Do-not-answer: A dataset for evaluating safeguards in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:45780c3fc487c72848139104a7a9d12aec73329abaa13cda054033630fb2e7f1","observation_id":"146497fa-4d7e-4d24-b4f8-01a4b6bd526d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Grok 4.1 model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:d2b5d01dee9db1aab917d5694f4f0cca36b397ff38f4cd24375347f67010646d","observation_id":"cbad44ec-e1ff-4caf-8cab-6d387b60ccc1","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Grok 4.3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:859ea7b2736b5bd0ea470a538cd45fa63d3271ba0951f9b31af0045af085330f","observation_id":"58fa480d-d3dc-4e0d-90c6-2698f3603551","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Hanjie, Runzhe Yang, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:3f32fd9d21c7594adccf5f7d4894421351d1847ffb98614bdbd2461a6bdcfe6d","observation_id":"54e3842f-6ab0-47f1-a261-f54264832e00","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Glm-5.1: Towards long-horizon tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:08ee55ffe2361db8c65a8484afdcbc5e3dee9741ed807903fb37574ea4af1f9d","observation_id":"d5cbc049-c668-42cf-acae-f00f4b6a3064","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"cited_work":{"arxiv_id":"2407.21772","doi":"10.48550/arxiv.2407.21772","metadata_source":"pith","pith_arxiv_id":"2407.21772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","venue":"cs.CL","work_id":"6d0d9d39-490d-48d5-b346-6bfe40b8b8fb","year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2407.21772","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:8d18d5d6ad539b2248301518ca532e1750080ea227ed99a2f62dce7715c4965a","observation_id":"faca9adb-3920-4b1d-8452-9b51c8ceeab6","resolution":{"observed_at":"2026-06-30T06:34:18.827770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01081","last_updated":"2025-04-08T18:38:04Z","snapshot_observed_at":"2026-07-06T21:02:33.351709Z","submitted_at":"2025-04-01T18:00:20Z","title":"ShieldGemma 2: Robust and Tractable Image Content Moderation","version":2},"cited_work":{"arxiv_id":"2504.01081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01081","snapshot_observed_at":"2026-07-04T15:09:54.641120Z","title":"Zeng Wenjun, Kurniawan Dana, Mullins Ryan, Liu Yuchi, Saha Tamoghna, Ike-Njoku Dirichi, Gu Jindong, Song Yiwen, Xu Cai, Zhou Jingjing, others","venue":null,"work_id":"2517fd6a-65d4-457a-b0eb-6581065fe312","year":2025},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2504.01081","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:a5dab70c333bb45071bde3e1a2c8c53fe16a447edd904cc5527a2c3dfa9365ea","observation_id":"6ba0bf05-8920-416b-95e3-1cf68579ff61","resolution":{"observed_at":"2026-06-30T06:34:18.821395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.830","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Safetybench: Evaluating the safety of large language models","venue":null,"work_id":"e2ec8a98-2771-4c34-bef4-eb942f15bf6e","year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:a5bfd86d993c03fa0d8ff082bbdf2cca2083d385e5da90260066d4d315f699d0","observation_id":"88b0bbb9-e442-4d47-8d23-e1b1bd3fceff","resolution":{"observed_at":"2026-06-30T06:34:18.161800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Shieldlm: Empowering llms as aligned, customizable and explainable safety detectors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:951afd2f7cf0d95d808393360ec0d6a49b8b9e05005dfed3aeafdd772bf526ae","observation_id":"bf086f55-7f0c-4e9f-adac-bc3de85447c5","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:26002b384f6452ca94126bdc79d221b2d5a0eb146b63eb20bc77c91835710349","observation_id":"c7a27968-7ea9-4dd6-aca2-1ca525b6b832","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:7705dd0fe476b7aefff2e5493b4699e6fa4804e0989ba3ffe1441b0a5ecb66a8","observation_id":"75dda0d0-cac0-485b-8d35-ba48d146afde","resolution":{"observed_at":"2026-06-30T06:34:18.824676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:a2f7b5071c0a2d477b93052ee8cd029e594c33c7d1380cf61884fa43776341df","observation_id":"6a073a54-5153-47a4-90ce-2baf63f9af81","resolution":{"observed_at":"2026-06-30T06:34:18.153439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive] 18 Table 8 L1 policy sample (rules 1–20 of 30)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:f0e79a3fd09d1b56e53e7bca92d8ca19b902a679ca46f855d693fecce20a4182","observation_id":"578eab8a-9bdf-401a-b707-ea4d6f82f7d2","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:76e52bba5b96c893d5136b9f121fcfb63f2077166e25a57e7ddbce4139a87d7a","observation_id":"37371522-2bbc-4010-91fc-a0f050f51761","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:b3f82bdd60aa47c8cd1251e68a28ae9fadaa38596f64254c8dd8860f385c9d88","observation_id":"e0a1f8c4-804d-451c-894e-e3252abeb32e","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:e12158d95ce3070f6902ef1688a004cdd651bf340243e31e4511302f5bbdd35f","observation_id":"35ac6a09-9e64-45bd-9d2b-b30755d7f956","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:b574fe0ac780cf8da037af853f1dfb372f8bd199a3b135927b34ce6a5b9ab47e","observation_id":"31a728d7-d9d0-4de3-94de-54c544bcd010","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:f0f0d8d4dcf3276655aeba10911299938e17c890cc3030a80ab94aaf4e7b69c2","observation_id":"6fcb4b02-e81d-4144-b7f5-d887e884f64e","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:294cc2fdeac1d7af192b85b588be3bda3009dac279b8ff64e6499379647a0ef4","observation_id":"cf33a480-5ca9-46d6-901d-ae02ee9dc937","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:cc663c47b0502d6b8921a0aa9578af795c42a32d33687075e62e5f6ddcfedbbb","observation_id":"8f0eddda-38f9-43f8-89a4-c256de9605d0","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:8e58ceefdb86de86dbb30243219f2792b921f79f8e8f3849007ed0bbc7c33604","observation_id":"527bdb49-d50b-42e3-a929-ad3be12bf465","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:2c7b95195db5cef52a602bb9feb13c22e6fd0a15fcf980cabb1b8ed3a6c6c128","observation_id":"e1c3a523-956c-4a13-a6b4-af2cd8013777","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:1ec928f81857ca79260e4bc5c74efdf9bd04b966d03ba4018695d16ee7dea12f","observation_id":"2c940998-f78c-446c-9b83-84dcbd9fb81e","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:9110fee874ed9ca8e0e4ada25c9e2d1fe4bcf2746f32b5dcb2e1ef143f9c3e64","observation_id":"326ea86f-3f73-4ed8-b83f-c9835c78fd9d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:9328bfe7f9686d222832b9452197f4b01ba7aa83ae7aa47db640be95b2495ef5","observation_id":"6c0401ae-60df-4dea-bd00-028ea6e01abd","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:af117edbcf61d85374a497fd31f7b50fd7e0ca6b23b3458cda1aff7d315a7571","observation_id":"a94cbe1f-2d4b-43a7-bf95-99c9cb2c6065","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:7807432f61252b89c4749a98110b56a5d32551061596f4a52196e08193011ccd","observation_id":"84092525-fad1-46f7-a8a8-5ea65afa193d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:a20e6b2589c7cd07b92c5fb47735ec9a449a4492d31cbf09f11472658518714a","observation_id":"4b9bef88-a2d0-491a-ad52-748c344e59ad","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:147a1ccebe12754433039426add76158cffbfc6e47b11effd1d8322781ba725f","observation_id":"bfce3bbb-ffb4-4fcd-8d2c-af36b110b1f5","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:7713544a9989987d9eee61695babee1c436e50c27c17935a6693147562fd5269","observation_id":"80114577-e665-4dc9-8896-41b7b4c8fffc","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the chatbot must provide the implemen- tation steps AND simultaneously detail a verifiable parental consent mechanism (e.g., age-gating, parental email verification)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:be3657a1734dbc48d26cd574584ec179e3771c5bceff31b4315adc5c74a51257","observation_id":"b4a47a7f-e0fa-4105-b91a-1465c669d819","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the chatbot must provide technical anonymization methods AND explicitly caveat that such methods may not suﬀice as a substitute for consent under strict legal regimes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:39a14f792b91f76245f32151c8700de686147d920c5ebd28d85796647c597498","observation_id":"8d0906fd-11eb-4ca9-859a-d752abe44d37","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the chatbot must provide the schema while explicitly warning that such authority claims require independent legal verification before implementation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:03ff3d12fce3271f2ce216a8c5c59d8850707e817c6ccab024f168cf84f4c9cf","observation_id":"5aa17dbe-3fb6-4f24-aab8-5cc890ec0b0e","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the chatbot must recommend backend services that natively support the provided certification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:3913060911c31b6c523f8c021cef717a853767a7297148be14994a40285caad4","observation_id":"5e1a4298-a0bd-4549-ba98-09ab3c1a036f","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the chatbot must provide the requested code snippet encapsulated in a dry-run or testing environment wrapper","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:29ae20bf9b5a38b219645a9b17684eb7d4b0b9d3b5013d319f3c0a8f0ebc0b8a","observation_id":"dcec1480-cc86-4fd5-b6ec-e7480fb5fed1","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the chatbot must discuss the sharing process while explicitly instructing the user to attach the quoted compliance sign-off to the data transfer agreement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:05f21b3aacb9670836c8feba2bfc88be43e5aee6e0a239ccc0371b0f36b75117","observation_id":"d0557bed-b16a-4ad9-a5ea-6d9bffbdf132","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy ALL of (i)-(ii) in such a turn makes Rule 7 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:55f0dc13eec23f97ec245c11c0e159bf0a2d48d9c8dee24cb91771d7f7f3f2de","observation_id":"02625f51-6a8c-4769-af8e-5c2c752e717f","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy ALL of (i)-(ii) in such a turn makes Rule 13 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:ac83900088d14af6e47173b24f5e633e9d4b610a90cc20f3bb3cd0041e84216d","observation_id":"c34dd3a0-55bc-4766-8a35-a900cdfb6cee","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy ALL of (i)-(ii) in such a turn makes Rule 11 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:7b24323a21cf333241ba8e211e55d402ac99d6ba83cdab0139b453f65951c8a4","observation_id":"722f58e2-d1cc-42a1-9afe-0696bacbf1fa","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy ALL of (i)-(ii) in such a turn makes Rule 7 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:09d8fbce09ac6e13b74f6b221b7fd1d5904d8f0c68dfa543ef146d82ee530aa6","observation_id":"c6036b1c-1f55-4843-9493-e708e29b6c3d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy ALL of (i)-(ii) in such a turn makes Rule 13 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:1a956b4c490fd57e58af8827ca83330fc1b696d126d2be573bb077665ca73b8d","observation_id":"98816288-53c3-4dfb-8408-7862ae2bda4d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy ALL of (i)-(ii) in such a turn makes Rule 11 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:8ef0ac834bfec1819494c024aa7426dc073abbc3ba659e29b16a743fc370c5ed","observation_id":"c94adad0-994b-4adb-99e4-2a27e2ec6522","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Under §2.2…","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:5c2015c57160b4d25ba0867a81c7b2bf8a409845ab79f59b039dc31ef964398c","observation_id":"915f17e8-52e6-434e-8d80-1d961839e61b","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy both elements in such a turn makes Rule 5 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:83687d318d9db6982e748a6c0b712de40d32c1e6cd124ade9e6e176aaa4831b4","observation_id":"2f1fd28d-c83b-4c59-a79b-5099170b0aa7","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy both (i) and (ii) in such a turn makes Rule 29 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:5b4d8ff054e07313defbaea9f09ee4d3753a263ee5eeadcb5279706368e794a8","observation_id":"9c19f3f2-5336-4dc8-a74e-2b2f5bbd9d90","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:3a93f30e26eb10c3832fcab0e4784e93da9df47b4a7f07d917ba0d541716fd2c","observation_id":"1f83a12d-ede1-40c1-b473-74a76d4ff116","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:032ecb6dc51519ba4acea898f814939b9c8a6822f7f54524c81ddfc9c12e782c","observation_id":"c9567dfc-20f6-4f27-b7f5-a99390a026fc","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:ebcfb20493ef1dcc4bfa007dbfefabc10c81b52061033e44256ed28e139d669f","observation_id":"552734f8-3e12-49de-817d-ef80a9f8562a","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:0a247e424022b5bb82b486b34367864217a98f04ef2c48734bdd8ee615eaf90e","observation_id":"e87af3db-48ce-4643-873a-ff2521822fae","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:b88a4758c46a9faba279002d7a8641252315fe65d17d3d37b1c83cdb2e9d05ed","observation_id":"92b15a28-cdda-41f4-9b90-8f8693e91aed","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy both (i) and (ii) in such a turn makes Rule 5 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:37be7aed508f330930f0fecbfaab136d0af93c8227d4f593758b6655391f177e","observation_id":"0eae82f1-36a5-4cb8-b3aa-3f8d1f0593cd","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Instead, the advisory system must restrict pseudo-executable code examples to generic placeholder functions without named services","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:cb7d2244bea0aea2f15aa01b9b54b89ab914768cbd309ce597d5a6300a6123f0","observation_id":"7435f776-7077-4365-b360-f45f3177a4e9","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[distractor] 22 Table 12 L2 policy sample, rules 11–21 (continued from Table 11; continues in Table 13)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:e803f505fd47f27b2a87adcca290fb6bd9ea09b0eb1bfcdf37548289f2ff8f45","observation_id":"30db60c6-43c4-4498-bd3d-f85b83ec6384","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy both (i) and (ii) in such a turn makes Rule 14 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:5f01b5f11b347f3568b3541e6c7c223f5ae4c490cb714fc05d9970a8db2c7c61","observation_id":"e46bf8d0-1cdf-4452-8bb6-badc11f3c1a6","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:2e66d2fcc06d20a61c8c97c1c37ab12512b0d2b2e294813a6bd746682f7c578c","observation_id":"99d2e068-a92b-4d0b-99c3-f4f32beccafa","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to satisfy both (i) and (ii) in such a turn makes Rule 5 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:203dd1694afdcf0ba8148c07603bcf52c15d14f08063e028add063cf7ec0617f","observation_id":"a7ac86cb-3ea5-4767-ab38-c9d159f5614f","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:438c789abcacb0c462c24234fcae9deead417d6128a57525f4aa5af401169fc6","observation_id":"57c81360-13b2-4569-8cc9-b2cf7edfbf9d","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Lapsed Standing is irreversible within a dialogue session","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:4a888ccfd77dc80ede57f78b20ddb62d729d8dbe86c0fcf2851415684df3c9b7","observation_id":"671317a7-53b3-4e88-9c33-327b42545b7a","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"[decisive]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:524e5a61a0665a908269a2524969ce1b7b256a3c96362998bba929a7b304872f","observation_id":"59ae442a-55fe-4038-9000-726372d8099b","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:31:55.631719Z","title":"Failing to include this additional element in such a turn makes Rule 29 violated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-06-30T06:31:55.631719Z"},"links":{"citing_paper":"/paper/2606.29887"},"observation_digest":"sha256:eff7cf3537386ae85db3bed6e68a6d439b6d6893da1824fcfb9c48d1a1b33706","observation_id":"e15ecfb4-4a35-46de-b6da-c3a8df1585aa","resolution":{"observed_at":"2026-06-30T06:31:55.631719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.29887","last_updated":"2026-06-29T07:27:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T07:27:22Z","title":"SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":82,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":146},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 146 outbound references and 0 inbound Pith citation observations for arXiv:2606.29887."}