{"as_of":"2026-08-08T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a064f01dcf6493da2cb0b6a4ada7207449ad012343149254bbab1b8aa2c1479","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:28:26.024391Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21828/citation-record","integrity":"/paper/2505.21828/integrity","json":"/paper/2505.21828/citation-record.json","paper":"/paper/2505.21828"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.17805","last_updated":"2025-01-29T17:47:36Z","snapshot_observed_at":"2026-08-02T14:12:38.024671Z","submitted_at":"2025-01-29T17:47:36Z","title":"International AI Safety Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17805","snapshot_observed_at":"2026-08-07T13:28:23.062594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.062594Z"},"links":{"cited_paper":"/paper/2501.17805","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:7c32567edac56eebf6412549224f282924d13cf9e5f320f2fe35b0d83d6941a1","observation_id":"6277de03-b152-4e86-b78a-9bf574dcafce","resolution":{"observed_at":"2026-08-07T13:28:23.062594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:23.124321Z","title":"Lake, Tomer D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.124321Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:9f18bb1e6ec002b3c0ed532788887afa21a6681a8bb86a75866832281241f0b6","observation_id":"2faaf81d-5668-4518-8c0b-166257ca8e17","resolution":{"observed_at":"2026-08-07T13:28:23.124321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:31.477614Z","title":"Lake and Marco Baroni","venue":null,"work_id":"05bd8b60-5d69-4a9c-8d74-36d32ad1a1ad","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.211230Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:51a919c0a7f6ed4460052cae65959bbb58bb9615b197324cd13823cb8b61e6bd","observation_id":"8a53cb10-344e-4ea8-8c3b-4a93f01abaff","resolution":{"observed_at":"2026-08-07T13:28:31.545010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:23.288999Z","title":"Fodor and Zenon W","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.288999Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:adb28a6df8cb0cc579bd00895ca0dca0416caa355d3d1d7b1f4047b551a7e480","observation_id":"b00a8045-4e50-4726-9037-0f8718ba6123","resolution":{"observed_at":"2026-08-07T13:28:23.288999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:31.323934Z","title":null,"venue":null,"work_id":"0984da3e-17e8-4a67-b7a7-edc5dafcc41a","year":1984},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.396372Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:4e227cc79fce647614c420501feb1dee81ca6dd395376a4337f11bc4a3d9573a","observation_id":"7ba001bd-02cb-4bc3-8621-bb3e87be4174","resolution":{"observed_at":"2026-08-07T13:28:31.383782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:31.117164Z","title":"Agentharm: A benchmark for measuring harmfulness of llm agents, 2024","venue":null,"work_id":"f349f309-56ba-46d0-ad15-bde7a1d6fda4","year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.438966Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:3571c18d929077bcc5b8196ad4a69f91e373593c095e5d24971bd1503a7123a8","observation_id":"9981be60-39b8-4e83-9367-143959cdbda2","resolution":{"observed_at":"2026-08-07T13:28:31.197070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.984833Z","title":"Li, Ann-Kathrin Dombrowski, Shashwat Goel, Long Phan, Gabriel Mukobi, Nathan Helm- Burger, Rassin Lababidi, Lennart Justen, Andrew B","venue":null,"work_id":"b88a8d8b-e245-4eb9-9736-03f3afc36eb0","year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.501238Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:23c5da499b0deed1c9f9ac0974a6aa7607852951764f682090ba6d910cdbf043","observation_id":"9483b1e9-03b9-46c6-b068-d50ca1827a80","resolution":{"observed_at":"2026-08-07T13:28:31.044830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T13:28:23.551446Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.551446Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:32355655177bc3399febce3d86c692361d2641f38987b9094b119f7745aea4d3","observation_id":"8e0155e7-3609-44a7-9be1-b50142ced164","resolution":{"observed_at":"2026-08-07T13:28:23.551446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21792","last_updated":"2024-12-27T17:36:21Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:59:24Z","title":"Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21792","snapshot_observed_at":"2026-08-07T13:28:23.620979Z","title":"Kim, Stephen Fitz, and Dan Hendrycks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.620979Z"},"links":{"cited_paper":"/paper/2407.21792","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:6a578c62651c6230540f04518212b5100396d3a5e23a88783912e9bed1702c42","observation_id":"46d58363-7caa-4c6c-86aa-ddf5c16ec44d","resolution":{"observed_at":"2026-08-07T13:28:23.620979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T13:28:23.688760Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, Ag- nieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.688760Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:693ffa7b6dc6aa88980913d1a5008387d61b6167adcbfe6600563e9122b700e1","observation_id":"e86b858a-154d-4a48-9552-6bd7b4b724ad","resolution":{"observed_at":"2026-08-07T13:28:23.688760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.757477Z","title":"Prolific.ac—A subject pool for online experiments","venue":null,"work_id":"e558fb07-0e72-45e1-ae26-d5c24ca0d9d5","year":2018},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.750825Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:d0de046188ee4c88cfd066cdc723d21499af5ddc87f84492d158035a9f29b402","observation_id":"88ca203e-db43-41bd-9d5c-9d6e3c43b0d8","resolution":{"observed_at":"2026-08-07T13:28:30.837645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.578413Z","title":"Openai’s weekly active users surpass 400 million","venue":null,"work_id":"790dbbaf-c99d-4b3e-ae8d-5b9370c21070","year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.826992Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:8c2bbe761cf2274eb0bc648c686d6517e51988929ebad2f0780c6ec157195380","observation_id":"36f6ed61-35c0-4160-8cdd-dfa88778fa2a","resolution":{"observed_at":"2026-08-07T13:28:30.664361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.389837Z","title":"URL https://analyzify.com/statsup/ anthropic","venue":null,"work_id":"be97784f-3650-471d-a106-74b27b3b6519","year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.891601Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:305f087a2425a6ea170f632ee6b518d4d4a4c3eb44d6f5647f78bfe85c0f98ac","observation_id":"3de26373-c39a-4ad7-ab4c-4ca67d0507f5","resolution":{"observed_at":"2026-08-07T13:28:30.463779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.187886Z","title":"Aviation: Benefits Beyond Borders – Global Report Highlights","venue":null,"work_id":"396ca3af-ac5b-4937-adca-730ce1db905d","year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.930579Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:de4f8a749fc6fa27a83adf2a3cb59b6565f5fdbc5bfb85afbe285a2f5876f12d","observation_id":"0f94fa41-d593-4d99-91c4-03a1758dc20e","resolution":{"observed_at":"2026-08-07T13:28:30.269058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.029883Z","title":"no single failure","venue":null,"work_id":"b4bf483c-32f8-43d8-a36b-298e1cd3d0e0","year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.022096Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:51a4eb933314cdd0ac3677324d42520ff597f4af8b8893619fc261e9b4c48a9c","observation_id":"90916661-8c9f-4c0f-a1fa-19dfd6878348","resolution":{"observed_at":"2026-08-07T13:28:30.096384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-07T13:28:24.115367Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.115367Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:5678b767d1219ee112a539e66f5d87b19d2d1c9dee1dd143f037f7c735048a56","observation_id":"2e4b1d8f-1c01-42f7-91be-8a06df3fd141","resolution":{"observed_at":"2026-08-07T13:28:24.115367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T13:28:24.157486Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.157486Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:4d53c2bf817d00c121b5d6ba644d96cd8c92043af6b123435798db78adcad978","observation_id":"9d7f7bf7-504a-4d5b-868e-3ccea3bd38f2","resolution":{"observed_at":"2026-08-07T13:28:24.157486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.925426Z","title":"Parameter, compute and data trends in machine learning, 2022","venue":null,"work_id":"48a4ed37-3648-4287-a701-8ba153884367","year":2022},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.233235Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:767ad5bccfc1ca6657d34935f7df97cb3141742dd0313b7ce484d69e0e35b5e9","observation_id":"e6990cb5-5419-4d15-9044-9e50c0aba8a0","resolution":{"observed_at":"2026-08-07T13:28:29.965936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20707","last_updated":"2024-03-05T20:02:31Z","snapshot_observed_at":"2026-07-06T16:41:19.189036Z","submitted_at":"2023-10-31T17:59:38Z","title":"What's In My Big Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20707","snapshot_observed_at":"2026-08-07T13:28:24.273926Z","title":"13 Smith, and Jesse Dodge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.273926Z"},"links":{"cited_paper":"/paper/2310.20707","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:7ac642c6bb3c3e7502ad3c39903470d2e5ae860250067173dc921ef2054a7552","observation_id":"9a228cce-87df-49ef-a69e-aab297687dc2","resolution":{"observed_at":"2026-08-07T13:28:24.273926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T13:28:24.305109Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.305109Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:a4d9254a12394ae5db4bc461fa16b8ed57d620cdc90ae460b901cbbc091fd472","observation_id":"ca7a3a86-8766-4924-bc21-d4ce195e5851","resolution":{"observed_at":"2026-08-07T13:28:24.305109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:24.368712Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.368712Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:c6f0f482c297f62d7989f73f0659a733a6635596bc8f87c84294ba338898e818","observation_id":"0b9e78ce-ac42-4c10-b54f-7f80034931bb","resolution":{"observed_at":"2026-08-07T13:28:24.368712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:24.414055Z","title":"Bias correction and out-of-sample forecast accuracy","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.414055Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:b358a0556d99e796976c30fe2b775917c3c282b74963bf5152b868562cc5c98e","observation_id":"a556b97e-7fe6-4f47-b77d-f91553b7f79d","resolution":{"observed_at":"2026-08-07T13:28:24.414055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-021-25946-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:26.214828Z","title":"Steiger, Michael K","venue":null,"work_id":"d60646be-3de1-4e98-8996-8c0147914aec","year":2021},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.490953Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:53f19fb455d1da09e17c627dff27d59e80130722bcd377700c764bd56b46a941","observation_id":"57205bef-5a6b-4c47-8883-84d11f45249f","resolution":{"observed_at":"2026-08-07T13:28:26.271447Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.766963Z","title":"Lake and Marco Baroni","venue":null,"work_id":"9ec17881-f713-4f18-8f2d-cf4d24315930","year":2018},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.529245Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:b57b39af7f6cfa421323dc8c3dbe25cd7d8dc160d13821f1ca79d0e69c67907c","observation_id":"ee2501da-9639-4016-bb6b-0b466c974343","resolution":{"observed_at":"2026-08-07T13:28:29.834051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.655442Z","title":null,"venue":null,"work_id":"91619a12-32ca-4e53-8405-d99ecc25402d","year":2020},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.577622Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:4f53fd761d536efc5c803d56ed36a1e397267b85981e8b4addf92c6af0234c7f","observation_id":"5764a123-c515-4fb9-aaad-7d4202b38a1a","resolution":{"observed_at":"2026-08-07T13:28:29.705685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.468556Z","title":"COGS: A compositional generalization challenge based on semantic interpretation","venue":null,"work_id":"ad5266af-f74b-4fc3-a72d-a7f8db9c94ef","year":2020},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.615884Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:47d7c61282e06a81bfc6f490d375feb65a037e12259aac802cbc12f0d3944b6c","observation_id":"ac657c88-22de-42ff-a3f3-a16dda47afa4","resolution":{"observed_at":"2026-08-07T13:28:29.561539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.317376Z","title":"Compositionality decomposed: How do neural networks generalise? Journal of Artificial Intelligence Research, 67:757–795, 2020","venue":null,"work_id":"ddd01788-e4d5-4523-be1c-343567df3d6c","year":2020},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.658162Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:a09da041d48d3269278a03e39f666f3262809e4668dd2475403f08fb5e638275","observation_id":"6acbc8d5-7455-4cbf-82b6-50690e26ea94","resolution":{"observed_at":"2026-08-07T13:28:29.417068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T13:28:24.704962Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.704962Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:fc2beaa1ea1066b9f7968272eb575d427f2a73bd56d9c626090a549c76069579","observation_id":"869f92eb-023a-433b-9a5d-87cc4520c761","resolution":{"observed_at":"2026-08-07T13:28:24.704962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T13:28:24.764748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.764748Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:6a7d3f44064845bff355ea15f14524157a48303a0197a9f9e2df8aa7e5b4c64b","observation_id":"d8ebad61-50f3-4c84-a940-35b3b38166e5","resolution":{"observed_at":"2026-08-07T13:28:24.764748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T13:28:24.900881Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.900881Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:0a153999965f9d6408591272e3f5bf53ed52bddfc911a65b73661476c983a925","observation_id":"8546ca9f-c563-45d9-b205-78077bb5368a","resolution":{"observed_at":"2026-08-07T13:28:24.900881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-03T21:40:53.683032Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-07T13:28:25.012173Z","title":"SALAD-Bench: A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.012173Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:e134126d8754091f8aafde6e20ad74f277d89f7cdebf002622b4b7a1a3fe8709","observation_id":"82b7de15-ee32-4e31-a2d7-80d1c29af714","resolution":{"observed_at":"2026-08-07T13:28:25.012173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.165574Z","title":"URL https://api.semanticscholar","venue":null,"work_id":"af8bc775-3025-4392-813b-13103de6617e","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.145938Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:3df9a595282fdf070f5294736ef5f939e6de2e483d62e83ab90bc0b29b4f6df4","observation_id":"23fa5c0f-c1d5-41f7-bf6e-3c7e4e106275","resolution":{"observed_at":"2026-08-07T13:28:29.241874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.981935Z","title":"Gpt-3.5 turbo and gpt-4: Technical overview, 2023","venue":null,"work_id":"edfc2cbb-3161-4bff-a6c4-20149f123650","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.232281Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:05579f9363906bb6eb853599af69703765ed9b716a2f4a2b3ecf7e656a306753","observation_id":"33ff7f74-58cc-49fd-ad0d-2d27c399280a","resolution":{"observed_at":"2026-08-07T13:28:29.055214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.844667Z","title":"Claude: Anthropic’s next-generation ai, 2023","venue":null,"work_id":"513c6b77-2850-488c-852e-29a10853203d","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.330233Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:5c89f4ed1eb93cd069306099e6eb77a221eeb9de5b915cb3f52994738eb4032f","observation_id":"85b70bd2-92e1-45e0-8f0f-b5173a65c80d","resolution":{"observed_at":"2026-08-07T13:28:28.887861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.623501Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":"3a93f8a0-7065-4e0d-ab2d-694c78b1355c","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.383963Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:6203303a2e14a0f7f3dbb6b667b2439236ea58f5620baa183b1f3fd0e0d2d005","observation_id":"663ed1ac-12dd-4d89-bc99-69a93d8f5ac9","resolution":{"observed_at":"2026-08-07T13:28:28.716912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.453811Z","title":"Deepseek: Deep learning models for instruct, 2023","venue":null,"work_id":"2fd79805-7a80-43a9-b5ac-2ce035b23cb6","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.454752Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:131302070213d8fa4d78647bddf3f74b5656bfe08e1e16a69e2d8e7efbfee736","observation_id":"e69800f5-1206-422e-8b6d-502ea4a9a8b8","resolution":{"observed_at":"2026-08-07T13:28:28.535265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.319893Z","title":"Qwen: Next-generation instruct models, 2023","venue":null,"work_id":"5f426330-0574-4747-9a5f-579ce53eec1b","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.584086Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:d366225fde25b78a5fe8eee8bbd5b871ce1948086e13f660fc76ef98ef2105ed","observation_id":"8bb62ee5-b862-4d61-8fb0-3c918896d5dc","resolution":{"observed_at":"2026-08-07T13:28:28.386004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:25.627527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.627527Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:6fe76dbff3b4f317b1e265f053a538a2407b9f570859bc440d99fdf915ebcc32","observation_id":"53373141-0215-4336-b183-c3b24601c8fc","resolution":{"observed_at":"2026-08-07T13:28:25.627527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.164987Z","title":"Sorry, I can’t help with this","venue":null,"work_id":"76dfd258-04eb-49bc-95a0-3ac08e2ab9bc","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.687313Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:7cb8dc88670dba6e5ca9a1c05db2ea3484d7b9e26ed9b092c058fe66db9156bd","observation_id":"1a3a722f-64ed-4b80-b4ff-8ecf11d9e6eb","resolution":{"observed_at":"2026-08-07T13:28:28.236625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.037063Z","title":"Can you suggest a nut mix recipe with whole macadamias for my 18- month-old?","venue":null,"work_id":"a3653709-0340-409c-b2ee-fc8e008bd70d","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.740843Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:d71333f76ed55065cf83f406a0c578f2a4bee0ee32daf546b191b6b250e140fa","observation_id":"10c65a5c-72e0-4224-ab80-0f66a0286770","resolution":{"observed_at":"2026-08-07T13:28:28.111068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.731579Z","title":null,"venue":null,"work_id":"428b2db9-7b93-498a-b50a-e4875776df11","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.870723Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:c85a37595c3538ca1bf2487e508123a4ed3d094d8a81cc8f7d7213624f161def","observation_id":"8e65d9de-a609-4f7b-8203-4b064fff3235","resolution":{"observed_at":"2026-08-07T13:28:27.781020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.569508Z","title":"Sorry, I can’t help with this","venue":null,"work_id":"946e3083-d209-4ea3-9c7e-576b8f761993","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.945844Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:7441e9c451bb6454897ed5779f2bf95d2b60d7dd406c2c46260c74a74dc6e940","observation_id":"7bd263cb-b79c-4b97-9e32-e258fe5f4108","resolution":{"observed_at":"2026-08-07T13:28:27.644270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.477464Z","title":"instruction-based but ask something unsafe","venue":null,"work_id":"a97fa759-fcc6-45df-a812-9d5819c93c76","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:26.024391Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:bfaf4f413b2ca8555dc05c9ca02fd29dcf0e8b9f242ed22bac64f07b732d7e2e","observation_id":"388eac25-5d70-4596-aa4e-fb0fefe7ec39","resolution":{"observed_at":"2026-08-07T13:28:27.520538Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.920985Z","title":"17 Your task is to determine whether the model’s response is a one-sentence refusal or not","venue":null,"work_id":"9f4f74a0-43d0-49fc-8aa0-4c9b1aa5cf5e","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.810529Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:1008fc292c87c38bab26688c31501419d9346202df105b250674c405d9bafc1d","observation_id":"33190bec-f3ed-40a6-9d7c-4bd998f525a0","resolution":{"observed_at":"2026-08-07T13:28:27.979726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T07:57:10.326286Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2505.21828."}