{"as_of":"2026-08-19T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8b027f978c5e32fb58082f3351f1a920a8119a8490777428709286752fc69e5","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:13:30.618840Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:31:28.922399Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T06:06:43.111814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-08-10T18:31:03.512629Z","title":"Chemsafetybench: Benchmarking llm safety on chemistry domain","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13952","last_updated":"2025-02-27T07:51:29Z","snapshot_observed_at":"2026-08-14T02:24:34.909939Z","submitted_at":"2025-01-20T06:35:01Z","title":"The Dual-use Dilemma in LLMs: Do Empowering Ethical Capacities Make a Degraded Utility?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T18:31:03.512629Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2501.13952"},"observation_digest":"sha256:94b0bd02c0a17bbe3e3eecd6a86ea9e76be9c27e7a6ad102cbe59ffc8952da05","observation_id":"4185627b-7924-4961-90fa-c33d25ee590b","resolution":{"observed_at":"2026-08-10T18:31:03.512629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-08-15T22:31:28.922399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06964","last_updated":"2025-05-17T05:08:12Z","snapshot_observed_at":"2026-08-17T11:43:49.709641Z","submitted_at":"2025-05-11T12:32:57Z","title":"Bridging AI and Carbon Capture: A Dataset for LLMs in Ionic Liquids and CBE Research","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-08-15T22:31:28.922399Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2505.06964"},"observation_digest":"sha256:d1ff5f4ab7026df2563e1befd47758e570e207134ee9c645700efae86caf7998","observation_id":"4248f7c3-83cb-4f9f-b245-0cdec1a89edc","resolution":{"observed_at":"2026-08-15T22:31:28.922399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-08-06T14:13:06.334084Z","title":"Chemsafetybench: Benchmarking llm safety on chemistry domain","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:06.334084Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:7e7ba44863389d04a4b151818efdaeccc7aca831d31b482e517afd3883c2076b","observation_id":"cf9ff821-f42f-482a-8cc0-7a22da0f7e34","resolution":{"observed_at":"2026-08-06T14:13:06.334084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-08-05T23:24:23.955660Z","title":"Chemsafetybench: Bench- marking llm safety on chemistry domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05427","last_updated":"2025-08-07T14:17:23Z","snapshot_observed_at":"2026-08-17T21:07:16.522359Z","submitted_at":"2025-08-07T14:17:23Z","title":"Large Language Models Transform Organic Synthesis From Reaction Prediction to Automation","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-05T23:24:23.955660Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2508.05427"},"observation_digest":"sha256:41ef384b2d9780a15eb6a8f490c6560726340686f7d430c6d1e103bc475e377b","observation_id":"63b37aa9-321f-4d52-99f7-069b63dfb873","resolution":{"observed_at":"2026-08-05T23:24:23.955660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":"2411.16736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6ab44f3e-3d85-4f4d-9f59-c006d8396f20","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-08-16T12:49:45.643383Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:5ec98b20aff73c76fa005f53b03a7351c03d78a906528b8aa53fcf974e99fe52","observation_id":"e93d3779-8b4b-46ec-a248-076e40f17437","resolution":{"observed_at":"2026-05-22T05:51:07.900654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":"2411.16736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6ab44f3e-3d85-4f4d-9f59-c006d8396f20","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-08-16T12:49:45.643383Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:02881468a2897b1eff5c2ed6f64d57c40175602a1bbb413981b0b394c44e1a95","observation_id":"495a9280-9279-4b0b-94be-9a4e07b58d48","resolution":{"observed_at":"2026-05-25T06:06:43.114555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-08-01T14:45:43.513794Z","title":"Chemsafetybench: Benchmarking llm safety on chemistry domain.arXiv preprint arXiv:2411.16736, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18665","last_updated":"2026-07-21T03:25:01Z","snapshot_observed_at":"2026-08-18T14:28:02.800355Z","submitted_at":"2026-07-21T03:25:01Z","title":"SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:45:43.513794Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2607.18665"},"observation_digest":"sha256:511d158fee81f4c5b6b849ed2c55659dcba7c3a6b8821995ffe7d51d7b362ab7","observation_id":"aeafda4a-109f-4d1a-bd01-8ad5944fe80d","resolution":{"observed_at":"2026-08-01T14:45:43.513794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16736","snapshot_observed_at":"2026-08-04T03:27:36.995699Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Do- main","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02595","last_updated":"2026-08-03T17:58:27Z","snapshot_observed_at":"2026-08-17T02:51:32.193838Z","submitted_at":"2026-08-03T17:58:27Z","title":"onepot-Bench 0: towards lab-aware in silico chemistry benchmarks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T03:27:36.995699Z"},"links":{"cited_paper":"/paper/2411.16736","citing_paper":"/paper/2608.02595"},"observation_digest":"sha256:e9f3e8552be533d5a899cc626e2c14a89be8da570d7bd03f7a218031b3dbe9bd","observation_id":"8a6e282f-c5e9-493b-b647-a810e9a24c92","resolution":{"observed_at":"2026-08-04T03:27:36.995699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16736/citation-record","integrity":"/paper/2411.16736/integrity","json":"/paper/2411.16736/citation-record.json","paper":"/paper/2411.16736"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:13:29.573144Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.573144Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:d94ade3ec9736003d5cd334e283509e68accf1c36be2771d7040e7ccbb5cbe9a","observation_id":"725413de-4f3b-47db-8a32-e6b56e87598d","resolution":{"observed_at":"2026-08-12T14:13:29.573144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.597406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.597406Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:0ec7c31f6784c00aad97510626fa6474dc340c2f0ae4a97904501600a193244d","observation_id":"c73b7420-3bbe-481d-b3b7-334844a7032e","resolution":{"observed_at":"2026-08-12T14:13:29.597406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.604398Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.604398Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:a19d044a2c5618c1d61c33c012102dae44b4cb3c7554e93bc26613b23ef4fe28","observation_id":"e5cc7824-c022-4afc-9028-1391563cd134","resolution":{"observed_at":"2026-08-12T14:13:29.604398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.610589Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.610589Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:43894156207db932840d32c0353fbbeba73e4f9be5e5da6f7bf163aaa0c837c6","observation_id":"56c0175f-2563-4227-82d4-cf62b32ef8c8","resolution":{"observed_at":"2026-08-12T14:13:29.610589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T14:13:29.633261Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.633261Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:8d38e0b1f23fe0d4b1178d3d6901117cb32245580b1c1a630207ea9f0d10066c","observation_id":"286ea39e-a229-4258-861a-65161cdf1422","resolution":{"observed_at":"2026-08-12T14:13:29.633261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.674124Z","title":"Autonomous chemical research with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.674124Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:5f91d74f6f107ba2748df1ac1e7d7fef5865eb2d436448480c30cea6d0d1fb6a","observation_id":"6799db45-a564-423c-a4a5-04d43bcf6744","resolution":{"observed_at":"2026-08-12T14:13:29.674124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.561030Z","title":"Manning, and Roxana Daneshjou","venue":null,"work_id":"04c2dbb5-f5eb-443b-b149-ce2dbc42a646","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.691608Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:c4a2f9a6c0a1f1bc65a7fc295f7e984ee6d2db2c119800b694382b6f5249d459","observation_id":"4b2ec2bb-5528-4b0f-8545-86056f5c2f64","resolution":{"observed_at":"2026-08-12T14:13:32.656089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.425433Z","title":"Bioinfo-bench: A simple benchmark framework for llm bioinformatics skills evaluation","venue":null,"work_id":"65278275-1005-4c1b-8369-480a8d96a814","year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.697690Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:d977161f5e29e4c3e4a38e823d935997ac23ccd855c8ba4167e2be3d0fa310a0","observation_id":"f2321ce5-37fc-4d13-8af0-31e70ba03428","resolution":{"observed_at":"2026-08-12T14:13:32.436165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.400781Z","title":"7 revealing ways ais fail: Neural networks can be disastrously brittle, forgetful, and surprisingly bad at math","venue":null,"work_id":"98c478ad-3f97-4155-9fb4-f36f49a9befb","year":2021},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.703002Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:ae202845e271c4e1b8c6dbd3beb9bb24904da46a689acb92f27f852097f176eb","observation_id":"bc27f439-5fe0-421e-977d-03269b8582a1","resolution":{"observed_at":"2026-08-12T14:13:32.407480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T14:13:29.709737Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.709737Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:f90ef84d85b632ce9222a196c9ea5622ff70e772454770ee2d28ba2692622cba","observation_id":"92ce51a7-7600-4755-add1-36fd4f4e2828","resolution":{"observed_at":"2026-08-12T14:13:29.709737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.375223Z","title":"Reaxys, 2024","venue":null,"work_id":"46b09a47-c6bc-479e-adf0-2269123d6cda","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.716484Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:6ea5ac71cbfc5026d1be51d02718bd258dc8b32421465b8b4278f80e5bc03072","observation_id":"dcc1e499-e7a1-4f17-9e4a-aac80db084e5","resolution":{"observed_at":"2026-08-12T14:13:32.385695Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.356237Z","title":"Pubchem, 2024","venue":null,"work_id":"ada5fa3d-4f56-40c2-8013-f9d51ab28edf","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.722191Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:99c98c342d9572a217b1eede2732451beaecc52d51aab10858cac54f9c3d5970","observation_id":"603757da-0c17-470d-9cf5-5c377758aa20","resolution":{"observed_at":"2026-08-12T14:13:32.361507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.327563Z","title":"What can large language models do in chemistry? a comprehensive benchmark on eight tasks","venue":null,"work_id":"3ed8b929-b162-475a-acbc-80e18f0d4f87","year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.753956Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:f0e753647f1356808861a2b0fba928678fd8402422a75e566526dced2ecdbb86","observation_id":"862b633f-002e-46d1-a712-e0574b4be724","resolution":{"observed_at":"2026-08-12T14:13:32.337335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.303595Z","title":"Testing llm performance on the physics gre: some observations, 2023","venue":null,"work_id":"1cbac284-3add-4b24-b1a7-7e783f1882fa","year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.801405Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:0d6d91267bf09c27ec9db12f71f6e0096874b2db59711722cf0718694a779b19","observation_id":"96573458-b7e6-437b-bbcf-409c957b5d8e","resolution":{"observed_at":"2026-08-12T14:13:32.313049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.806063Z","title":"A survey on large language models: Applications, challenges, limitations, and practical usage","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.806063Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:806aeeb920e7a99bc850c0c9fdc6f3bcc058dc4f7dd4dcc8abbd34a7a01b9af5","observation_id":"2a72e99d-6cef-482d-b746-0ca9d31d536a","resolution":{"observed_at":"2026-08-12T14:13:29.806063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:32.081428Z","title":"Control risk for potential misuse of artificial intelligence in science, 2023","venue":null,"work_id":"61e0142a-e2a4-49a8-b9d1-c0d182cfe32b","year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.810841Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:1b2d9b064e28c6e1fa9056117924902b6e8a69f89f61c3873ea39173cbb1f588","observation_id":"9ec6be15-c050-440e-96a4-388f71cc675b","resolution":{"observed_at":"2026-08-12T14:13:32.152244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-12T14:13:29.816346Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.816346Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:83edc15043d03bbe349604574d24a6dfc094ff342cebbc6487b69fbc199fbf0b","observation_id":"b0f3e916-d60f-4496-a253-6d652f7d43a6","resolution":{"observed_at":"2026-08-12T14:13:29.816346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04363","last_updated":"2024-03-13T22:48:14Z","snapshot_observed_at":"2026-08-16T14:54:25.086457Z","submitted_at":"2023-10-06T16:36:08Z","title":"Amortizing intractable inference in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04363","snapshot_observed_at":"2026-08-12T14:13:29.822476Z","title":"Amortizing intractable inference in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.822476Z"},"links":{"cited_paper":"/paper/2310.04363","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:681addc60fbe52e03cc117e8ca22dff6cc52acf12d06a8322ba6dd606e5c1879","observation_id":"78ea54ef-4993-4424-9b62-327f83ec94b7","resolution":{"observed_at":"2026-08-12T14:13:29.822476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-12T14:13:29.831623Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.831623Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:41f9cef8e0a6e759dbd667a6c8f1fdb793699cb84ad622054a341b044550c649","observation_id":"dbebfee4-bf42-40d0-b12a-e4f429c54186","resolution":{"observed_at":"2026-08-12T14:13:29.831623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.961537Z","title":"Leverag- ing large language models for predictive chemistry","venue":null,"work_id":"577d9e7e-b291-449b-b587-865bdf962cdf","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.837221Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:0d9464e541cefe68526e5a5f6c485ad4c79b5e586dc810132d43689c66076cbe","observation_id":"22ea5419-1a3e-4f19-a983-86722423f3c1","resolution":{"observed_at":"2026-08-12T14:13:31.988696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.945141Z","title":"A compre- hensive evaluation of large language models on benchmark biomedical text processing tasks","venue":null,"work_id":"f98d3781-553c-491e-aa4b-2e627cc338ec","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.878291Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:e10a71c90d7634061500aaa46858fe6263eff22248a76195dc9420c7a7e1bd6f","observation_id":"372d6eb8-33bc-4048-931c-e419cb0d4501","resolution":{"observed_at":"2026-08-12T14:13:31.950399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.912941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.912941Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:80590f7161f1ce10631442611dd52a12726c85fa1af5120074f38ef2b5f79c44","observation_id":"c3a09434-197a-43db-8c09-1321c0593d69","resolution":{"observed_at":"2026-08-12T14:13:29.912941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.919876Z","title":"Llm based biological named entity recognition from scientific literature","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.919876Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:d6056cd2ab86c63ae99ab43674e41b90b7ad55fdd8eacb8236cf3990d4127577","observation_id":"68a7c90c-a619-49eb-900f-684a2da1fcf4","resolution":{"observed_at":"2026-08-12T14:13:29.919876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02789","last_updated":"2024-01-05T12:59:20Z","snapshot_observed_at":"2026-08-16T14:29:37.405116Z","submitted_at":"2024-01-05T12:59:20Z","title":"Large Language Models in Plant Biology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02789","snapshot_observed_at":"2026-08-12T14:13:29.928166Z","title":"Large language models in plant biology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.928166Z"},"links":{"cited_paper":"/paper/2401.02789","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:297dd6a6bdc3d623c523a0e626d0c8f7a9e1b64419f91f0d9607327b820462a1","observation_id":"d0377570-475b-43ca-b87d-cb35a6b8dd0c","resolution":{"observed_at":"2026-08-12T14:13:29.928166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-16T14:20:31.299446Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-12T14:13:29.934618Z","title":"Salad-bench: A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.934618Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:a18a6d3c8c56b4f10c652aad5ab562b49efec8e8429080d86aea810be8f22fe1","observation_id":"90d8e3c8-4f2f-4112-b717-4f6ae335f782","resolution":{"observed_at":"2026-08-12T14:13:29.934618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:29.941544Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.941544Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:61f9f0fbe6c8cd58136efcf4af152022b440814f96659045678833c94284b148","observation_id":"363eced4-2ff4-43d5-8778-2595877ebb02","resolution":{"observed_at":"2026-08-12T14:13:29.941544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.850422Z","title":"Bran, Sam Cox, Oliver Schilter, Carlo Baldassari, Andrew D White, and Philippe Schwaller","venue":null,"work_id":"5161bd67-85d9-432b-ac68-7812e8b5d4a2","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.950036Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:6e43cb6675fcf943d21b1c51a9b5629d257dc0c997d3f1cde606d8671b43b3e6","observation_id":"283a0f19-1621-421c-98c2-33ccecf9eeef","resolution":{"observed_at":"2026-08-12T14:13:31.876810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.779878Z","title":"Feasibility study on parameter adjustment for a humanoid using llm tailoring physical care","venue":null,"work_id":"cb8e6a18-ac54-4188-89bb-75d570bbe478","year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.955973Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:8e129397d563ee743ece58dfc49e4b64011ec4041f7bbc31ccbacc545f268eac","observation_id":"1286dc47-0650-45b9-b833-9a5a667c6282","resolution":{"observed_at":"2026-08-12T14:13:31.815541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.695651Z","title":"Ghs classification results, 2024","venue":null,"work_id":"99e2b396-60d6-479e-8cd2-9b008bcd1af7","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:29.985121Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:14766b7a251591f46051ff5db8f431f9484efb329a6cd370e39c3b0f715464f4","observation_id":"aa4f2c8a-0342-449e-9f8c-483e2a8c807b","resolution":{"observed_at":"2026-08-12T14:13:31.730801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.605353Z","title":"Forbidden materials, 2024","venue":null,"work_id":"77b08f83-f88f-4b1a-9daf-e22bfbf443ed","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.035469Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:7ad811428fddb2eeeb46f639dced4800061b626ad5a0f7884dc68a5ed71a151b","observation_id":"3b55005b-1c68-48cd-b89f-0506e4a0f26e","resolution":{"observed_at":"2026-08-12T14:13:31.655625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05399","last_updated":"2025-01-10T09:54:54Z","snapshot_observed_at":"2026-08-16T14:02:47.100425Z","submitted_at":"2024-04-08T10:57:25Z","title":"SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05399","snapshot_observed_at":"2026-08-12T14:13:30.092281Z","title":"Safetyprompts: a systematic review of open datasets for evaluating and improving large language model safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.092281Z"},"links":{"cited_paper":"/paper/2404.05399","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:d062a87cbe4b2d499cf001a4d0b879a38fc4c44134a132087e7e5e6c2929ab16","observation_id":"954e25ab-33c8-4929-b8f1-380b590e7ecf","resolution":{"observed_at":"2026-08-12T14:13:30.092281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14029","last_updated":"2023-10-21T14:49:58Z","snapshot_observed_at":"2026-08-18T04:33:17.440727Z","submitted_at":"2023-10-21T14:49:58Z","title":"LLM-Prop: Predicting Physical And Electronic Properties Of Crystalline Solids From Their Text Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14029","snapshot_observed_at":"2026-08-12T14:13:30.100549Z","title":"Llm-prop: Predicting physical and electronic properties of crystalline solids from their text descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.100549Z"},"links":{"cited_paper":"/paper/2310.14029","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:1a8d572f87f5de878f3401dfa75f79fdd1e5015b2c0a5b278d9d4c64411f50f0","observation_id":"dafe91d1-599d-4f26-a3f6-5c41ef31160c","resolution":{"observed_at":"2026-08-12T14:13:30.100549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:30.105680Z","title":"Sci- enceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.105680Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:0623ff929b9aa4655dcd90a87a78da4322fff1db78f47e4333279b95c447c5f3","observation_id":"2b384e7b-4249-4d34-917a-c43584a04316","resolution":{"observed_at":"2026-08-12T14:13:30.105680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.421965Z","title":"Scifinder, 2024","venue":null,"work_id":"5610419c-2853-4bb3-ac5f-ab55b84c634e","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.111553Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:45826d8c40df95decb77b48aee5d00544ed7337d2a94ad95959af451e5c7218d","observation_id":"e8cebf45-4ba9-44e4-9a95-bca374ce03c5","resolution":{"observed_at":"2026-08-12T14:13:31.476645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:30.116533Z","title":"Large language models encode clinical knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.116533Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:7315d1c36a967b0875cf2c9a2606e1772ff17a90e4dd0e1f23d903a12ee9214c","observation_id":"c4d34305-8f25-421a-a737-47ba038d9d36","resolution":{"observed_at":"2026-08-12T14:13:30.116533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.385331Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific research, 2023","venue":null,"work_id":"e9753bda-1145-4105-84ef-d54dd4f40993","year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.122858Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:01c2af86a58cdb333203af0b7768e02b91937eb9e228ee8500838432a85258f5","observation_id":"3256f40b-4469-4936-8317-a2ed30ce3d90","resolution":{"observed_at":"2026-08-12T14:13:31.390532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.365622Z","title":"Prioritizing safeguarding over autonomy: Risks of llm agents for science, 2024","venue":null,"work_id":"8420c87b-c416-4308-8c1f-e1c519a3e66b","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.225702Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:7036ef8bf9c6713bdd8e36f4274f39e6cddb47b67b28d2323a4a4f216d11e343","observation_id":"29247775-4c1e-4820-bf7d-f694f3e14dfe","resolution":{"observed_at":"2026-08-12T14:13:31.371688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08676","last_updated":"2024-06-24T08:50:22Z","snapshot_observed_at":"2026-08-16T14:03:07.627131Z","submitted_at":"2024-04-06T15:01:47Z","title":"ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08676","snapshot_observed_at":"2026-08-12T14:13:30.244731Z","title":"Alert: A comprehensive benchmark for assessing large language models’ safety through red teaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.244731Z"},"links":{"cited_paper":"/paper/2404.08676","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:c575060666b7e63ca91f1ff22a18fe08123562604ce4a8c7576a90276467b915","observation_id":"0acf68a5-75b1-4a76-8a61-9211234ece49","resolution":{"observed_at":"2026-08-12T14:13:30.244731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:30.273619Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.273619Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:97f3f383201fda197e085ac16d168657388909984added1ac7dc80312c4cce43","observation_id":"de03f665-7dd2-4afe-8765-f0a6f20b74a9","resolution":{"observed_at":"2026-08-12T14:13:30.273619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T14:13:30.280099Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.280099Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:9352b2fb2125ede9f0d5f774b6f9cc7b68c5ce82f55496e6f08950d4932c536d","observation_id":"fe1f287c-840b-4581-9fa9-a823de9a8de9","resolution":{"observed_at":"2026-08-12T14:13:30.280099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.332531Z","title":"Decodingtrust: A comprehensive assessment of trustworthiness in gpt models","venue":null,"work_id":"f2b5a70c-2d85-4d76-998c-b400b10f215c","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.286312Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:ada275ab85b19a9b534ea16beb6f8dceb2810889ff726e3b4ca3f8e895a9b376","observation_id":"ae9b171d-8517-40e3-a7f8-8444b9f1f90f","resolution":{"observed_at":"2026-08-12T14:13:31.339126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-12T14:13:30.291357Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.291357Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:a238b5a54cbfad6461c42ac284614c0f6547e70c024cfefbf085a3916aa907b4","observation_id":"6b0c52eb-18a4-4a0f-9cac-851a944fa2cb","resolution":{"observed_at":"2026-08-12T14:13:30.291357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:30.314088Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems , 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.314088Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:2855eb2211dd198b5d78c1e48e4163549f5f048058a4e7c0f4d27e6e5809a059","observation_id":"a022faa0-2d92-4765-bce3-645f518d8ca1","resolution":{"observed_at":"2026-08-12T14:13:30.314088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.299053Z","title":"Chemical weapons convention, 2024","venue":null,"work_id":"7beffdcc-028f-4dc9-a71e-e72d7553251c","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.384200Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:62773ac329de19b3facc3896ab17b3432aed9c66ae199c04e145e0741cd49490","observation_id":"9697a903-1d92-4c1f-9c92-73f4fefc761b","resolution":{"observed_at":"2026-08-12T14:13:31.307569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.199229Z","title":"Controlled substances act, 2024","venue":null,"work_id":"0586ac02-6a9e-4480-9504-ca4df42776e7","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.464135Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:410d8701315c4cb81ffce8e0bff60c79fd07bb8706832f9f1c80835adb0f2095","observation_id":"db6229e4-2efd-48b2-97b1-9460259d5682","resolution":{"observed_at":"2026-08-12T14:13:31.246001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-12T14:13:30.562189Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.562189Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:ef922fbd7a2d52a0d6a9844fb75bb2bdf486838aa9e71ae2b4ee395084453a65","observation_id":"f577934a-aef6-4aab-9eda-6492d96d717c","resolution":{"observed_at":"2026-08-12T14:13:30.562189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13925","last_updated":"2024-04-22T07:03:44Z","snapshot_observed_at":"2026-08-16T13:59:00.952519Z","submitted_at":"2024-04-22T07:03:44Z","title":"MARIO Eval: Evaluate Your Math LLM with your Math LLM--A mathematical dataset evaluation toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13925","snapshot_observed_at":"2026-08-12T14:13:30.592858Z","title":"Mario eval: Evaluate your math llm with your math llm–a mathematical dataset evaluation toolkit","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.592858Z"},"links":{"cited_paper":"/paper/2404.13925","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:d0c920eaa417c3046a33a5b100c3ee48a443656ccd859e8a82cf97028392e84e","observation_id":"734ff493-79bc-433a-8a94-aea1e4f23fec","resolution":{"observed_at":"2026-08-12T14:13:30.592858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06852","last_updated":"2024-04-25T14:34:28Z","snapshot_observed_at":"2026-08-16T14:19:43.618677Z","submitted_at":"2024-02-10T01:11:59Z","title":"ChemLLM: A Chemical Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06852","snapshot_observed_at":"2026-08-12T14:13:30.600439Z","title":"Chemllm: A chemical large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.600439Z"},"links":{"cited_paper":"/paper/2402.06852","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:6367a1c70107e624b6f066fb5b6325dd4e517bcfc455e684334c906c0169ec84","observation_id":"9e1e103c-3c95-44d3-a57a-c00c72da9f64","resolution":{"observed_at":"2026-08-12T14:13:30.600439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00286","last_updated":"2023-12-10T13:58:24Z","snapshot_observed_at":"2026-08-18T10:08:35.100624Z","submitted_at":"2023-11-01T04:36:45Z","title":"JADE: A Linguistics-based Safety Evaluation Platform for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00286","snapshot_observed_at":"2026-08-12T14:13:30.606833Z","title":"Jade: A linguistics-based safety evaluation platform for llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.606833Z"},"links":{"cited_paper":"/paper/2311.00286","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:45295ea199a5c180f77e06ead987c1389fd95fd123a5313378194cc5c54e1aab","observation_id":"e0f023d7-c425-4bcc-83d2-415ce08046d3","resolution":{"observed_at":"2026-08-12T14:13:30.606833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07045","last_updated":"2024-06-24T04:04:21Z","snapshot_observed_at":"2026-08-18T14:35:02.737196Z","submitted_at":"2023-09-13T15:56:50Z","title":"SafetyBench: Evaluating the Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07045","snapshot_observed_at":"2026-08-12T14:13:30.612898Z","title":"Safetybench: Evaluating the safety of large language models with multiple choice questions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.612898Z"},"links":{"cited_paper":"/paper/2309.07045","citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:fd7c61ee32892cea3a90e0b24b0e3edbb9c2080a81f349fc6c6b4c55958de473","observation_id":"484257d8-a543-48f8-8f52-60cdaa5fde61","resolution":{"observed_at":"2026-08-12T14:13:30.612898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:13:31.068490Z","title":"[[rating]]","venue":null,"work_id":"ed45c131-5190-412c-a08b-34112eefe615","year":2024},"citing_paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:13:30.618840Z"},"links":{"citing_paper":"/paper/2411.16736"},"observation_digest":"sha256:72a4311ac22f7f5d5a0707b2521e8400ec288f02d3961342f1a5d1c6f204dd32","observation_id":"a0a33b7e-4953-4859-955f-a468d2ab28bb","resolution":{"observed_at":"2026-08-12T14:13:31.129191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16736","last_updated":"2024-11-23T12:50:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T22:20:30.385271Z","submitted_at":"2024-11-23T12:50:33Z","title":"ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":30,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 8 inbound Pith citation observations for arXiv:2411.16736."}