{"as_of":"2026-08-11T15:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb9a82dd3f39265a9081b83effeab0667fe8afcd9ed3bae23e08ec2e4b47e670","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:44:18.994680Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01317/citation-record","integrity":"/paper/2606.01317/integrity","json":"/paper/2606.01317/citation-record.json","paper":"/paper/2606.01317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":"2202.03286","doi":"10.48550/arxiv.2202.03286","metadata_source":"pith","pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models with Language Models","venue":"cs.CL","work_id":"d1274c54-508f-42f9-aeb3-91db13f3a622","year":2022},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:07ebccb6ba5cff42073e772059648edc0731d0aab2ea9b8c916a7891283e3527","observation_id":"b0a007ea-a870-4cc8-8a61-7d1dd199d7fc","resolution":{"observed_at":"2026-07-01T21:36:15.071498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Proceedings of the 16th","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:4c591e9c9b81a0db883ef40e8f1ab21b3d5507b06a893884bd0d7f5e647a5e08","observation_id":"4c814a72-2663-40e0-ab91-eb609f048e7b","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Extracting Training Data from Large Language Models , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:f0d68cea6ec8f98b8d7eed202e90cb0598b402e5e11a68aa42f3ea184d0edbfe","observation_id":"7b90fe33-20b8-4630-90f4-95fefb774868","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:b1bf05660d72f130f872fff08839815ea2599c6927602f4af0d5aae5474848ba","observation_id":"d7459563-31e4-4fdc-9422-086420ed3837","resolution":{"observed_at":"2026-07-01T21:36:15.069087Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:45d90d9e4004038811b45a2be4a30ed684202553ab9f89d065d4a4a0e8bc35f0","observation_id":"9f57470a-be26-4ef8-97cd-cbd67dd9186b","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Forsyth and Dan Hendrycks , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:cad2146a67326e8df3b630a7cd9b20a49b62115839fe00c281de9a8b3e68d4e4","observation_id":"1e53ebb4-1dec-42d3-bd00-6ed89d372d3c","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Chasing Shadows: Pitfalls in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:183c17677cd3146185d939d1f450645e0b021231e0098b733319928174cfe457","observation_id":"3f34189b-fc60-43d2-b1bb-6419cf2d3b57","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Findings of the Association for Computational Linguistics (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:3d1c06806e5f8b4b8af19cf22efb9d6ea75a5b4dd4e53eff49e087d26e67b8f6","observation_id":"a2f23be2-0ab0-49d4-812b-3b7bf5847f92","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Zico Kolter and Matt Fredrikson and Yarin Gal and Xander Davies , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:fc7138c077d14ece9149b0224ee5df55ad14d90f5fc7799de473403d9c68ccc4","observation_id":"8c3ecaf5-4212-4eee-81a3-8fb7f4900011","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Advances in Neural Information Processing Systems (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:22c5e3706e3a2fb5236b383e92dc57280fbf3fd378238911d21b2a6b3a5492ce","observation_id":"4a39f42e-d611-4a64-b9ae-ca9df611ec69","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:bf9becb21cb642b28182d2c2ecb767ec871d2ffcdcc7cb6c654a2ff3447ddd93","observation_id":"13bcc762-ad98-4574-9b08-55292b7454a4","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Findings of the Association for Computational Linguistics (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:144a02a7a5d649cc1877cb484e79d6e3027d026ec9762e158b6a6ac792094ef5","observation_id":"32c96666-bce1-412f-a7ea-35e976b6acc0","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.698688Z","title":"Qin, Y ., Liang, S., Ye, Y ., Zhu, K., Yan, L., Lu, Y ., Lin, Y ., Cong, X., Tang, X., Qian, B., et al","venue":null,"work_id":"8f8bcd20-c1e6-4d1f-a85f-401fd47e3acc","year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:6d73675c5f7f69ece8a0f8a303c3f5a9fb1e1c0b4b4cd9f8964b393c535455df","observation_id":"d2321bcc-c45c-4a05-8b44-86d74c8aca49","resolution":{"observed_at":"2026-07-01T21:36:15.074645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:f635097eb825d49821127e7468b4ab20c9e6d1080c908293310f79f66ab0a882","observation_id":"b2878297-f368-4b5f-ab3b-26ac00db564f","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:eeab25862572f263d570f7e51906a64518d1a2f40178821efbc46ecfb1293950","observation_id":"9c7489b0-7248-47a7-8e96-96eb6eb8252b","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:261359a829a8a800489de42af27654d6c59ff411d2f6e8ce219c799fb45acdb3","observation_id":"a553fda0-5d2c-4d78-9968-6217012cc40a","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"AgentDojo:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:c75db8d51d11d4e5de9dc30f6aed28668f7e763933071bb6619e0bd7ed782e60","observation_id":"a0a44ef4-f4a6-4b81-9857-e86861ec49e5","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Zico Kolter and Matt Fredrikson , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:593aaef2616859b0dfa6f3d185f0a35bca7c86ffb528741828960a25d0e8cabf","observation_id":"ca446d45-f632-4055-8ae5-f677e5036214","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:bc595c55d90f1cdf7c9cf872782c1a19c68b751f40f775501d050a194a3fe078","observation_id":"f1a0435e-8438-4dd0-8844-e0b1829426ff","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:179237df219ab88ead2d815dfab9e98cc2952b34baae0cdd31fa78630dd62cbd","observation_id":"88d93696-3e02-44b6-bf41-15f7cc886619","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:90304859b180a1f5d5b2747a6dca02c7cae9f6d5e9d5324973414f031f551d6d","observation_id":"1cc0622c-f20f-4d7e-91c4-cbbbfeea2273","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:a8205f76d8b3173d26d12adf44794f077dc5423459cdaa1131b930f3592b077b","observation_id":"ca95514f-71b0-451c-a019-a58b65b88753","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Maddison and Tatsunori Hashimoto , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:8407fbf813050e1492cde5b02c20ce005747e684bc9edcd7b7d09d33e7f82cfe","observation_id":"63957f8f-a573-41e9-90bc-526d4c133cef","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:c8810185e46a6abee8ace603495b84c1c03274a279fe17041b6fbe39b265b104","observation_id":"bf7be383-ee5b-430c-98b0-968c893b5343","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-10T13:10:29.115486Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":"2312.04724","doi":"10.48550/arxiv.2312.04724","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2312.04724 [cs]","venue":"arXiv (Cornell University)","work_id":"45b8079b-5204-450f-8024-f3a8142583a9","year":2023},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:388f88a68180857f939e96457e6404406dfd2014502006b250f3c8ccde80c05d","observation_id":"0e47e741-ab83-4a5a-aa3c-4c83b18a6e4d","resolution":{"observed_at":"2026-07-01T21:36:15.066149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:44:18.994680Z","title":"Findings of the Association for Computational Linguistics:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T16:44:18.994680Z"},"links":{"citing_paper":"/paper/2606.01317"},"observation_digest":"sha256:8e30bf245f0d78ad22093d0262954c69a1ff900125164c4f23d971fcbc0b798b","observation_id":"71153747-9fc8-4aaa-b81c-dc3add28371f","resolution":{"observed_at":"2026-06-28T16:44:18.994680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01317","last_updated":"2026-05-31T16:06:02Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-10T05:39:13.866749Z","submitted_at":"2026-05-31T16:06:02Z","title":"SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":21,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2606.01317."}