{"as_of":"2026-07-22T05:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29e5baedca678391cea042be24020b58ca59d3a31b83fd745426097ea3f63dd2","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:08:05.893904Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.10779/citation-record","integrity":"/paper/2605.10779/integrity","json":"/paper/2605.10779/citation-record.json","paper":"/paper/2605.10779"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentharm: A benchmark for measuring harmfulness of llm agents","venue":null,"work_id":"692b0845-fac6-45a8-8c8e-885519b799da","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:d56890d631b5e67436c9d8b09b2c72050ea353304d7225f511bc668b612148e5","observation_id":"25347ef8-f034-433d-82f4-0317f3b8a608","resolution":{"observed_at":"2026-05-12T16:26:43.228999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System card: Claude Sonnet 4.6","venue":null,"work_id":"6f318d0e-c7ba-4dcb-a159-267bee74e822","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:ab28a75f69b9cdd3e25c35fd95621b5647a74e10a6c5544cb4d91bdb59fcaf68","observation_id":"7a04aab9-ac02-4a30-8e31-b425cedff576","resolution":{"observed_at":"2026-05-12T16:26:43.249477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenClaw 2026 security crisis: Protect your API keys now","venue":null,"work_id":"91b237d4-4097-4a93-a98b-34c4609f0df9","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:542c921d490b6da95cf42a86344b95907363dcc6d21f13da8560a087418bd775","observation_id":"fda9ff58-de75-42f5-861d-ad4916e81e84","resolution":{"observed_at":"2026-05-12T16:26:43.171809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Windows agent arena: Evaluating multi-modal os agents at scale","venue":null,"work_id":"4df3fbb2-48b6-4dec-b5f2-a53e31c6c209","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:d2c57dfb8290ca321548ca5d467f5d279e270bd61ab1fb22873db260583ffaec","observation_id":"f17b7352-a605-41d7-be2f-cf80c44c2d32","resolution":{"observed_at":"2026-05-12T16:26:43.128527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.16943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:07:41.485234Z","title":"Mind the gap: Text safety does not transfer to tool-call safety in llm agents","venue":null,"work_id":"5d0462dc-84ae-4bd0-8120-2264efe3c6c0","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:397a8fedcf7ef51bf22e00ac342d90ec010008604487a6c7574b791e931a4efc","observation_id":"a8b99f5f-08e3-4e3e-ba1f-60660968ef3a","resolution":{"observed_at":"2026-05-12T06:36:26.758976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teleai-safety: A comprehensive llm jailbreaking benchmark towards attacks, defenses, and evaluations","venue":null,"work_id":"f6887fd0-1bac-4378-b68a-7d1fbc45e68d","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:4ac061ca406a40e4e7c3002c6b0b5b247a29a1fd03e7ab0c7e9c7c3a4657a76c","observation_id":"75b9a77b-fd56-4ca3-b28c-7d1710bb0bf0","resolution":{"observed_at":"2026-05-12T06:36:26.765247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentdojo: A dynamic environment to evaluate prompt injection attacks and defenses for llm agents","venue":null,"work_id":"3e68ac6d-0201-4f88-8ff2-8133ed647999","year":2024},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:56b6e49c91ef1ca882a233990756ebccb3d8f8ec93c8ea56f9ea3ed6f387c6c6","observation_id":"d50e995d-1a9a-4250-a896-33517ebcf31d","resolution":{"observed_at":"2026-05-12T16:26:43.180008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-V4: Towards highly efficient million-token context intelligence","venue":null,"work_id":"528891b8-d1a2-4234-abe6-069321948e9a","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:40dbb229252ab16a72dbd72c933d9c89bb733f73e712731b4310a52f04cd4b5c","observation_id":"e03808e8-26fc-438b-ab90-759db19a0ec6","resolution":{"observed_at":"2026-05-12T16:26:43.237138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:0ecc3a162c77b35e78c14fda33c54c87b493f5594803740e005fb859ae277522","observation_id":"d1507b5f-e09d-4e89-b4fb-ec738fcf91a0","resolution":{"observed_at":"2026-05-12T06:36:26.870498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:47:50.254511Z","title":"Sok: The attack surface of agentic ai–tools, and autonomy","venue":null,"work_id":"c185362d-a226-40fa-a8d2-fc48331ef5bf","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:16251671945f9502b330d082a75a03a677be10861dc0576419e8dcc630f72103","observation_id":"287fef8e-2eef-47bf-8305-0f94ee4cfeb9","resolution":{"observed_at":"2026-05-12T06:36:26.746191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wasp: Benchmarking web agent security against prompt injection attacks","venue":null,"work_id":"b3a7458b-4d7b-4e50-b274-4d075ee9b40e","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:da64062ea24ce6270f4ba5c79ee5ce9aedc58d5382737d911ffd973fd488b152","observation_id":"8865d338-5b76-4706-900b-6df475dbfcef","resolution":{"observed_at":"2026-05-12T16:26:43.241892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenClaw security issues include data leakage & prompt injection","venue":null,"work_id":"72b3bd15-32e5-4665-8c18-7822bf445532","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:bd0933604a6d466245e76b3585ee56c8d3ed9c1e2f6a4fa67cc449611050ed24","observation_id":"ef8ede4c-3c49-4dbb-b7d2-898cb6af804d","resolution":{"observed_at":"2026-05-12T16:26:43.276107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Security advisories for OpenClaw","venue":null,"work_id":"d63b0e3c-de4d-498c-942b-3dca5d045a59","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:b9042f9f21bedf287e52fcda3a1b2f6956affc4b39365536a6666d64ce665238","observation_id":"6f355e14-b6ac-42bf-a936-a9f769c8279d","resolution":{"observed_at":"2026-05-12T16:26:43.200940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SSRF in image tool remote fetch in OpenClaw.https://github .com/openclaw/openclaw/security/advisories/GHSA-56f2-hvwg-5743","venue":null,"work_id":"e5c0a08a-9838-403b-aa19-07f37b8239b2","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:11ad65b5261385e3ed7621158ff41ad88f71717fb8f5f4b6ddbba083c9e8279d","observation_id":"cd7f7159-18a2-4d29-995f-9c2232da4f9d","resolution":{"observed_at":"2026-05-12T16:26:43.197099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenClaw nostr privateKey config redaction bypass leaks plaintext signing key via config.get","venue":null,"work_id":"0f23f7b0-db46-4577-8d23-55aea5c23118","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:63a026ec8af24d7e37df7cf047a2990687685a0f73cdc72379e255d5b0643110","observation_id":"d843f2e7-b45a-44e7-b698-9b06b453eb5f","resolution":{"observed_at":"2026-05-12T16:26:43.205162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3.1 Pro model card","venue":null,"work_id":"7e5ea2f3-e124-4ed5-9429-b593ecd69065","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:733d16cc6bd5203bc3b6bef7a9328aac46d955164ee90d62656403da568d32c1","observation_id":"34dacf78-8f10-45d8-9809-62bbfb04e622","resolution":{"observed_at":"2026-05-12T16:26:43.208440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10044","last_updated":"2026-06-03T17:59:34Z","snapshot_observed_at":"2026-07-15T13:17:46.769726Z","submitted_at":"2026-03-08T01:37:45Z","title":"Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety","version":2},"cited_work":{"arxiv_id":"2603.10044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.10044","snapshot_observed_at":"2026-07-02T23:07:27.090002Z","title":"Safety under scaffolding: How evaluation conditions shape measured safety","venue":"cs.SE","work_id":"db96fa97-ba08-4291-b236-d332f5e483f1","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2603.10044","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:dcd22ca02a8e6fe210631e9eec65e0a506a025c1597d38749250b0d39590e41f","observation_id":"98ec8e2c-151d-46c8-b4d3-4be3a69c242c","resolution":{"observed_at":"2026-06-04T03:08:16.834969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Researchers reveal six new OpenClaw vulnerabilities","venue":null,"work_id":"530245e9-6c3a-4501-a65e-df3a0fe3ce28","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:3a3ae0348a832357c923bcc588af91abc7911a8672a643b433a21849959baf35","observation_id":"fbe1e613-c4e2-4a2c-aeb0-8ca6f54c08a3","resolution":{"observed_at":"2026-05-12T16:26:43.217424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.16901","doi":"10.48550/arxiv.2602.16901","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Jiang, Y","venue":null,"work_id":"1e8d816d-5eec-49eb-af9b-3c3796137e22","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:473a3aa09507fc97db366a63607eab36d20f7b8b785e1fe81ab80478288b76ba","observation_id":"591d3d8c-5b9a-45f5-82c2-16605617d6b7","resolution":{"observed_at":"2026-05-12T06:36:26.824950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Os-harm: A benchmark for measuring safety of computer use agents","venue":null,"work_id":"8afc630d-da0d-4fae-be85-c1d37af5b414","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:921173eedab07585850303f51539d1c8ffaed4de4c0ecc295f2047ed716b6809","observation_id":"e9ca5bb6-b05d-44e4-a8bd-79a41dbbeec4","resolution":{"observed_at":"2026-05-12T16:26:43.232994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sec-bench: Automated bench- marking of llm agents on real-world software security tasks","venue":null,"work_id":"f797a3e9-4e78-43b9-8095-5c0afcf15df6","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:299b33f1582f0d9d338880c733f4c8b72199ae2f8ff0e31900894caaf5ce8232","observation_id":"f0a8a938-e0b2-43b7-bda1-42eb5809d47f","resolution":{"observed_at":"2026-05-12T16:26:43.184208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.28139","last_updated":"2026-05-01T09:39:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T17:23:19Z","title":"Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows","version":2},"cited_work":{"arxiv_id":"2604.28139","doi":"10.18653/v1/2023.emnlp-demo.28.https://aclanthology.org/2023.emnlp-demo.28/","metadata_source":"pith","pith_arxiv_id":"2604.28139","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows","venue":"cs.SE","work_id":"519230b1-eb35-4f2c-a0ed-824ba45c6abd","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2604.28139","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:6f74a5098ceb503fc74b2977e7e9941705e359ae1151cf90c8eacae7c229d39a","observation_id":"2db58369-1310-4a60-83d4-3cbf9dc76cbc","resolution":{"observed_at":"2026-05-12T06:36:26.733753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05172","last_updated":"2026-04-08T09:27:21Z","snapshot_observed_at":"2026-07-06T22:54:00.211106Z","submitted_at":"2026-04-06T21:09:06Z","title":"ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces","version":2},"cited_work":{"arxiv_id":"2604.05172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05172","snapshot_observed_at":"2026-07-03T06:07:41.480446Z","title":"ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces","venue":"cs.AI","work_id":"1d0d802c-947a-4c92-8995-c392b01261d7","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2604.05172","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:1bbda66b862cc408459c2b9a75bd81d72ba15e3fb86c7988d651c2c0cd8bf440","observation_id":"0686fc54-fca5-421e-95d6-79a9bb105864","resolution":{"observed_at":"2026-05-12T06:36:26.861402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25747","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Besafe-bench: Unveiling behavioral safety risks of situated agents in functional environments","venue":null,"work_id":"b5e1c973-d1fd-421b-a784-e1fec87a7909","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:3dd87d99a169f7c503957739e95450deb196eb648aa9da269f1feb9177fe7f7c","observation_id":"ee976a74-c2e8-4c40-9e88-6af6a0b9c889","resolution":{"observed_at":"2026-05-12T06:36:26.807870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":"a4341733-eb4e-4b0e-b28d-8e5c14f00c68","year":2024},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:56719caa60b9c77dfbb4ecd53bc89b0b99ac72200021e7aaa482258f7e250b29","observation_id":"6ef0844a-8a1b-4c52-a106-74b3fc8819aa","resolution":{"observed_at":"2026-05-12T16:26:43.221422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces","venue":null,"work_id":"772ae841-d121-4852-8787-6e735c4f4e83","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:dab67e0157fa26d4cca682129d7795b593eef8e3343108200e069bb5569b6169","observation_id":"912a0731-be66-4907-ac9f-bd6b05868032","resolution":{"observed_at":"2026-05-12T16:26:43.225238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CVE-2026-26322: OpenClaw SSRF vulnerability in gateway tool via unrestricted gatewayUrl parameter","venue":null,"work_id":"6207542c-375c-45b5-98fe-fe9672ca7168","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:c24ac1a0c795b0754cce7102217198b91319a7b790b1d14c395fdf01a2c01ad4","observation_id":"955d3ad5-a082-4171-b960-c862ed561857","resolution":{"observed_at":"2026-05-12T16:26:43.261556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CVE-2026-43528: OpenClaw security vulnerability","venue":null,"work_id":"ec6d54b6-2abd-4e78-8881-92a49cb4fd8d","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:d82442ff8c491e157cc5bffe62dbe24822a21ccba31db0f268ce81fdc3d7a1e6","observation_id":"8e7cb622-bc14-437a-8acc-5c1aaf8ce550","resolution":{"observed_at":"2026-05-12T16:26:43.160025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CVE: Common vulnerabilities and exposures","venue":null,"work_id":"27f3b860-ae55-4a3b-8bc5-3189138b2ae6","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:82456fdef571baeed803e5127bb7c9312df0f2b8da51a9a34c3fbd20adb97315","observation_id":"93f3511b-3c72-4da4-8445-113789dfcede","resolution":{"observed_at":"2026-05-12T16:26:43.147190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PinchBench: An independent benchmark for OpenClaw agent performance on complex real-world tasks.https://pinchbench.com/","venue":null,"work_id":"fd615533-90c3-478b-bc09-d2d6d7f2bf77","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:305dd9685e6920c30ac7dbac5d5f0bf713fbbbd4719250d1f9c44aa73346be64","observation_id":"090fed7d-4139-465e-a357-9c52fa2a8e21","resolution":{"observed_at":"2026-05-12T16:26:43.140141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-5.3-Codex system card","venue":null,"work_id":"21fce7d6-bdb8-42bf-b5f8-4901288badbd","year":null},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:ce32bb8f0775260cce8bb239f452f87c43452dece7f8596cd253a9f017833ba1","observation_id":"fe37f0e3-d05b-4c4b-9de4-d24f2c0b8871","resolution":{"observed_at":"2026-05-12T16:26:43.156006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fc4cddff-20f2-4eb2-b2cd-c4fb9aa957f2","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:0fee2c2a7d6234980381aa00d782f59807deed28b8ee544eb6682858dd3f03e1","observation_id":"36b6e734-bfbe-4d30-9147-c1dee5d9bcac","resolution":{"observed_at":"2026-05-12T16:26:43.143544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Known vulnerabilities.https://clawdocs.org/securit y/known-vulnerabilities/","venue":null,"work_id":"1731ae78-d3ec-4116-8708-03f85ab95b10","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:9c2a945198aa4a1ebd94c1972925c231a499e4246cca48f3fbd41b4d23653927","observation_id":"35994066-7dd9-4da6-a124-593cc4c88d49","resolution":{"observed_at":"2026-05-12T16:26:43.152106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The OpenClaw prompt injection problem: Persistence, tool hijack, and the security boundary that doesn’t exist","venue":null,"work_id":"f06a6b15-5bea-4121-8136-cd41628684e8","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:839e5f6a4c65af145551e38e206ec628b60618336aa610d1e044c2ce1e3fec4a","observation_id":"4b7a497d-b483-471a-8a3d-9174d9177d2c","resolution":{"observed_at":"2026-05-12T16:26:43.164081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.6-Plus: Towards real world agents","venue":null,"work_id":"722406a8-9e55-4cc6-bbc0-1681a653f408","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:0015b5dd10b79688249865a49b57ddca467c527cf9e01820c7629991fb8b5cea","observation_id":"02d19e5a-b245-4305-ab78-ebbfc86e1139","resolution":{"observed_at":"2026-05-12T16:26:43.168234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identifying the risks of lm agents with an lm-emulated sandbox","venue":null,"work_id":"97de76da-d06e-4809-ad00-a18053d885be","year":2024},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:7493e212599fa7c4445fe22b56ae8c14c289f6907ea13caa94a9c0c67209dcf5","observation_id":"02591845-6c30-4b65-918c-0ab860ccfaf7","resolution":{"observed_at":"2026-05-12T16:26:43.120687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01359","last_updated":"2026-06-15T23:34:33Z","snapshot_observed_at":"2026-07-06T22:31:24.978726Z","submitted_at":"2025-10-01T18:38:20Z","title":"Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks","version":2},"cited_work":{"arxiv_id":"2510.01359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.01359","snapshot_observed_at":"2026-06-19T17:09:49.202012Z","title":"Breaking the code: Security assessment of AI code agents through systematic jailbreaking attacks","venue":null,"work_id":"3a12a39d-f970-48f8-a362-0da8dcb2db50","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2510.01359","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:05c2eb6a46c6cf6558a9cd8d8cc0e547da64f01c2c624ad13e5e66d19ebc5233","observation_id":"0d635b06-c562-462c-8943-ee37d329e3fa","resolution":{"observed_at":"2026-06-19T17:09:49.202012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27517","last_updated":"2026-05-13T20:27:01Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-29T04:51:27Z","title":"A Security Analysis of the OpenClaw AI Agent Framework","version":3},"cited_work":{"arxiv_id":"2603.27517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.27517","snapshot_observed_at":"2026-06-30T18:55:00.632625Z","title":"A Security Analysis of the OpenClaw AI Agent Framework","venue":"cs.CR","work_id":"abba296b-1a4a-4dc4-90eb-bcca20d872df","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2603.27517","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:d989b9b007f95f5ca35a1d476417b34f601dd3d4b63f023dc7fddc1bc02a5b3d","observation_id":"15ecae64-40df-4897-a1b1-2bc47fd6673c","resolution":{"observed_at":"2026-05-13T01:45:22.267689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta is having trouble with rogue AI agents","venue":null,"work_id":"b02f3e1d-123b-4863-bf71-4734d073fc9c","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:9c08a43f1effd1f826810e8a2ec33a6ded140caf2c2db98fed383def6afd62aa","observation_id":"19ec58f4-ac51-41f0-8ae1-07931c2a39b6","resolution":{"observed_at":"2026-05-12T16:26:43.124902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MITRE ATT&CK: Adversarial tactics, techniques, and common knowledge.https://attack.mitre.org/","venue":null,"work_id":"253579c5-0094-432e-ae77-51f2dc7cfa5a","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:3c2a443b2ff8a3e53dab9558ea6aeec94f44c8b861cc95c0cce4597ba85f0292","observation_id":"c3d819d0-9c6c-4239-a17e-c7b28bac36f1","resolution":{"observed_at":"2026-05-12T16:26:43.132359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01438","last_updated":"2026-04-04T15:18:43Z","snapshot_observed_at":"2026-07-06T22:51:35.522923Z","submitted_at":"2026-04-01T22:24:24Z","title":"ClawSafety: \"Safe\" LLMs, Unsafe Agents","version":2},"cited_work":{"arxiv_id":"2604.01438","doi":"10.48550/arxiv.2604.01438","metadata_source":"pith","pith_arxiv_id":"2604.01438","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ClawSafety: \"Safe\" LLMs, Unsafe Agents","venue":"cs.AI","work_id":"65792180-ed14-4f36-a1e6-78f74ed5224d","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2604.01438","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:1f179251ec4ac0d55c88c5f4997b9ab743caa520e51a4ff87738066a607a834b","observation_id":"75c0bbf1-234b-4d75-8b57-1b27d456dd5e","resolution":{"observed_at":"2026-05-12T06:36:26.833350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safetoolbench: Pioneering a prospective benchmark to evaluating tool utilization safety in llms","venue":null,"work_id":"c51e889e-609f-41da-844e-9cc3779f2772","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:aae3aca6d2df794b6f5a9c03f50ab58f1be4adc176d2861f533ed92b2029e278","observation_id":"dea6e0f3-4bd3-42da-8494-666d80c8ba0d","resolution":{"observed_at":"2026-05-12T16:26:43.136296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"ecdeea8a-7b4b-4444-9b29-4d5474c20a39","year":2024},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:b9134fcd0bc85cb30391dfc1d3b0de7c114e5cc490f5dcdf4732bcc45f5aaa8f","observation_id":"10f89a0e-15b8-4ba6-b48f-04b89abc1c07","resolution":{"observed_at":"2026-05-12T16:26:43.175876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"cited_work":{"arxiv_id":"2604.06132","doi":"10.48550/arxiv.2604.06132","metadata_source":"pith","pith_arxiv_id":"2604.06132","snapshot_observed_at":"2026-07-11T01:37:42.602509Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","venue":"cs.AI","work_id":"57acc3ec-f4c3-49ab-bd0f-5aab91002df9","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2604.06132","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:9fac0239eb225d2f35062e15b8dd137b880106987f9d277cd80e9727d8a60406","observation_id":"dcf30c38-2ed2-482b-b851-7d516d2bec5c","resolution":{"observed_at":"2026-05-12T06:36:26.884477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Injecagent: Benchmarking indirect prompt injections in tool-integrated large language model agents","venue":null,"work_id":"e8ba7757-f62f-4466-befe-0ff73580780c","year":2024},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:9bbac94a512f223d6057b22f9dd40cfc9246f466dfc4993750044aa46c5c7d44","observation_id":"b6df349a-4ce0-4f00-929f-43da6817fedf","resolution":{"observed_at":"2026-05-12T16:26:43.253628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agent security bench (asb): Formalizing and benchmarking attacks and defenses in llm-based agents","venue":null,"work_id":"5a535836-6d0d-4e5a-9545-458e8fa79ac9","year":2025},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:d33f7dd5f56a7b7d29cb666acad97e8a9bcfb9e17b32c93b526898f5d00e2fa0","observation_id":"d4a718db-00e6-412c-92e4-3089f24083d9","resolution":{"observed_at":"2026-05-12T16:26:43.266707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08523","last_updated":"2026-07-20T17:58:40Z","snapshot_observed_at":"2026-07-22T04:21:34.184261Z","submitted_at":"2026-04-09T17:57:13Z","title":"ClawBench: Can AI Agents Complete Everyday Online Tasks?","version":2},"cited_work":{"arxiv_id":"2604.08523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08523","snapshot_observed_at":"2026-07-10T01:46:41.301646Z","title":"ClawBench: Can AI Agents Complete Everyday Online Tasks?","venue":"cs.CL","work_id":"cb5e61b1-57bf-472b-825c-ddee917acd58","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2604.08523","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:d71373b38b1d6fe33694c9a0fde0228d5e8311d24efa3cd8925e80e1d5fe2fd7","observation_id":"c10ab230-deea-4f9e-86f4-1c726cf894d9","resolution":{"observed_at":"2026-05-12T06:36:26.815083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-11T02:47:49.837877Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:b086c2f94e7550cf5dfce2addfdaa91a16fb50622d8451479c6fb0bf6f522e96","observation_id":"d2f40add-ce62-4dc1-95c7-babccf75ff46","resolution":{"observed_at":"2026-05-12T06:36:26.876698Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"destructive actions","venue":null,"work_id":"9859479c-ecea-4308-89c0-8b8eaa68b8b7","year":null},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:6efdc2c2a739c001ff975016df155a3db44da664ba71ceaf403a2f063e0cc684","observation_id":"98a215d5-998e-4099-b9e3-368a6c3dac27","resolution":{"observed_at":"2026-05-12T16:26:43.245656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"958a8053-73ad-4d05-8064-bf67fdccdeba","year":null},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:ce9dcf83a13bb8f796818f2fc5eb782f94c4384599732907270c6325b7450bf8","observation_id":"fc44a2ab-a9c3-4bd1-bc1e-6352418eb984","resolution":{"observed_at":"2026-05-12T16:26:43.257291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are you sure?","venue":null,"work_id":"21d2c60f-c5dc-4dba-8c9f-27b852b60f94","year":null},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:f1761d1124f49bcf1278b0fb5670fa12ae9cc221f88078c3896f1ece2c7f7cc0","observation_id":"0d23b74f-6cd4-47ae-915e-fb617963f808","resolution":{"observed_at":"2026-05-12T16:26:43.271777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are you sure?","venue":null,"work_id":"a93fe6c5-b244-46ca-ae59-feedb2daef98","year":null},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:eba0a8b041ec3ab27342a456beb2e0ebe977c761640cd37d54634ab4f5dbbbb6","observation_id":"2e20461e-dec2-4ee2-937d-1a8c6b7a9c87","resolution":{"observed_at":"2026-05-12T16:26:43.192999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c38238f9-9688-4780-9650-c142e44eda4d","year":null},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:59bd9a9cb43e1851b825d3b9d870f37c7c976d3c8a14e036df32ca6a951152a9","observation_id":"48f05cc4-00d7-4f4c-b030-067cc233f7f4","resolution":{"observed_at":"2026-05-12T16:26:43.189103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://api.eve.com/v1","venue":null,"work_id":"06bcac7b-1910-4f3f-b00a-75a7df86862c","year":2026},"citing_paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:05.893904Z"},"links":{"citing_paper":"/paper/2605.10779"},"observation_digest":"sha256:39ecafcc8eaa4967f979de4b189dbcf17af909116f6ec18a91866a4aba305aaf","observation_id":"0b489a9f-1005-4e02-98ca-289d0c0170e8","resolution":{"observed_at":"2026-05-12T16:26:43.213497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10779","last_updated":"2026-05-11T16:14:04Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:14:04Z","title":"LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":39},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2605.10779."}