{"as_of":"2026-08-04T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3937462c812b9338a203568b3009c8d14bb363575e8b1d11f706565c9c256849","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:32:05.798089Z","state":"measured"},{"denominator":127,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":127,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:19:50.579212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2604.17243","last_updated":"2026-04-19T04:04:44Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T04:04:44Z","title":"RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T06:48:11.250689Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2604.17243"},"observation_digest":"sha256:096e47f10d05ab00ca466744d08381f22efaeb0fe4ad9399ecd37827e2c6816c","observation_id":"6ed70e2c-2a10-4796-bf45-1aefcfc0e33d","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2604.23897","last_updated":"2026-04-26T21:48:01Z","snapshot_observed_at":"2026-08-03T01:45:27.083478Z","submitted_at":"2026-04-26T21:48:01Z","title":"MarketBench: Evaluating AI Agents as Market Participants","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T06:05:07.499390Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2604.23897"},"observation_digest":"sha256:7cbb2ae5ffdae988433b99f40a663ce7e67f75e3f571b725f0a970fc353f2cae","observation_id":"0a2bdf16-e43e-41f4-9865-d911d5e96a1f","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.01428","last_updated":"2026-05-02T12:59:14Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T12:59:14Z","title":"Hallucinations Undermine Trust; Metacognition is a Way Forward","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T14:29:54.924293Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.01428"},"observation_digest":"sha256:e85e4bd18ff0eb04bd74d1fdbb3ce9344259552d426fdd01785c4934476521ce","observation_id":"9889ff19-7931-4bf1-9783-b3025e31eb08","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.10516","last_updated":"2026-05-11T13:06:24Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:06:24Z","title":"Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:15.286881Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.10516"},"observation_digest":"sha256:54ae4f9f74ddffc6eaeca2896738bea4c49ed71f6857b35cebbb33624c146372","observation_id":"c9384694-029a-4423-b4c9-cf36be9197cc","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:05:44.188530Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:58b84b190069453b4fd8f7a5fc2ce2b91e0dceccdd3c41d2f0299d7a4ee5182d","observation_id":"a08f4184-c304-4a8d-bea9-b0e684746564","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-02T14:19:50.579212Z","title":"Towards a science of ai agent reliability, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:50.579212Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:010e41f0bbf776f4545813ec291e3e2daa516a92348499628ff19d6f5109a8ee","observation_id":"ead9c734-8157-4dc3-97af-de282ca33a1d","resolution":{"observed_at":"2026-08-02T14:19:50.579212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.12078","last_updated":"2026-05-12T13:05:02Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:05:02Z","title":"Property-Level Reconstructability of Agent Decisions: An Anchor-Level Pilot Across Vendor SDK Adapter Regimes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T04:58:02.620334Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.12078"},"observation_digest":"sha256:77b325da410ca88c22ceed80569fe6abecf0e0d64cae1e2514359a0991af8b38","observation_id":"f85ca813-783e-4d8c-9295-bf08cf54d27f","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.19149","last_updated":"2026-05-18T22:03:38Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-18T22:03:38Z","title":"Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T10:29:17.065496Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.19149"},"observation_digest":"sha256:019c1dda41e24cdc64b238b2b97390661173b32be5610471d5dc95825e91ef1e","observation_id":"7bb037b1-d4a2-4479-9f34-f0ab9238a985","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.20520","last_updated":"2026-05-19T21:42:32Z","snapshot_observed_at":"2026-08-03T02:30:24.579386Z","submitted_at":"2026-05-19T21:42:32Z","title":"Open-World Evaluations for Measuring Frontier AI Capabilities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T06:38:51.427985Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.20520"},"observation_digest":"sha256:282949007d5812ce6b4fafc02d5c0bf43aa66b6ff7a76ab9338c2c400825b1e1","observation_id":"f5569acb-0f07-4d96-81bf-aea1fb9b8e79","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.21694","last_updated":"2026-05-20T19:52:24Z","snapshot_observed_at":"2026-07-06T23:32:05.693503Z","submitted_at":"2026-05-20T19:52:24Z","title":"PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:19:26.725722Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.21694"},"observation_digest":"sha256:44bb80ae05edf0d7a62b131ca8338281296b859a43cde1f9db57ffccc78be4b7","observation_id":"d8433886-6462-4a12-a5e7-8d1c216ffe06","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2605.23330","last_updated":"2026-05-22T07:45:04Z","snapshot_observed_at":"2026-08-02T05:47:41.731065Z","submitted_at":"2026-05-22T07:45:04Z","title":"Security, Privacy, and Ethical Risks in OpenClaw","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-25T04:25:49.102385Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2605.23330"},"observation_digest":"sha256:468729ca1b221dd85ebc3cfcfb8e3952df0d73a0231fc2470400850de9547d73","observation_id":"de17cb54-7b6e-469d-85e6-fb7155f42c92","resolution":{"observed_at":"2026-06-03T02:05:13.650582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.02494","last_updated":"2026-06-01T17:01:53Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:01:53Z","title":"Monitoring Agentic Systems Before They're Reliable","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T13:28:46.165040Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.02494"},"observation_digest":"sha256:54f2c8bbf669cf0c4b438b14ba84e3011c9e7b916f44fc9b2255cfbdd312cb38","observation_id":"bffe2de8-0724-4fb9-a889-fa4f1c7dcafc","resolution":{"observed_at":"2026-07-02T00:16:25.063284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.10711","last_updated":"2026-07-15T14:06:51Z","snapshot_observed_at":"2026-08-02T11:57:58.809406Z","submitted_at":"2026-06-09T11:15:48Z","title":"The Agentic Web Requires New Normative Infrastructure","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-27T11:55:10.777827Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.10711"},"observation_digest":"sha256:7304d931533d480cac3590b11591c964b71151e922e9bce18f7339523f5abeda","observation_id":"55698cfa-3644-4578-8c9c-f76697b1024b","resolution":{"observed_at":"2026-06-28T02:41:32.588820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.10711","last_updated":"2026-07-15T14:06:51Z","snapshot_observed_at":"2026-08-02T11:57:58.809406Z","submitted_at":"2026-06-09T11:15:48Z","title":"The Agentic Web Requires New Normative Infrastructure","version":1},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-06-27T11:55:10.777827Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.10711"},"observation_digest":"sha256:aba3e2eab0fb1e82c2e885c645fe7cfabfe9ff3d6e169e6c78cfe56dd1c89f4f","observation_id":"48fdb14d-6f07-44a3-b77e-7bb71b09e991","resolution":{"observed_at":"2026-07-03T07:37:45.656513Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-02T11:58:03.111695Z","title":"Towards a Science of AI Agent Reliability , February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10711","last_updated":"2026-07-15T14:06:51Z","snapshot_observed_at":"2026-08-02T11:57:58.809406Z","submitted_at":"2026-06-09T11:15:48Z","title":"The Agentic Web Requires New Normative Infrastructure","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-02T11:58:03.111695Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.10711"},"observation_digest":"sha256:a73b51d0f7ecec701522f2fcc4a72e37defa743d0f4bf74f2dd23b30737f92f7","observation_id":"f6c2acb3-5074-466a-9337-56e16cc5eb01","resolution":{"observed_at":"2026-08-02T11:58:03.111695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.18121","last_updated":"2026-06-16T16:21:52Z","snapshot_observed_at":"2026-07-06T23:53:36.096914Z","submitted_at":"2026-06-16T16:21:52Z","title":"On the Reliability of Networks of AI Agents: Density Evolution, Stopping Sets, and Architecture Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T21:47:40.583759Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.18121"},"observation_digest":"sha256:03400d30e396d45b11540f4f5e9cb7a74fbe28dab544efe6189d2aa8bba08b30","observation_id":"fcb7779e-f229-4214-aeb0-628d711248b3","resolution":{"observed_at":"2026-07-03T23:49:02.316356Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.19380","last_updated":"2026-06-23T21:39:23Z","snapshot_observed_at":"2026-08-02T16:17:49.865974Z","submitted_at":"2026-06-13T18:29:53Z","title":"ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T03:55:09.415657Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.19380"},"observation_digest":"sha256:7833c20f61f184f750bf09ada194b969962de19afbac98e5ea6044f9b461449b","observation_id":"87e4f5f4-b3a6-481d-883b-ec359783bf39","resolution":{"observed_at":"2026-07-03T17:38:44.290825Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.20695","last_updated":"2026-06-15T07:25:11Z","snapshot_observed_at":"2026-08-01T19:30:08.037495Z","submitted_at":"2026-06-15T07:25:11Z","title":"How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T02:49:04.341583Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.20695"},"observation_digest":"sha256:361c35893e3dc2b689bd0dee79faf5f491a5b3f7bc5538716c982435787a5b26","observation_id":"31c8b8ae-ac70-421a-af47-9895648093ad","resolution":{"observed_at":"2026-07-03T18:28:49.823913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":"2602.16666","doi":"10.48550/arxiv.2602.16666","metadata_source":"pith","pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rabanser, S","venue":"cs.AI","work_id":"d2833ef7-9399-45cf-85f4-9513c6d8947f","year":2026},"citing_paper":{"arxiv_id":"2606.26158","last_updated":"2026-06-23T22:30:44Z","snapshot_observed_at":"2026-08-01T02:19:45.706411Z","submitted_at":"2026-06-23T22:30:44Z","title":"Life After Benchmark Saturation: A Case Study of CORE-Bench","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T01:17:50.141575Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2606.26158"},"observation_digest":"sha256:23abf1d1c01d145997ad075a0f92cca52c3001152e53d8a7b9938019bd1457d0","observation_id":"28fdfbb4-b973-44a3-ac86-c5c0f797105d","resolution":{"observed_at":"2026-07-04T15:49:57.809667Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.907883+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-12T05:44:33.099337Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02972","last_updated":"2026-07-03T05:28:43Z","snapshot_observed_at":"2026-08-04T09:23:39.890170Z","submitted_at":"2026-07-03T05:28:43Z","title":"A Scalable Approach to Evaluating Moral Sensitivity in LLMs","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-07-12T05:44:33.099337Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.02972"},"observation_digest":"sha256:1c61e1c823ba80eb1ab77857ce7531bd378a9e062f9c1d2e2f0172297c5d318b","observation_id":"9f275142-5b90-464c-a3e9-2e542f4f5354","resolution":{"observed_at":"2026-07-12T05:44:33.099337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-11T22:10:22.729188Z","title":"& Narayanan, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04034","last_updated":"2026-07-04T21:27:40Z","snapshot_observed_at":"2026-08-03T18:33:54.331755Z","submitted_at":"2026-07-04T21:27:40Z","title":"The \"I Don't Know\" Filter: Enhancing Agentic Reliability in Function Calling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:22.729188Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.04034"},"observation_digest":"sha256:3b57cddf6eb277f3349b127528b7b1b453693f7f7134c6369aff3c028073ff2b","observation_id":"33f62d4c-08b2-4a26-a187-116324a42ff5","resolution":{"observed_at":"2026-07-11T22:10:22.729188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-12T14:32:04.742971Z","title":"arXiv preprint arXiv:2602.16666 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05404","last_updated":"2026-06-08T20:10:32Z","snapshot_observed_at":"2026-07-12T14:32:00.967125Z","submitted_at":"2026-06-08T20:10:32Z","title":"The Jagged Global Economy: Frontier AI Unevenly Exposes National Economies","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-12T14:32:04.742971Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.05404"},"observation_digest":"sha256:38c1e0bed7240f10b8045d1ed39d7c30aa192c35ce5b4e19903b1abc815baad3","observation_id":"dce57456-45d2-4361-af9e-fe7484d4f62d","resolution":{"observed_at":"2026-07-12T14:32:04.742971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-07-15T08:35:47.870083Z","title":"Towards a Science of AI Agent Reliability,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-15T08:35:47.870083Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:be81b0d933d9e92ef0f869468aa290cfe571dc42cdfb5f993c0abd5168bb5763","observation_id":"29cf422f-1591-4cb4-95a7-8942a256def4","resolution":{"observed_at":"2026-07-15T08:35:47.870083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-02T06:46:18.294647Z","title":"Towa rds a Science of AI Agent Reliability,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:46:18.294647Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:88b80f2bf14a624c5851c779c984a7b2081704e9d92b08ab05efdc3d8a97b0c7","observation_id":"34b5ddd2-4684-41a5-aeac-f399b62640be","resolution":{"observed_at":"2026-08-02T06:46:18.294647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-02T02:14:46.632901Z","title":"Towards a science of ai agent reliability,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14407","last_updated":"2026-07-19T14:44:07Z","snapshot_observed_at":"2026-08-02T02:14:46.174277Z","submitted_at":"2026-07-15T22:50:26Z","title":"Decision Making Needs Uncertainty Quantification [Lecture Notes]","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:14:46.632901Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.14407"},"observation_digest":"sha256:16423f183941bd13f9236ab33e39225521da419e27e53fd2664c165097c10572","observation_id":"8469b6ee-b72a-49f6-b0a0-57be3d51ad09","resolution":{"observed_at":"2026-08-02T02:14:46.632901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-01T23:57:11.469991Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15193","last_updated":"2026-07-16T16:48:39Z","snapshot_observed_at":"2026-08-01T23:57:03.384438Z","submitted_at":"2026-07-16T16:48:39Z","title":"Plover: Steering GUI Agents through Plan-Centric Interaction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T23:57:11.469991Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.15193"},"observation_digest":"sha256:686d08f207d0108b38a912c72a7db06b16ac0def973b74617bca8728467f8fb0","observation_id":"939ae7d6-8ba3-42d5-8c82-3a1ac016493b","resolution":{"observed_at":"2026-08-01T23:57:11.469991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-01T21:18:26.994142Z","title":"arXiv preprint arXiv:2602.16666 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16130","last_updated":"2026-07-17T17:11:22Z","snapshot_observed_at":"2026-08-01T21:18:18.354339Z","submitted_at":"2026-07-17T17:11:22Z","title":"A Methodology for Auditable Trustworthiness Levels in AI Lifecycle Governance","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T21:18:26.994142Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2607.16130"},"observation_digest":"sha256:21d7018c4e5bc01037d69ab8b33d9be8c7f8f601a3fc2137f3b0d84507c70d29","observation_id":"e965362c-196f-455a-90fa-d49366434e4f","resolution":{"observed_at":"2026-08-01T21:18:26.994142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.16666/citation-record","integrity":"/paper/2602.16666/integrity","json":"/paper/2602.16666/citation-record.json","paper":"/paper/2602.16666"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.000301Z","title":"Bc tribunal con- firms companies remain liable for information provided by ai chatbot.Business Law Today,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.000301Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:18a300fe361f751d24fda4f2b1059501f506675a649e98fe93c1340580c4c59c","observation_id":"a10e6045-68ae-4bf0-9645-13973e2d02fb","resolution":{"observed_at":"2026-08-02T22:31:56.000301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.130639Z","title":"AgentHarm: A benchmark for measuring harmfulness of LLM agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.130639Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:23f2611a7d2094ad6d63e290281922b6acfda821ab586c0b62c3ea8dffa7d406","observation_id":"a337ddb8-a7aa-45c6-9a97-f3864c0baaa3","resolution":{"observed_at":"2026-08-02T22:31:56.130639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.226720Z","title":"AA-Omniscience: Eval- uating cross-domain knowledge reliability in large language models.ArXiv preprint, abs/2511.13029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.226720Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:5b229b63fb1499f64ead76d17452a63a6d6db970cf77046817082e511ba36d40","observation_id":"2f324aae-812f-46a7-bb0d-f3e3f30b8413","resolution":{"observed_at":"2026-08-02T22:31:56.226720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.323137Z","title":"Basic concepts and taxonomy of dependable and secure computing.IEEE trans- actions on dependable and secure computing, 1 (1):11–33, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.323137Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:18007ed468f8dcfcc42951fc5b1451c2d96964d46096f01020af9f9781250000","observation_id":"9f4453c2-da10-4019-b2e3-b1826fbaa51e","resolution":{"observed_at":"2026-08-02T22:31:56.323137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-02T22:31:56.404637Z","title":"Con- stitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.404637Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:710d0e781e4f827c9972b63a462d75fae2c7978efd365cf16c761694cc231502","observation_id":"d2677057-91cb-4b58-aa01-f4ce5a456a69","resolution":{"observed_at":"2026-08-02T22:31:56.404637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.482697Z","title":"G., Riols, F., and Sharma, R","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.482697Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:e1ce6743392590d5ab926b63e034857459c874bfcbc41fb74798b88a6cf76686","observation_id":"2fa8343e-f3e4-4a87-8d36-62d9eec45b29","resolution":{"observed_at":"2026-08-02T22:31:56.482697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.551202Z","title":"John Wiley & Sons, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.551202Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:02073662fd1645f439c6e2ba0feb8da162014f45e46cb05003db1a013cdec0d0","observation_id":"1566dc03-ed80-4673-8b6b-3b2329dc6ae6","resolution":{"observed_at":"2026-08-02T22:31:56.551202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.608102Z","title":"Replit ceo apologizes after ai coding tool deleted a live production database.Business Insider, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.608102Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:44d0595908dd8d77dbe8f9b5085b287d6082c03f1d99aaaadf4e3a9e468d26bc","observation_id":"579165b6-3728-4ad8-a3fc-2fd2e2250822","resolution":{"observed_at":"2026-08-02T22:31:56.608102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T22:31:56.669112Z","title":"Training ver- ifiers to solve math word problems.ArXiv preprint, abs/2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.669112Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0ec5c19a2d6062ea26a6726221bee89c62893794044473d773cedf062a7e59ff","observation_id":"7243b0aa-f28b-4d7b-a257-46da8786b16d","resolution":{"observed_at":"2026-08-02T22:31:56.669112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.720076Z","title":"Saber: Small actions, big errors–safeguarding mutating steps in llm agents.ArXiv preprint, abs/2512.07850, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.720076Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:d0e503430d3854992e5ba3dbfee09537657dbf8b68ac4999a15b9136aaf05689","observation_id":"3b50dc7d-c939-42b3-82e2-4668ac9fb89a","resolution":{"observed_at":"2026-08-02T22:31:56.720076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.772845Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.772845Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c8c74b54883b757bbfd871ffc0ff5495edb96228d37674e78fd40bf9d6a3eba1","observation_id":"8066a8d9-a153-47ea-a126-205a2b8642a5","resolution":{"observed_at":"2026-08-02T22:31:56.772845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.818970Z","title":"System safety and artificial intelli- gence","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.818970Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:b6cf40602367dc617dc4b488bff2f77c1a4405c33cdd9c76f795e00e0d1b62f4","observation_id":"1c5d56bc-2808-44ab-b2b5-5d5885ad2ed4","resolution":{"observed_at":"2026-08-02T22:31:56.818970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.862719Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.862719Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:ce3af570606b776b02b81c7ea2b07510e8028a5bda02397d401e5eb4fd9104f3","observation_id":"b6e08298-ec2f-4c18-a11a-a5e747c3fe2c","resolution":{"observed_at":"2026-08-02T22:31:56.862719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.912541Z","title":"EN 50126: Railway applications – the specification and demonstration of relia- bility, availability, maintainability and safety (rams), 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.912541Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:a0b6e916a31acea906e84f4e3a14afae29e17c948bf0a6869ac174035626c16f","observation_id":"3e17f9e3-fe8e-416a-b34b-e78e93a0a528","resolution":{"observed_at":"2026-08-02T22:31:56.912541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:56.977985Z","title":"AGI safety literature review","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:56.977985Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:e9f7ca0d2f1812c825f999d97b93bb38557c2071373d0476379421d3a4bc3ff5","observation_id":"37170fcd-5c16-4dc1-baca-7d3df0337495","resolution":{"observed_at":"2026-08-02T22:31:56.977985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.280811Z","title":"Detecting hallucinations in large language models using semantic entropy.Nature, 630 (8017):625–630, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.280811Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c57969cf549d4131dd108c5709ead17762bfdf56e1d01d6be483a4035d88f181","observation_id":"6dce1331-875d-4640-9a66-b6f4becc3009","resolution":{"observed_at":"2026-08-02T22:31:57.280811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.322397Z","title":"Advisory circular AC 21-16g: RTCA document DO-160 versions D, E, F, and G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.322397Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:f87f5ef7a4eee6cb8f068be728ec4e06c893b97a3e62fb8d07ff2ebf10e5c2af","observation_id":"98b8c2b0-e685-4d21-9334-a0a286a5bd0e","resolution":{"observed_at":"2026-08-02T22:31:57.322397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.393032Z","title":"Advisory circular AC 25.1309-1b: System design and analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.393032Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:659388ab9e4550a4535b42328bb07b5ac60af0f14ccbe57a317d2c860d833861","observation_id":"45576a26-6f54-4c7b-81a1-bff7ed75b0e6","resolution":{"observed_at":"2026-08-02T22:31:57.393032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09923","last_updated":"2026-06-04T15:38:02Z","snapshot_observed_at":"2026-08-03T10:32:29.759975Z","submitted_at":"2026-01-14T23:06:35Z","title":"CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.09923","snapshot_observed_at":"2026-08-02T22:31:57.455347Z","title":"Camels can use comput- ers too: System-level security for computer use agents.ArXiv preprint, abs/2601.09923, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.455347Z"},"links":{"cited_paper":"/paper/2601.09923","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c10913823619d86e676e9b3ae63b25a854ecb3c7b6be1de16be1d5ab55b4c709","observation_id":"d9c59013-f4ba-440d-a4ce-30878cab342a","resolution":{"observed_at":"2026-08-02T22:31:57.455347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.512065Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.512065Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c245c788b223e01d4a03ad84edc52cb0469cfb900f5fe14a7658f414e906473b","observation_id":"6daadb69-ab68-456e-81cd-1985825bbbec","resolution":{"observed_at":"2026-08-02T22:31:57.512065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.568257Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.568257Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:28522db0bf33199917d072ed803e7b38d3d0a2c2611f32d7aa3cffbe616a6022","observation_id":"444fc3fe-29b2-4442-8e28-d279337527f3","resolution":{"observed_at":"2026-08-02T22:31:57.568257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.627633Z","title":"and Thinking Machines Lab","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.627633Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:052514b8c406a8e6611ffeccbd9b03d6ab9d44b2ce6ddb44f6a4b129ba8fd535","observation_id":"55af2ed3-a1db-4c8b-966f-eb2605f63305","resolution":{"observed_at":"2026-08-02T22:31:57.627633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-02T22:31:57.772423Z","title":"Unsolved problems in ml safety","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.772423Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:2cd8e899115a1623105a3f855994ee4d11c96e1915a64038b0d5781ea240bc44","observation_id":"5d016375-96a5-4957-9791-9ecf17a315bd","resolution":{"observed_at":"2026-08-02T22:31:57.772423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.854855Z","title":"IEC 61508: Functional safety of electrical/electron- ic/programmable electronic safety-related sys- tems, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.854855Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0b984634234a12396d327a81d677842f1d184b90eb7bd47b9395039f4e0a301c","observation_id":"73439282-1249-4eb2-8a3a-3fd523a9ae2c","resolution":{"observed_at":"2026-08-02T22:31:57.854855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.908630Z","title":"IEC 61513: Nuclear power plants – instrumentation and control important to safety – general re- quirements for systems, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.908630Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:fc35f6fe01c3c2481566605cedad61a24c8f4ade30418c1ed9faefedf4b6aa7f","observation_id":"b629d23e-f387-4c8f-b370-b35965b38885","resolution":{"observed_at":"2026-08-02T22:31:57.908630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.964798Z","title":"ISO 26262: Road vehicles – functional safety,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.964798Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:b1aeffe38a457b5009714257d165c19092aae7c586a80cc4659cd379aabce09d","observation_id":"426b4eb2-4cba-4a5a-a97f-4a20febed251","resolution":{"observed_at":"2026-08-02T22:31:57.964798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.118057Z","title":"E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.118057Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:8c763242d9c7ac0cc62b8fb88ad88e80ee1c539140aac70894ec9cd6ed3b750b","observation_id":"fb1a75a8-1a13-45bd-a96b-f1e173a7d169","resolution":{"observed_at":"2026-08-02T22:31:58.118057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-02T22:31:58.200811Z","title":"Language models (mostly) know what they know.ArXiv preprint, abs/2207.05221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.200811Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:765c9144b54b6c9e348ed5bc0263ccc7af7bdd97ec4b9fa5b7ce21d677ab8007","observation_id":"adda3f0a-843e-4238-9057-27235285a61d","resolution":{"observed_at":"2026-08-02T22:31:58.200811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-02T22:31:58.319721Z","title":"T., Nachum, O., Vempala, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.319721Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:50a76c68bb991edea9045b851db21ce35af287da0b7290b9881571fd58d3e47e","observation_id":"6c4ddc9a-3121-455e-8594-eaeed519cf14","resolution":{"observed_at":"2026-08-02T22:31:58.319721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.448052Z","title":"and Garrick, B","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.448052Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:8fe56e14d1c36eb1f417dfb4f380ae5dec093ae826bd8fe2721c221085303fe7","observation_id":"8b6bc575-95b5-4d97-afc9-829331e1623c","resolution":{"observed_at":"2026-08-02T22:31:58.448052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.558868Z","title":"S., Wei, B., Xue, T., Chen, Z., Chen, F., Utpala, S., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.558868Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:df9182b43ae2981ef790e49e1282e41fe44e0c3bbe29aabc6eff487d68470f1d","observation_id":"ac8e115d-b3b6-4ffc-82da-459d8efd795a","resolution":{"observed_at":"2026-08-02T22:31:58.558868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15927","last_updated":"2024-06-22T19:46:06Z","snapshot_observed_at":"2026-07-30T04:59:24.269176Z","submitted_at":"2024-06-22T19:46:06Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15927","snapshot_observed_at":"2026-08-02T22:31:58.662787Z","title":"Semantic entropy probes: Robust and cheap hallucination detection in llms.ArXiv preprint, abs/2406.15927, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.662787Z"},"links":{"cited_paper":"/paper/2406.15927","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0afcf26d6bf45de868586d3177ad86b40f598c7b7443b286f0399ebb03761656","observation_id":"a14ac10a-1079-4305-b43f-17f6dcbee446","resolution":{"observed_at":"2026-08-02T22:31:58.662787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.734057Z","title":"Dependability: Basic concepts and terminology","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.734057Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:8fb915736863bccd92de7d6a03aa167909d3335569164a9453578579909b02ba","observation_id":"aa295a54-7671-4e56-b099-74f17f10efd5","resolution":{"observed_at":"2026-08-02T22:31:58.734057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.793618Z","title":"NYC’s AI chatbot tells businesses to break the law.The Markup, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.793618Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:b999fe5613e219d51b0948d4ed0a0f6e913aaa0d7c672452b0b3bb045a6618cc","observation_id":"a48b4020-b05f-4202-a175-e3a71ff6583b","resolution":{"observed_at":"2026-08-02T22:31:58.793618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.882469Z","title":"RLAIF vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.882469Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0ecd8ba404fc9dff4372f76d9f12f07e0a0f8ea4006116118289b63f95f16ce5","observation_id":"6245b488-59a3-4a96-93f6-1f7783943d7d","resolution":{"observed_at":"2026-08-02T22:31:58.882469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.960411Z","title":"HaluEval: A large-scale hallucina- tion evaluation benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.960411Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:2fba492b229fa55c44c0f63d34238e2db31847996602829dafe13b94945186eb","observation_id":"3670f65c-ea99-46dd-920e-db150466cd44","resolution":{"observed_at":"2026-08-02T22:31:58.960411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-02T22:31:59.010250Z","title":"Holistic eval- uation of language models.ArXiv preprint, abs/2211.09110, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.010250Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:6d99405af22992903edf38d41468765408a4f5f44cff18a35cd38bddb2310c26","observation_id":"2cc35c64-2c6c-4219-816c-a0a343912e7b","resolution":{"observed_at":"2026-08-02T22:31:59.010250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.059674Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.059674Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:7db27b71d0742a180179a2b36aeecff75efaaa50f9b3c1d058a13786aa01d733","observation_id":"90ce6d96-1e8a-4094-a57a-981774ba6ae6","resolution":{"observed_at":"2026-08-02T22:31:59.059674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.132441Z","title":"Truth- fulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.132441Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:244b12fec9cd67798a95aa5bf08dfc61013c10e1947caa39e4c9d77cbdf9821a","observation_id":"b221e500-1ec4-46f9-b5a3-6f17772db80c","resolution":{"observed_at":"2026-08-02T22:31:59.132441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.209112Z","title":"Agentbench: Eval- uating llms as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.209112Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0f36f478c86e66e898d0a093506817da53193502191b6da9f1b27ef9d14130d2","observation_id":"f7f8f259-157c-4b79-9f1b-9e026aaa1232","resolution":{"observed_at":"2026-08-02T22:31:59.209112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.264997Z","title":"GAIA: a benchmark for 18 Towards a Science of AI Agent Reliability general AI assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.264997Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:cfa94216afbfd77e2b22d153110685b3d3fa7a184e1e8b679200f73755db7bcf","observation_id":"ae293490-02db-4f4c-915d-c3ef0e4c18b6","resolution":{"observed_at":"2026-08-02T22:31:59.264997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.314863Z","title":"Evaluation and benchmarking of llm agents: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.314863Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:f9fa2fd39082048dc9e65958ec026efb1b23e4a7f00f09694e47a50163f1140d","observation_id":"9c1b1fb8-424b-427e-8210-1922fb4d8e44","resolution":{"observed_at":"2026-08-02T22:31:59.314863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.392872Z","title":"Tech- nical support to the national highway traf- fic safety administration (NHTSA) on the re- ported Toyota motor corporation (TMC) unin- tended acceleration (UA) investigation","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.392872Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:4df69d03040e43891840d1dad21089062d37735246d9a3b9062e4700a03b1156","observation_id":"8bee43e2-02e9-419c-85b4-a5278ba6320a","resolution":{"observed_at":"2026-08-02T22:31:59.392872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09023","last_updated":"2025-10-10T05:51:04Z","snapshot_observed_at":"2026-08-03T03:11:42.084785Z","submitted_at":"2025-10-10T05:51:04Z","title":"The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09023","snapshot_observed_at":"2026-08-02T22:31:59.395624Z","title":"V., Hayes, J., Ilie, M., Pluto, J., Song, S., Chaudhari, H., Shumailov, I., Thakurta, A., Xiao, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.395624Z"},"links":{"cited_paper":"/paper/2510.09023","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:7b4b30296a03009bc202fc7a40f3b4432167d987578284fdde8c9bb59dd55498","observation_id":"488f3856-a389-4b16-8d60-3890a7cd0261","resolution":{"observed_at":"2026-08-02T22:31:59.395624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.463552Z","title":"A taxonomy of trustworthiness for artificial intelligence.CLTC: North Charleston, SC, USA, 1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.463552Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:be9ffa7fd36f6ee63d98423f322679d6148f9de13e3bf638a4c3e6bd16bf1988","observation_id":"84bde15a-dda1-427e-9eb7-3e376d11369b","resolution":{"observed_at":"2026-08-02T22:31:59.463552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.611397Z","title":"Computer-using agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.611397Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:703afdaaad24505cd2c197f84abfc432c11f5971975eade25dbbab4ca44e2b3c","observation_id":"4cb71f27-8b65-4562-be1f-6d5a89e810ae","resolution":{"observed_at":"2026-08-02T22:31:59.611397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:59.777746Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.777746Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:4f38a7dfea1cba6c3a5fb8206699e2804dc258d7f3636106ab0d9ba4b697c129","observation_id":"e3b5b9fb-58f6-4357-8437-7e118f985c72","resolution":{"observed_at":"2026-08-02T22:31:59.777746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04123","last_updated":"2026-06-04T19:57:38Z","snapshot_observed_at":"2026-08-03T18:55:54.928348Z","submitted_at":"2025-12-02T16:45:10Z","title":"Measuring Agents in Production","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04123","snapshot_observed_at":"2026-08-02T22:31:59.913036Z","title":"Z., Arabzadeh, N., Cogo, R., Zhu, Y., Xiong, A., Agrawal, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:59.913036Z"},"links":{"cited_paper":"/paper/2512.04123","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:1d9361312148f59c57e07a648964a511b46b060fb4b6e5f17f1967e6fe11403b","observation_id":"5c0ad10d-346e-44c5-bb2b-44b969729707","resolution":{"observed_at":"2026-08-02T22:31:59.913036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:00.012603Z","title":"and Papernot, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.012603Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:6c6e4ee61b3270a1691bd13a05c8339b55b1658cd64fe39091b6f65fc86bf3da","observation_id":"b19077b5-8448-4b9e-91ff-b868424346ab","resolution":{"observed_at":"2026-08-02T22:32:00.012603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:00.136848Z","title":"DO-178C: Software considerations in airborne systems and equipment certification, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.136848Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:f4098b1e8aa9d9ac0f785024e1676cd1d931187c674e479b7e95ae9c832728fd","observation_id":"a9d33331-722f-4c34-8078-aa92aaf8aeae","resolution":{"observed_at":"2026-08-02T22:32:00.136848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10899","last_updated":"2023-12-18T23:38:05Z","snapshot_observed_at":"2026-07-06T17:17:59.618048Z","submitted_at":"2023-12-18T23:38:05Z","title":"Concrete Problems in AI Safety, Revisited","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10899","snapshot_observed_at":"2026-08-02T22:32:00.250667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.250667Z"},"links":{"cited_paper":"/paper/2401.10899","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c1d44aed9738f1e1a26cd15fdfaf7d281187c120e8bcd618531bea7561975f6d","observation_id":"8b5a8fd3-9277-42c2-bc77-d68e147ec667","resolution":{"observed_at":"2026-08-02T22:32:00.250667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:00.402850Z","title":"Bench- marking prompt sensitivity in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.402850Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:3f142105a4285bd06085cfbaedc85ef9dad5fe8816b2d51454d7c40ef4f2257c","observation_id":"c935ebc1-8b1a-4e09-aa4d-56e72a1a8ac5","resolution":{"observed_at":"2026-08-02T22:32:00.402850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:00.565941Z","title":"Microsoft puts limits on bing ai chats after its chatbot went off the rails.The New York Times, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.565941Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:755e6a38d22945f536b4c928134d5b47a69b02a81790b1fb9f10703569c70eca","observation_id":"607a9e46-276e-45aa-b2e2-063e9b32b4b3","resolution":{"observed_at":"2026-08-02T22:32:00.565941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:00.680451Z","title":"SAE arp4761: Guidelines and methods for conducting the safety assess- ment process on civil airborne systems and equipment, 1996","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.680451Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:ad49bc2f1a3f9c116758541695a134af1cf045f72b96e00fde139aab2906d948","observation_id":"f5f5900b-8839-4df1-b7bf-2ceb56c45d2e","resolution":{"observed_at":"2026-08-02T22:32:00.680451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:00.839975Z","title":"ARP4754A: Guidelines for development of civil aircraft and systems","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:00.839975Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:76c601caf9ecaafad9bcafdf9f80d036e52b2d1495557f5c28af683a7c40d715","observation_id":"93cf02e2-c380-411c-8ab2-2598d9c14759","resolution":{"observed_at":"2026-08-02T22:32:00.839975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.006686Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.006686Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:dd90935fae394478317bf34b69c547d721410276979c25469b9af6d70717f89d","observation_id":"f07eac62-3118-4b97-a797-3afdf6fa50a7","resolution":{"observed_at":"2026-08-02T22:32:01.006686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.131096Z","title":"Air canada ordered to pay cus- tomer misled by chatbot.The Guardian, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.131096Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:7fc1a3fa7a9b747a6bec9d3958e1a1ad864b05eae4e1613a16791156e607f973","observation_id":"495c8ffd-953c-4321-bfa3-c0c8dce8646d","resolution":{"observed_at":"2026-08-02T22:32:01.131096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.268184Z","title":"Ai coding platform goes rogue and deletes entire company 19 Towards a Science of AI Agent Reliability database.Tom’s Hardware, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.268184Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:66cb241e0225256a801e7958f34ed61fd2324f7ce362757de6f505f773c3f659","observation_id":"7b0cc11b-d1ae-4722-998a-20c9094e4362","resolution":{"observed_at":"2026-08-02T22:32:01.268184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-02T22:32:01.393850Z","title":"Solving math word prob- lems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.393850Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:55e71ff75681ebec26b4a5acabf97d9262e3ba8a038ef6ef829d48b949d6cc61","observation_id":"ccb0a125-5de2-406a-8cf0-0b1e2a1efb8f","resolution":{"observed_at":"2026-08-02T22:32:01.393850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.465081Z","title":"Nuclear Regulatory Commission","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.465081Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:43c66283e6b18b9d9ff82b009e5afe93ad337601b325b23bb82019c949452e72","observation_id":"d964bfe1-e70a-4d88-bd17-b998dc781a5d","resolution":{"observed_at":"2026-08-02T22:32:01.465081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.560820Z","title":"Nuclear Regulatory Commission","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.560820Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:4fe7d6eb108bd7da721d150ab45668d89f1dee623d1ee9152b8cb0f75fd6d30e","observation_id":"6b7e4b0c-68b4-4002-9340-d56bf5173cc6","resolution":{"observed_at":"2026-08-02T22:32:01.560820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.725125Z","title":"Mac-sql: A multi-agent collaborative framework for text-to-sql","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.725125Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:ed98fd13856538057b613481f801b6f1327b9e83ed66b8246d5b607a1282eeb8","observation_id":"9db4b6cd-1c47-48f3-a99a-e4b623f0844f","resolution":{"observed_at":"2026-08-02T22:32:01.725125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:01.877416Z","title":"Math- shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:01.877416Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:af5a5f95372d81a45f1fe6a4e8d0f5e55af27af338c32b46df2a3ba66abca7af","observation_id":"0e2b54e2-1430-445c-971b-624e42866bd5","resolution":{"observed_at":"2026-08-02T22:32:01.877416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16974","last_updated":"2025-09-13T01:57:49Z","snapshot_observed_at":"2026-07-06T20:56:36.184649Z","submitted_at":"2025-03-21T09:43:37Z","title":"Assessing Consistency and Reproducibility in the Outputs of Large Language Models: Evidence Across Diverse Finance and Accounting Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16974","snapshot_observed_at":"2026-08-02T22:32:02.023467Z","title":"and Wang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.023467Z"},"links":{"cited_paper":"/paper/2503.16974","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:bb23bb283b8f67a61efe53d98d8205d8e22798e21e0af2913b0d2165af917179","observation_id":"58b21271-5c75-4a4a-8ea2-59011ee69658","resolution":{"observed_at":"2026-08-02T22:32:02.023467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-07-06T18:31:49.437336Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-02T22:32:02.429944Z","title":"and Zhao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.429944Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:6d7d365ea4edd6c93dcf6a9e1b384fbd172133c286237c200e6cd26dc3ff3ef2","observation_id":"ed6e48bb-5ca5-437e-bea2-6117ceec8fb8","resolution":{"observed_at":"2026-08-02T22:32:02.429944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:02.586611Z","title":"Microsoft limits bing ai chat to 5 replies per session.The Verge, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.586611Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:5c80be6117d42f96a04e41cce9b8350938ea8c6b3861558984d98b4e73ec69a9","observation_id":"b3377de9-bded-420c-a631-d1d8f75e98f6","resolution":{"observed_at":"2026-08-02T22:32:02.586611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:02.734774Z","title":"Taxonomy of risks posed by language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.734774Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:ca04612849f5a381b00cec3ebfc1c3fec82c5345916d25f3a3c5d1ecdf9de13c","observation_id":"a7b073b1-64d2-424a-939f-2690c3f7b2ca","resolution":{"observed_at":"2026-08-02T22:32:02.734774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11986","last_updated":"2023-10-31T18:23:32Z","snapshot_observed_at":"2026-08-02T09:23:01.679296Z","submitted_at":"2023-10-18T14:13:58Z","title":"Sociotechnical Safety Evaluation of Generative AI Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11986","snapshot_observed_at":"2026-08-02T22:32:02.903561Z","title":"A., Mateos-Garcia, J., Bergman, S., Kay, J., Griffin, C., Bariach, B., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.903561Z"},"links":{"cited_paper":"/paper/2310.11986","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:09f80563ddc29a578895ce6e2fb3c06f8187340cbb35da6877d9f16b879857e3","observation_id":"3fcc2a13-9dd6-4110-9d9a-9259d32ec18b","resolution":{"observed_at":"2026-08-02T22:32:02.903561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:03.190872Z","title":"E., Wettig, A., Lieret, K., Yao, S., Narasimhan, K., and Press, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.190872Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:47d10a70c3651335cd89a3ab07c91dbddb4953879e37d76b56bcdb19645eadc2","observation_id":"2a02438b-b284-494a-b181-9864bdbbebef","resolution":{"observed_at":"2026-08-02T22:32:03.190872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:02.252437Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:02.252437Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c025336577d545e3f07246be1f81235af04be5072c6e90652c8a04d473209e5a","observation_id":"f56cb142-42b9-480b-84e3-eb264157e9a9","resolution":{"observed_at":"2026-08-02T22:32:02.252437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T22:32:03.635899Z","title":"τ-bench: A benchmark for tool-agent- user interaction in real-world domains.ArXiv preprint, abs/2406.12045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.635899Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:3cb42e8118a5ebb72f5a01486bdc84562c7d6b90e042dde8456243c2dec67675","observation_id":"878f42ae-3102-428b-9629-16912559dfec","resolution":{"observed_at":"2026-08-02T22:32:03.635899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:03.709801Z","title":"Y., Cho, K., Li, X., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.709801Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:46172b846c0141d472f365b820a076c8600c2a7140729a45eb85fe1e09289397","observation_id":"5b934862-0017-4b13-8023-63bf05d8b733","resolution":{"observed_at":"2026-08-02T22:32:03.709801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:03.811875Z","title":"Calibrate before use: Improving few-shot performance of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.811875Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:50b064e79cbc237c2dfc31f160a8cd518dccf5703011afaa93f4a436de270030","observation_id":"0dd3b9a7-4675-4b90-b9f7-d9ecb4c463fb","resolution":{"observed_at":"2026-08-02T22:32:03.811875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:03.993956Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.993956Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:71bd28a3c0765034ca01dfd4913fbd2e08bb7d93a1b83efb86199ee590031494","observation_id":"c0f1b8df-14c4-4b74-9c2c-437ce9cc806d","resolution":{"observed_at":"2026-08-02T22:32:03.993956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.074734Z","title":"Larger and more instructable lan- guage models become less reliable.Nature, 634 (8032):61–68, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.074734Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:004ded0974de52b0ff808f21893ad0c2ca75725acfd3413ff21354cac45c6435","observation_id":"2cc75de2-f29f-4bde-8e87-da062fa84c2e","resolution":{"observed_at":"2026-08-02T22:32:04.074734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.144286Z","title":"Can I get a refund for order #12345?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.144286Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:715e06e67ae4b19ce00399f85080df619e6dc3138a74e547d05d01be0eeb6935","observation_id":"28c0715c-2cb4-41ae-9a49-2c0fc94b6d28","resolution":{"observed_at":"2026-08-02T22:32:04.144286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:03.371122Z","title":"R., and Cao, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.371122Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:32fe62444b6358905b3d25809f68c721791dc92b2616a0e9cb39425e64bc3b2e","observation_id":"4ca553ad-8a3f-4246-9dc2-6f4b5434afc8","resolution":{"observed_at":"2026-08-02T22:32:03.371122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:03.537658Z","title":"20 Towards a Science of AI Agent Reliability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:03.537658Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:a2678e5420ddb349873f195942573f323f95b0acd7ff93334fcbb99e8e3f274d","observation_id":"f2677310-aca0-497d-b02f-b8e896914b7e","resolution":{"observed_at":"2026-08-02T22:32:03.537658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.212036Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.212036Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:60ffe54a6a66f1007df902cf5071fcbabe6ea1498406b7e3454403dea9cbc222","observation_id":"95a3d96c-b097-4b1c-a0c4-c5d75c09b0f4","resolution":{"observed_at":"2026-08-02T22:32:04.212036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.275599Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.275599Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:999869954358bb58d6f0bbbbdaf4ee4b50fb905302f7b69b4d1196c1aa8de5a5","observation_id":"de80676d-64d6-4c50-90d6-a06a01273c45","resolution":{"observed_at":"2026-08-02T22:32:04.275599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.354803Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.354803Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c965b584f40a64182c16347919e172406343f8cdc803e97e2b255c77d932eab6","observation_id":"2a381969-814e-4ca4-8043-1e951574f37a","resolution":{"observed_at":"2026-08-02T22:32:04.354803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.451259Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.451259Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:26db95932f89ad83083676f26e2a6567e2b5eaf3fffc1a953eb25b62eadadfc6","observation_id":"f64de184-07c3-47fd-b425-d162863b4b7b","resolution":{"observed_at":"2026-08-02T22:32:04.451259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.526199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.526199Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:eeadd3deca4e703150dab43fb3ff62697dfc36dd28a681e354d60379ab64d12c","observation_id":"3dca140b-d8b7-4b40-b6ad-ebdf25c8faf3","resolution":{"observed_at":"2026-08-02T22:32:04.526199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.605601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.605601Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:750a4c89d42add5f63a5593062607fe023e62d661f1195c1361991c6e4d85777","observation_id":"5699494b-dc09-46eb-b182-af008b176654","resolution":{"observed_at":"2026-08-02T22:32:04.605601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.659249Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.659249Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c384c85960083b939dd8605aee25c66d5fb063ea29f6a6be28874fbb4ee72671","observation_id":"c7c89c01-79c3-4cbb-8cd2-e2701fbb4d6e","resolution":{"observed_at":"2026-08-02T22:32:04.659249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.727481Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.727481Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:5847c1a40716281c6172a5885c9430427f4c606e70d0cac321930c2e7348ccf0","observation_id":"1c1500e0-1998-444b-9438-5243c9f36fd8","resolution":{"observed_at":"2026-08-02T22:32:04.727481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.793653Z","title":"D.2 Implementation We evaluate 14 language models from three major providers, spanning release dates from April 2024 to December 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.793653Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:2e7f99ec2563e2be1fe3e2e45b9cded8b3f1a4152cc7fb8aa8e16ac3d317f739","observation_id":"ed380dff-b3ff-4b17-8dff-6e58c6bf1907","resolution":{"observed_at":"2026-08-02T22:32:04.793653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.867804Z","title":"What is the population of Paris in 2024-01-15?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.867804Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:96e00b9d770b84df96ef4a5771307153089c47d0e40be8f24610e794469822f5","observation_id":"622b3c26-bd1c-43f8-9259-36eb185e46a8","resolution":{"observed_at":"2026-08-02T22:32:04.867804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:04.937875Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:04.937875Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:84aa2bc596caec29e93cba56e229ba2c963b782b862430f53c23d0596f619b88","observation_id":"980422d2-d6ee-4b50-9fab-44725929c770","resolution":{"observed_at":"2026-08-02T22:32:04.937875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.025603Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.025603Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0342bd957e3e022803d569e2aa9bb02acffc904f9c90f373e8403b56b00380e5","observation_id":"4d099fe0-c422-438c-a94b-3e1d3ccd80a8","resolution":{"observed_at":"2026-08-02T22:32:05.025603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.093275Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.093275Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:ea6a330bcbfeaf494fa3ce5844d4ff2fcb9c9480beb06c1719701d2c13065f64","observation_id":"9ec7abbf-d5b0-4f20-bc57-a3469b9fb7da","resolution":{"observed_at":"2026-08-02T22:32:05.093275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.175916Z","title":"Forbidden function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.175916Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:1305dab805422089ab77f296118fd6b8fe9837621fdbce6413edbf9886daac35","observation_id":"dacca3d7-7862-4b1f-979c-66693617be12","resolution":{"observed_at":"2026-08-02T22:32:05.175916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.275530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.275530Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0db8ab81f29860ab781a9350ddfdbfc666c50ed545aa7aecc705e74d213cdd02","observation_id":"6e0fee29-401c-43a7-a09b-f030072166e7","resolution":{"observed_at":"2026-08-02T22:32:05.275530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.408798Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.408798Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:0c87a036e07a189638bd1bb045ceb1389c9c5184a6aa1f4b1104b0afbbd9fa3f","observation_id":"871d8092-b558-4a8f-b562-29a7935d8dcd","resolution":{"observed_at":"2026-08-02T22:32:05.408798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.513237Z","title":"informational","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.513237Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:6c01c49b0abdf58bdec1e6a25bfcb624e960ac5085b85a8a0350058bd1ff4ac6","observation_id":"bbe7a93c-8d86-4d2c-9329-bfbf3afa9bae","resolution":{"observed_at":"2026-08-02T22:32:05.513237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.601729Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.601729Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:a328b06de52ac409165c89d98de1a22468a530b27df65aba7810222f4125d348","observation_id":"b7020922-4717-4160-8eec-e856d654f433","resolution":{"observed_at":"2026-08-02T22:32:05.601729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.688987Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.688987Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:d24a5f57940f534fc85713226bd3a0f847eb9e2f2cd1c11039ec3b16e7a228d4","observation_id":"7be98929-8f5c-4bfe-b59c-1a4548490c1f","resolution":{"observed_at":"2026-08-02T22:32:05.688987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:32:05.798089Z","title":"try harder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-02T22:32:05.798089Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:c467a30e378b20a1fdc7b50614a3749666a4630c788109610745186674d1d5ad","observation_id":"bec867ef-b75c-4ac8-b520-af628a832f9f","resolution":{"observed_at":"2026-08-02T22:32:05.798089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:57.211940Z","title":"2018/768","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":768,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:57.211940Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:6a482c381b944fa05ab24a390f3ee7cf7a37d12386be99d4be6019a36d68ab2d","observation_id":"a8ff1e6e-ce60-456d-970c-722e1695f0b2","resolution":{"observed_at":"2026-08-02T22:31:57.211940Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:58.036119Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:58.036119Z"},"links":{"citing_paper":"/paper/2602.16666"},"observation_digest":"sha256:cb7677f14f4ca40b50d6528fb37bb30835c2b45a60d4d89cf6d14e78776f8ab9","observation_id":"da8f3795-777a-44af-9eac-8a3a4eca80c5","resolution":{"observed_at":"2026-08-02T22:31:58.036119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T22:31:53.381890Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 27 inbound Pith citation observations for arXiv:2602.16666."}