{"as_of":"2026-08-23T00:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:785a295d34d6c2da495f9ed1e2919e7268f992704bee942b2984e8dc7d653da8","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:16:16.539220Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:19:51.357826Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-16T10:19:51.357826Z","title":"arXiv preprint arXiv:2505.23836 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20084","last_updated":"2025-06-29T16:03:19Z","snapshot_observed_at":"2026-08-21T02:25:16.122020Z","submitted_at":"2025-04-25T16:03:50Z","title":"AI Awareness","version":2},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-08-16T10:19:51.357826Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2504.20084"},"observation_digest":"sha256:33bdf661acebf3cd17b133338c6e7004618ff7b776279ddd29fd7b6bf206d138","observation_id":"71751645-d83b-4346-ab32-026e5a3c704d","resolution":{"observed_at":"2026-08-16T10:19:51.357826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-07T00:13:40.968945Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17303","last_updated":"2025-06-17T23:33:21Z","snapshot_observed_at":"2026-08-21T01:50:42.191715Z","submitted_at":"2025-06-17T23:33:21Z","title":"The California Report on Frontier AI Policy","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:40.968945Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2506.17303"},"observation_digest":"sha256:7bcab5fd3b4220348ccd83147e9a85be05fe42fa5aa66d31b6e2d94d99982d3e","observation_id":"e5a33385-10e3-4e59-8446-4f0ae2d562a3","resolution":{"observed_at":"2026-08-07T00:13:40.968945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-06T20:52:29.855907Z","title":"Large Language Models Often Know When They Are Being Evaluated","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03010","last_updated":"2025-07-02T10:48:37Z","snapshot_observed_at":"2026-08-19T03:07:07.906031Z","submitted_at":"2025-07-02T10:48:37Z","title":"Subversion via Focal Points: Investigating Collusion in LLM Monitoring","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:52:29.855907Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2507.03010"},"observation_digest":"sha256:ccec876ea5e901f724a28fb6ce72b16ffa3c36ab4c18616158bb9585b652e4a0","observation_id":"32a4d493-fc2c-4b5f-bca2-5444675ec82b","resolution":{"observed_at":"2026-08-06T20:52:29.855907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-06T20:18:15.522929Z","title":"Needham, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03409","last_updated":"2025-07-04T09:16:11Z","snapshot_observed_at":"2026-08-14T06:14:50.175666Z","submitted_at":"2025-07-04T09:16:11Z","title":"Lessons from a Chimp: AI \"Scheming\" and the Quest for Ape Language","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:18:15.522929Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2507.03409"},"observation_digest":"sha256:b48d37eb97b84895e6bf776676f7527ca092928d9f342347a6f824035bcdfa3a","observation_id":"014e48a2-b814-4089-aba3-d37313ff299e","resolution":{"observed_at":"2026-08-06T20:18:15.522929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-06T16:39:36.667793Z","title":"Sella Nevo, Dan Lahav, Ajay Karpur, Yogev Bar-On, Henry Alexander Bradley, and Jeff Alstott","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-19T16:29:33.572763Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.667793Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:2e33bf1e8507b18d02444450ee5ff07fefecb25b5145a0ba0b371702d9d2e1a1","observation_id":"d196b84c-0b27-4bf2-a575-2e893d947be3","resolution":{"observed_at":"2026-08-06T16:39:36.667793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-15T18:24:06.722915Z","title":"Large Language Models Often Know When They Are Being Evaluated , June 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17951","last_updated":"2025-07-23T21:46:37Z","snapshot_observed_at":"2026-08-20T02:10:17.008538Z","submitted_at":"2025-07-23T21:46:37Z","title":"Are LLM Belief Updates Consistent with Bayes' Theorem?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T18:24:06.722915Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2507.17951"},"observation_digest":"sha256:2126110e0be984129ddd777ee108ef692207ce4c2f9b609bd4f491b5ce2a280a","observation_id":"a276a77f-28fc-4934-81cf-438322bf642c","resolution":{"observed_at":"2026-08-15T18:24:06.722915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T10:16:43.213404Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04373","last_updated":"2025-09-10T06:08:26Z","snapshot_observed_at":"2026-08-19T19:30:19.438285Z","submitted_at":"2025-09-04T16:32:18Z","title":"Measuring Bias or Measuring the Task: Understanding the Brittle Nature of LLM Gender Biases","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T10:16:43.213404Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2509.04373"},"observation_digest":"sha256:320114072be6a32cef2700549094f563ee034e31eeb9b073a4f09c5579c860af","observation_id":"ca63ec3a-d0b1-4d4c-a9af-07197cc22118","resolution":{"observed_at":"2026-08-05T10:16:43.213404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2509.18052","last_updated":"2026-04-06T17:12:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:27:29Z","title":"The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T14:31:11.974395Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2509.18052"},"observation_digest":"sha256:88bb75e507d4c616761c7b8c1f051a03fb199ddf1de8fccd3ac5de55dde497dc","observation_id":"d6fff0f1-dedf-4da2-bbe2-afcc30102295","resolution":{"observed_at":"2026-05-18T14:31:29.441230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2604.03121","last_updated":"2026-04-03T15:45:35Z","snapshot_observed_at":"2026-08-14T20:17:35.790268Z","submitted_at":"2026-04-03T15:45:35Z","title":"An Independent Safety Evaluation of Kimi K2.5","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T19:38:18.674355Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2604.03121"},"observation_digest":"sha256:61684ae8e18912ddb52f2080ef1c6a77b47479e6606a34bbd772e699a27d353a","observation_id":"fc8eaeac-ef49-45ef-ad60-8fdfcbb3a357","resolution":{"observed_at":"2026-05-13T19:43:11.497804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2604.05274","last_updated":"2026-04-07T00:18:28Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T00:18:28Z","title":"Simulating the Evolution of Alignment and Values in Machine Intelligence","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T20:15:46.311347Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2604.05274"},"observation_digest":"sha256:1853435a4c69b6833ce7236402a158333e025f788ef255bfc2817122cd4bb903","observation_id":"0a7a6c42-8f3b-4ca0-8a9d-a7f391032f7d","resolution":{"observed_at":"2026-05-10T22:05:48.497134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2604.13301","last_updated":"2026-04-14T21:13:54Z","snapshot_observed_at":"2026-08-16T09:30:42.664073Z","submitted_at":"2026-04-14T21:13:54Z","title":"Honeypot Protocol","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:35:16.230357Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2604.13301"},"observation_digest":"sha256:cf2fab79c461b3c2bc03095a7ff949f63124499712b8fd89f9bde00f56bfb3e9","observation_id":"e931c58f-1d37-4a12-8957-f3dacf5c1eee","resolution":{"observed_at":"2026-05-10T14:35:34.167631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-08-13T15:26:57.998704Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:301a88c11748065fe6f6508e4271be0b01b49016df463892d56d72aa50dd55b9","observation_id":"a5726432-a35f-4568-9ac5-ff01aa23a448","resolution":{"observed_at":"2026-05-11T23:16:16.451642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.02269","last_updated":"2026-05-04T06:22:22Z","snapshot_observed_at":"2026-08-15T02:54:09.259804Z","submitted_at":"2026-05-04T06:22:22Z","title":"Towards Understanding Specification Gaming in Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T16:24:52.564505Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.02269"},"observation_digest":"sha256:62d68b234caabe937bc757da48c1798b6eed1c51abcec422931fa92cacdbaaf4","observation_id":"11820b76-29ca-487c-bbae-8368eaea64ef","resolution":{"observed_at":"2026-05-11T16:31:09.801473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.02964","last_updated":"2026-05-03T07:10:42Z","snapshot_observed_at":"2026-08-15T01:30:31.105334Z","submitted_at":"2026-05-03T07:10:42Z","title":"Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T15:38:41.821264Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.02964"},"observation_digest":"sha256:a2df11425ec57241e5b86bd284008f71810c861074b2b0112ced67f2f0a49054","observation_id":"3ffaa199-acf2-41bc-b72f-3b1994ed3d86","resolution":{"observed_at":"2026-05-11T10:06:03.651126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.05835","last_updated":"2026-05-07T08:09:43Z","snapshot_observed_at":"2026-08-14T22:16:50.347566Z","submitted_at":"2026-05-07T08:09:43Z","title":"Evaluation Awareness in Language Models Has Limited Effect on Behaviour","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:54.568772Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.05835"},"observation_digest":"sha256:60a14e3387ff82b99962a9225fb5245b674888000769775aadbd554ac3e4f2b5","observation_id":"ec45d5b5-4ded-4809-9c16-e34ed3515f9b","resolution":{"observed_at":"2026-05-11T19:46:15.167301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.06490","last_updated":"2026-05-07T16:12:36Z","snapshot_observed_at":"2026-08-13T08:30:16.218170Z","submitted_at":"2026-05-07T16:12:36Z","title":"Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T09:44:44.131088Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.06490"},"observation_digest":"sha256:a9a56986f90395f42ec5ff225eeb9509f0a8316834c56662a17490dc40ab6cd6","observation_id":"b4e8bf0d-15fc-494a-9c0d-aee4dc2e0600","resolution":{"observed_at":"2026-05-11T20:16:10.915339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.06652","last_updated":"2026-05-07T17:56:41Z","snapshot_observed_at":"2026-08-11T13:46:01.060829Z","submitted_at":"2026-05-07T17:56:41Z","title":"When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T12:07:02.778631Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.06652"},"observation_digest":"sha256:40a43cbf76dfcd865edd62a1527db28652914a8fa41ed84815a5bd7a818e9d74","observation_id":"2c504cd9-7b1a-42f8-a979-2cb3ec681887","resolution":{"observed_at":"2026-05-08T21:39:24.666799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.10601","last_updated":"2026-05-11T14:02:56Z","snapshot_observed_at":"2026-08-17T01:41:22.145538Z","submitted_at":"2026-05-11T14:02:56Z","title":"The Open-Box Fallacy: Why AI Deployment Needs a Calibrated Verification Regime","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T03:37:12.567351Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.10601"},"observation_digest":"sha256:f969434e5b53ff6111860758046c6d87a03a82158292676160d5fcb93fe1a57d","observation_id":"29f87113-88d6-47b3-a880-7cfefb06b50d","resolution":{"observed_at":"2026-05-12T07:11:26.489069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2605.23420","last_updated":"2026-05-22T09:29:18Z","snapshot_observed_at":"2026-08-19T02:10:01.659393Z","submitted_at":"2026-05-22T09:29:18Z","title":"Naturalistic measure of social norms alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T04:36:48.254343Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2605.23420"},"observation_digest":"sha256:a388f20118e73a155b1b06ef152d07064cd26b4a37d24851e57cc87b73a43340","observation_id":"d12d4985-7841-4d48-aacc-95684c94c188","resolution":{"observed_at":"2026-05-25T04:40:24.547338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.02211","last_updated":"2026-06-01T13:10:49Z","snapshot_observed_at":"2026-08-15T20:19:37.129619Z","submitted_at":"2026-06-01T13:10:49Z","title":"Consistency Training while Mitigating Obfuscation via Rate Matching","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:43.147442Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.02211"},"observation_digest":"sha256:cd3f447e5462a96375ee112593935977dbc8b460ea8ebad1aaeb1c9c5da22175","observation_id":"4f8a1ee2-2cfa-4ed0-b5cb-48c5b5f25f0c","resolution":{"observed_at":"2026-07-01T23:26:21.934177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.05391","last_updated":"2026-06-03T19:53:31Z","snapshot_observed_at":"2026-08-13T09:52:35.213263Z","submitted_at":"2026-06-03T19:53:31Z","title":"Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T04:58:10.803420Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.05391"},"observation_digest":"sha256:2e5fed6c08b2e65f8eab325e42ff210a7fab9db3495294e16e9e8e9f856e114c","observation_id":"adfc2b2e-db10-4ab5-be71-542087ee551f","resolution":{"observed_at":"2026-07-02T10:36:52.855321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.06286","last_updated":"2026-06-04T15:25:24Z","snapshot_observed_at":"2026-08-13T08:39:08.171099Z","submitted_at":"2026-06-04T15:25:24Z","title":"LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T01:40:53.284131Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.06286"},"observation_digest":"sha256:110cc330720b5947101d1db60025c72c87958674a9333cac5a53457c09f272f4","observation_id":"6a8b9bfd-f0d7-44cf-8261-44acad1fd5d7","resolution":{"observed_at":"2026-06-28T01:41:29.315927Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.07631","last_updated":"2026-05-31T04:28:21Z","snapshot_observed_at":"2026-08-07T01:48:42.889654Z","submitted_at":"2026-05-31T04:28:21Z","title":"Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T17:37:51.505359Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.07631"},"observation_digest":"sha256:2033151421c2783158c5932438a9767be1cb2d45ec853fe8607318e824cde613","observation_id":"5eb1a384-aa8d-4722-9772-0ed7bf494874","resolution":{"observed_at":"2026-07-01T20:56:13.886101Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.08629","last_updated":"2026-06-07T13:47:11Z","snapshot_observed_at":"2026-08-07T04:03:10.261869Z","submitted_at":"2026-06-07T13:47:11Z","title":"Sycophancy Towards Researchers Drives Performative Misalignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T18:52:29.375027Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.08629"},"observation_digest":"sha256:ad585ca7c8b90ee78e0d9c984cb1d91da7e5f58885713972418722ac3a368739","observation_id":"62bfab90-7019-4ae2-ab7c-41c8a09278d0","resolution":{"observed_at":"2026-07-02T22:27:26.195598Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.11063","last_updated":"2026-06-09T16:24:16Z","snapshot_observed_at":"2026-08-09T22:11:04.022394Z","submitted_at":"2026-06-09T16:24:16Z","title":"CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T13:23:28.061924Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.11063"},"observation_digest":"sha256:9d6ed0bcdfd49594bace565173386ba7c2f50dc82312ccae278737aa507c81f0","observation_id":"09e0708c-53d6-47e4-906c-e6fc347d0fe3","resolution":{"observed_at":"2026-07-03T05:07:39.428576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.12016","last_updated":"2026-06-10T12:43:31Z","snapshot_observed_at":"2026-08-14T06:45:51.871253Z","submitted_at":"2026-06-10T12:43:31Z","title":"Generalization Hacking: Models Can Game Reinforcement Learning by Preventing Behavioral Generalization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T10:59:09.372559Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.12016"},"observation_digest":"sha256:31322b55a2e7c9ee6e568aaacb286206ef25f9c755a27091afe4cd4f573bf508","observation_id":"37fd511b-e396-443e-ae66-40f8d5f092be","resolution":{"observed_at":"2026-07-03T08:17:44.938579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.12731","last_updated":"2026-06-10T22:37:26Z","snapshot_observed_at":"2026-07-06T23:51:35.904251Z","submitted_at":"2026-06-10T22:37:26Z","title":"Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T09:50:24.891865Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.12731"},"observation_digest":"sha256:42e40ed1ec6a5a08586b0792bf141dfe2bf8ebb242da8de8c5fcc195aa37eff2","observation_id":"24a2c7fb-6793-4a10-95aa-d4e0f3d12700","resolution":{"observed_at":"2026-07-03T10:48:02.440185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.23583","last_updated":"2026-06-22T16:48:43Z","snapshot_observed_at":"2026-08-16T14:13:02.157673Z","submitted_at":"2026-06-22T16:48:43Z","title":"Evaluation Awareness Is Not One Capability: Evidence from Open Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T08:23:20.122338Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.23583"},"observation_digest":"sha256:1067a9c00c90489cb9576e4529e1863cb70803709d270b39d63743a0885900b7","observation_id":"512610eb-fc91-4a50-b0f6-ce0079167855","resolution":{"observed_at":"2026-07-04T10:49:46.869656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.28863","last_updated":"2026-06-27T11:12:17Z","snapshot_observed_at":"2026-08-18T03:35:58.844908Z","submitted_at":"2026-06-27T11:12:17Z","title":"Defeat Devices in AI Systems","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-30T08:34:58.879346Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.28863"},"observation_digest":"sha256:349e5389d23d7099629e843b62222bbaa5aacba21df59f47a62cfbc1839028dd","observation_id":"3242f6d5-421a-45a4-9aad-0d419c6ac36e","resolution":{"observed_at":"2026-06-30T08:44:27.919110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2606.31916","last_updated":"2026-06-30T16:22:12Z","snapshot_observed_at":"2026-08-12T20:49:26.366092Z","submitted_at":"2026-06-30T16:22:12Z","title":"Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-01T05:40:54.002702Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2606.31916"},"observation_digest":"sha256:cfb5267240e775cde52aff22387ec692cb87453e4655e97af2a97b91c2253c9b","observation_id":"71ad9311-cc8c-4b1f-a7cc-ac1b262d95d4","resolution":{"observed_at":"2026-07-01T10:15:44.698122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":"2505.23836","doi":"10.48550/arxiv.2505.23836","metadata_source":"pith","pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, and Marius Hobbhahn","venue":"cs.CL","work_id":"5203df7a-e1a6-45a0-b8cf-50762163f660","year":2025},"citing_paper":{"arxiv_id":"2607.07184","last_updated":"2026-07-08T09:17:47Z","snapshot_observed_at":"2026-08-21T11:09:28.802605Z","submitted_at":"2026-07-08T09:17:47Z","title":"Predicting LLM Safety Before Release by Simulating Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T18:07:42.556329Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.07184"},"observation_digest":"sha256:7ca2b4c5e780fa8497556073fbc0c9b4e513819ad0685a06dda26cfc6a72821e","observation_id":"a59c605b-f5b8-4386-9a4f-7586d3f74aab","resolution":{"observed_at":"2026-07-09T18:16:25.813826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T00:38:08.989936+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-01T23:29:50.626336Z","title":"Large language models often know when they are being evaluated, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15434","last_updated":"2026-08-09T21:27:54Z","snapshot_observed_at":"2026-08-15T03:34:25.378426Z","submitted_at":"2026-07-16T20:07:47Z","title":"Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T23:29:50.626336Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.15434"},"observation_digest":"sha256:4c09eba4cd777c8c66dff63cc49ac5183694c6017d1d98eaf16a144deef4acb1","observation_id":"3f181c66-37a7-4bc2-b6f4-0822b3871b4b","resolution":{"observed_at":"2026-08-01T23:29:50.626336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-02T14:26:49.433333Z","title":"Large language models often know when they are being evaluated.arXiv preprint arXiv:2505.23836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20436","last_updated":"2026-05-11T13:44:35Z","snapshot_observed_at":"2026-08-16T18:17:56.734765Z","submitted_at":"2026-05-11T13:44:35Z","title":"Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:26:49.433333Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.20436"},"observation_digest":"sha256:d842447649dacc7c25c4ef040a0f43310a9b134281fa9ecf00f0ee514340fbb2","observation_id":"ba0632d1-31cc-4481-97af-30d0b63d7694","resolution":{"observed_at":"2026-08-02T14:26:49.433333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-07-31T23:35:43.718137Z","title":"& Hobbhahn, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23927","last_updated":"2026-07-27T01:47:12Z","snapshot_observed_at":"2026-08-16T00:57:41.780490Z","submitted_at":"2026-07-27T01:47:12Z","title":"Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:35:43.718137Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.23927"},"observation_digest":"sha256:8e7b3034b639a170fa43a19c665eab9453b2160d0b44072218650f7469480d82","observation_id":"73131b97-d4f1-457a-844c-2339afd33228","resolution":{"observed_at":"2026-07-31T23:35:43.718137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-01T01:16:41.785644Z","title":"arXiv preprint arXiv:2505.23836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-15T05:25:30.837764Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:41.785644Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:6cd7ca92889382d92ec02e8e26c07a5473b845940be2f7c7e665a0096f183d22","observation_id":"b0cd2c7f-7416-43b1-b555-412c771768e6","resolution":{"observed_at":"2026-08-01T01:16:41.785644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-01T01:13:36.803652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25907","last_updated":"2026-07-28T16:01:48Z","snapshot_observed_at":"2026-08-16T12:18:04.964992Z","submitted_at":"2026-07-28T16:01:48Z","title":"Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T01:13:36.803652Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.25907"},"observation_digest":"sha256:f3de949fecf622bbd93ccc0c4d7a3253ae921d6277a8b42d1b21a42211f5fb4c","observation_id":"592725c1-a39b-45e3-b101-7b47c9da458d","resolution":{"observed_at":"2026-08-01T01:13:36.803652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-07-30T16:01:42.510478Z","title":"Large language models often know when they are being evaluated, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26952","last_updated":"2026-07-29T14:20:13Z","snapshot_observed_at":"2026-08-13T17:49:24.624671Z","submitted_at":"2026-07-29T14:20:13Z","title":"Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-07-30T16:01:42.510478Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.26952"},"observation_digest":"sha256:dd86aada2697bed7620ae39aa5b11a0bcac41b77b7514d705938e6c6d4bb42a6","observation_id":"e6e48d91-61f2-4ac3-9bcb-31e893026e59","resolution":{"observed_at":"2026-07-30T16:01:42.510478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-03T00:25:12.383258Z","title":"arXiv preprint arXiv:2505.23836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-08T06:19:07.682563Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:12.383258Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:d08dc49a6747070876ce066a5ef5ef31b1f1fad3c473ee15e196626a50e662dc","observation_id":"61b0ff3f-f4ab-4b02-87d9-3ba13e643245","resolution":{"observed_at":"2026-08-03T00:25:12.383258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-03T17:02:00.896094Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28934","last_updated":"2026-07-31T01:29:16Z","snapshot_observed_at":"2026-08-19T12:31:28.830748Z","submitted_at":"2026-07-31T01:29:16Z","title":"FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T17:02:00.896094Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2607.28934"},"observation_digest":"sha256:482cc0589f52cdfb114bb2f0f7dd518e6727df4c22611cda5ce77b5968268618","observation_id":"1bd384b3-2bfc-4a56-898a-426a4397d627","resolution":{"observed_at":"2026-08-03T17:02:00.896094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-12T12:19:26.030841Z","title":"arXiv preprint arXiv:2505.23836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11008","last_updated":"2026-08-12T09:15:36Z","snapshot_observed_at":"2026-08-21T03:05:25.234479Z","submitted_at":"2026-08-11T14:55:44Z","title":"Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T12:19:26.030841Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2608.11008"},"observation_digest":"sha256:c87212b5837b4b5ac375867d4fa78469a32841263db5252947fba6fb15c6f9bc","observation_id":"22b4dd25-ddf0-4615-be23-e88bd3efb9f5","resolution":{"observed_at":"2026-08-12T12:19:26.030841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-15T14:20:32.813026Z","title":"arXiv preprint arXiv:2505.23836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11008","last_updated":"2026-08-12T09:15:36Z","snapshot_observed_at":"2026-08-21T03:05:25.234479Z","submitted_at":"2026-08-11T14:55:44Z","title":"Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:20:32.813026Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2608.11008"},"observation_digest":"sha256:070a16913717a85112b40ac3607d203f5088adaabbea66a5d919fb00a0c458f8","observation_id":"3e85087d-387f-4c75-89db-e0fb1db3f69d","resolution":{"observed_at":"2026-08-15T14:20:32.813026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-15T14:00:07.878819Z","title":"arXiv preprint arXiv:2505.23836 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11513","last_updated":"2026-08-11T23:57:06Z","snapshot_observed_at":"2026-08-18T10:39:33.774546Z","submitted_at":"2026-08-11T23:57:06Z","title":"Do Influence Tactics Matter? Investigating Prompt Framing Effects in LLM Code Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:00:07.878819Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2608.11513"},"observation_digest":"sha256:64c452639e514b65911a8c39ed20bc6f065bb7788ede023f12247bf1dc700aab","observation_id":"141c6d5b-da9a-4c0f-96ff-bb6c0d23d9a0","resolution":{"observed_at":"2026-08-15T14:00:07.878819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23836","snapshot_observed_at":"2026-08-14T13:38:50.766477Z","title":"Large language models often know when they are being evaluated","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13329","last_updated":"2026-08-13T14:57:37Z","snapshot_observed_at":"2026-08-20T06:52:46.071416Z","submitted_at":"2026-08-13T14:57:37Z","title":"A Probe Direction Is a Property of Its Prompt","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T13:38:50.766477Z"},"links":{"cited_paper":"/paper/2505.23836","citing_paper":"/paper/2608.13329"},"observation_digest":"sha256:d9a3dfdb9e53e63fda391a0d504b82c2414c025dec6b1031594e4b884e11ba02","observation_id":"380638a4-fddc-4bc8-858d-53a9ee46c614","resolution":{"observed_at":"2026-08-14T13:38:50.766477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23836/citation-record","integrity":"/paper/2505.23836/integrity","json":"/paper/2505.23836/citation-record.json","paper":"/paper/2505.23836"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.973285Z","title":null,"venue":null,"work_id":"ba3078af-8fa3-4b30-b4a7-d177eeecf471","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.989984Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:4c561efc1e0e59c67f95a898b7de004bdf84d6c1cf671f67912a183bd4491971","observation_id":"ee4c52f0-ab01-483b-a8ab-6f74e0b8d19d","resolution":{"observed_at":"2026-08-07T13:16:18.050051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.759618Z","title":null,"venue":null,"work_id":"cc1166fa-e7d0-45a1-a5b0-c6e1e2534a5b","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.082916Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:d77a690dfa25d42e5d6479b453f3b92d2ce7c26f8a90bb6a0d2753fd0142660d","observation_id":"4c42e766-0c9e-4716-8ed9-04bf6b419834","resolution":{"observed_at":"2026-08-07T13:16:17.865736Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07045","last_updated":"2024-06-24T04:04:21Z","snapshot_observed_at":"2026-08-18T14:35:02.737196Z","submitted_at":"2023-09-13T15:56:50Z","title":"SafetyBench: Evaluating the Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07045","snapshot_observed_at":"2026-08-07T13:16:15.735454Z","title":"Bertie Vidgen, Nino Scherrer, Hannah Rose Kirk, Rebecca Qian, Anand Kannappan, Scott A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.735454Z"},"links":{"cited_paper":"/paper/2309.07045","citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:2f424cdeca04c40421d785c9c7899c2422c6cd47f330963a4a66e218603d39d5","observation_id":"8d2f4893-47b3-4137-af3c-f0aa5f4dec6e","resolution":{"observed_at":"2026-08-07T13:16:15.735454Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.405393Z","title":"Fictional Scenario","venue":null,"work_id":"c34f5668-e179-4d0a-966a-958a4f08817b","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.273381Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:57a9404ebb03141d28271edbb12d7363a3574c2f9ca4d5edf7c6b18683be9594","observation_id":"bd404eaa-09a4-4f82-bc8e-33d8fa5fc2ec","resolution":{"observed_at":"2026-08-07T13:16:17.460904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.159482Z","title":"test\" or","venue":null,"work_id":"09edc385-ca67-4b60-b59d-ba92d9de995c","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.896241Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:03140ce1addba03a6faaa50f222f4850da7f1605ed69d737056d8ebc0cc74c14","observation_id":"62c685d9-cf3e-49f8-872e-58ae93b95136","resolution":{"observed_at":"2026-08-07T13:16:18.288641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.572707Z","title":null,"venue":null,"work_id":"24b27810-18da-4912-bbb8-7645c25d3c64","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.176113Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:b3a45ef0d17d75bbec5da3e8a79182e488e89be1c0326216669527e6ae12619b","observation_id":"bd4373ad-587b-498f-bdce-17f0110f9107","resolution":{"observed_at":"2026-08-07T13:16:17.641327Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.238905Z","title":null,"venue":null,"work_id":"1b93ff74-db3d-4061-bf70-17ace46b0cb7","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.368296Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:20b0d6bfcb747820aa8d62de0fcc0a441f4faa98efc692a1ad99028bb2388367","observation_id":"ef4e8172-1c6c-4446-bae3-c66de5f65b6e","resolution":{"observed_at":"2026-08-07T13:16:17.303560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.078769Z","title":null,"venue":null,"work_id":"36bebce6-bc8c-403f-85de-274a7216cebd","year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.465156Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:f7ef2e4a41dfb7b65130bfe06894db4b1e718ee494178f68c717b185dd13a9b7","observation_id":"73cfae9e-ee65-4db2-a7f4-e9aa548beb77","resolution":{"observed_at":"2026-08-07T13:16:17.134569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.895412Z","title":"Figure 18: The UI used by the authors to annotate the transcripts and create the human baseline","venue":null,"work_id":"ee68c6a7-d936-4161-ba41-a7ca4557970a","year":1982},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.539220Z"},"links":{"citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:5a3a7530ca6b065dd2e99f1000bb38dac2e6e12420bb5934e71777c3dc872737","observation_id":"9d3697b5-9296-4033-acaa-e7c8039ac2e7","resolution":{"observed_at":"2026-08-07T13:16:16.971288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-08-16T17:13:42.482483Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-07T13:16:15.857298Z","title":"You are a helpful assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.857298Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:ab08e700c3ac7c9fcc5aefca3456b5a991bb69710adb932555881492a742b374","observation_id":"3d05b928-c056-401c-bd28-2c7c2c051e3f","resolution":{"observed_at":"2026-08-07T13:16:15.857298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17389","last_updated":"2023-10-26T13:35:41Z","snapshot_observed_at":"2026-08-19T06:38:31.381707Z","submitted_at":"2023-10-26T13:35:41Z","title":"ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17389","snapshot_observed_at":"2026-08-07T13:16:15.795060Z","title":"Thomas Hartvigsen, Saadia Gabriel, Hamid Palangi, Maarten Sap, Dipankar Ray, and Ece Kamar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.795060Z"},"links":{"cited_paper":"/paper/2310.17389","citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:39f0590b61c03b7d889251ea67dd21ef99ad3e1f0d4a7ce56592c208e014bc4f","observation_id":"96d8ff20-356b-4be2-9aba-bb9b38955dea","resolution":{"observed_at":"2026-08-07T13:16:15.795060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-20T18:53:27.304270Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-07T13:16:15.583967Z","title":"Paul Bagocs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.583967Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:1b00700596d504e3b04a7308a1b97949f205a75915880d5fd1dc45fdb300d258","observation_id":"dcf12358-b2e3-48bf-86b9-bff50897266d","resolution":{"observed_at":"2026-08-07T13:16:15.583967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-16T05:17:43.289570Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09024","snapshot_observed_at":"2026-08-07T13:16:15.669721Z","title":"ShareGPT","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.669721Z"},"links":{"cited_paper":"/paper/2410.09024","citing_paper":"/paper/2505.23836"},"observation_digest":"sha256:7caadfcfe38f3545d7cda8b1143b03949ce6a055110ed8166c002825c38b2dc9","observation_id":"5881551b-1fe8-446c-b433-fd14e10458b8","resolution":{"observed_at":"2026-08-07T13:16:15.669721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23836","last_updated":"2025-07-16T11:25:40Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T20:46:40.924970Z","submitted_at":"2025-05-28T12:03:09Z","title":"Large Language Models Often Know When They Are Being Evaluated"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":7,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 43 inbound Pith citation observations for arXiv:2505.23836."}