{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df6e23e987ea4aeb6c29c715b48889bdaf41ff31621584a6b87e22afa79422e9","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:28:11.181361Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07947/citation-record","integrity":"/paper/2506.07947/integrity","json":"/paper/2506.07947/citation-record.json","paper":"/paper/2506.07947"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.07100","last_updated":"2020-10-14T13:58:53Z","snapshot_observed_at":"2026-07-31T07:45:23.793883Z","submitted_at":"2020-10-14T13:58:53Z","title":"Re-evaluating Evaluation in Text Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07100","snapshot_observed_at":"2026-08-07T05:28:11.120511Z","title":"Re-evaluating evaluation in text summarization.arXiv preprint arXiv:2010.07100,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.120511Z"},"links":{"cited_paper":"/paper/2010.07100","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:b2dd49b27e2773adcd4b2f8e52f38c5f0d709e1de0d767898b6fa7d0b08b21c0","observation_id":"29d4592b-fa06-4d7c-803b-04f41a7120f1","resolution":{"observed_at":"2026-08-07T05:28:11.120511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-07T05:28:11.142515Z","title":"J., Shlens, J., and Szegedy, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.142515Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:2b431b6995dea6c10d88612d7ba48d142b16eb099ce62a55bde8b236460bfacf","observation_id":"77c6bbc9-e814-4d60-a18c-b83fa3f9270d","resolution":{"observed_at":"2026-08-07T05:28:11.142515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07231","last_updated":"2018-08-22T06:00:56Z","snapshot_observed_at":"2026-07-06T06:56:49.530908Z","submitted_at":"2018-08-22T06:00:56Z","title":"Reducing Gender Bias in Abusive Language Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07231","snapshot_observed_at":"2026-08-07T05:28:11.159775Z","title":"H., Shin, J., and Fung, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.159775Z"},"links":{"cited_paper":"/paper/1808.07231","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:9659e5daeeaca1b28f71749c9db9b8472994f62a3911cd76843c7de2ed6b0952","observation_id":"4bbcbe76-0111-4f28-b4b2-36f41321738c","resolution":{"observed_at":"2026-08-07T05:28:11.159775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12558","last_updated":"2024-04-01T21:55:06Z","snapshot_observed_at":"2026-07-06T16:35:31.876632Z","submitted_at":"2023-10-19T08:09:58Z","title":"Large Language Models Help Humans Verify Truthfulness -- Except When They Are Convincingly Wrong","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12558","snapshot_observed_at":"2026-08-07T05:28:11.165754Z","title":"T., Zhao, C., Feng, S., Daumé III, H., and Boyd-Graber, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.165754Z"},"links":{"cited_paper":"/paper/2310.12558","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:ea8aec31a47d8054ce343b44c60d5eea2cb0db7e071b82d9674a0e0458aefb5e","observation_id":"2cd5e4bc-436f-4365-9b47-c76d90088f13","resolution":{"observed_at":"2026-08-07T05:28:11.165754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00746","last_updated":"2024-06-18T13:08:24Z","snapshot_observed_at":"2026-08-06T18:33:39.368740Z","submitted_at":"2023-10-01T17:52:59Z","title":"RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00746","snapshot_observed_at":"2026-08-07T05:28:11.168723Z","title":"M., Peng, Z., Que, H., Liu, J., Zhou, W., Wu, Y ., Guo, H., Gan, R., Ni, Z., Yang, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.168723Z"},"links":{"cited_paper":"/paper/2310.00746","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:978b07ece78b3080510abbb627dcc521fdf1cf0c5cd01309a043ee8220969a7a","observation_id":"428fe31f-9dfc-4ecf-9332-74760eb580f7","resolution":{"observed_at":"2026-08-07T05:28:11.168723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T05:28:11.171948Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.171948Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:d2548841fd02a4ef5bff38bc29938f9cdeef253f77ee39ab2275a85df9403d4f","observation_id":"17e6e69e-9328-4e50-8104-cb8b67cf9315","resolution":{"observed_at":"2026-08-07T05:28:11.171948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02622","last_updated":"2019-09-26T09:56:23Z","snapshot_observed_at":"2026-07-06T08:19:30.852269Z","submitted_at":"2019-09-05T20:26:44Z","title":"MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02622","snapshot_observed_at":"2026-08-07T05:28:11.177892Z","title":"M., and Eger, S","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.177892Z"},"links":{"cited_paper":"/paper/1909.02622","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:08cd8896612ee25870de2dbc77fd0f1c04098a1785f758697304bf2c0644cb2f","observation_id":"1ae77d9e-a123-457e-97d1-4f6f0074a7b8","resolution":{"observed_at":"2026-08-07T05:28:11.177892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T05:28:11.174703Z","title":"Q., and Artzi, Y","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.174703Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:e2d014e1ccebad5c7c57869cdf37ece75d18abe60730d4681c985e7e18e87987","observation_id":"4d8d9b65-ca47-4d27-99ad-70cf5a3378af","resolution":{"observed_at":"2026-08-07T05:28:11.174703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-07T05:28:11.156193Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilac- qua, M., Petroni, F., and Liang, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.156193Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:7984ed096918f2f190217d88bc11f220a529af33f0e8bdd960c962d2a5be9dc0","observation_id":"b73b1547-da50-4877-909b-94f8ff8fb7fb","resolution":{"observed_at":"2026-08-07T05:28:11.156193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07702","last_updated":"2024-03-14T02:07:11Z","snapshot_observed_at":"2026-08-02T18:42:43.546865Z","submitted_at":"2023-08-15T11:08:30Z","title":"Better Zero-Shot Reasoning with Role-Play Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07702","snapshot_observed_at":"2026-08-07T05:28:11.152894Z","title":"Better zero-shot reasoning with role-play prompting.arXiv preprint arXiv:2308.07702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.152894Z"},"links":{"cited_paper":"/paper/2308.07702","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:977314eefb34e72beed2232c0c79ed8e01a720f2883b1587df3c3fb5d1067dd0","observation_id":"dc38017d-7887-44c6-9ea6-aedfd7cd2b39","resolution":{"observed_at":"2026-08-07T05:28:11.152894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05201","last_updated":"2024-10-02T20:17:49Z","snapshot_observed_at":"2026-08-05T06:17:54.405816Z","submitted_at":"2024-02-07T19:11:23Z","title":"The Effect of Sampling Temperature on Problem Solving in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05201","snapshot_observed_at":"2026-08-07T05:28:11.162864Z","title":"and Guven, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.162864Z"},"links":{"cited_paper":"/paper/2402.05201","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:d8b7b2985a0892048b8898762064d8eeb33cc4cf918c36b8ba26497a80b42891","observation_id":"5d19118c-c010-4eab-a08a-2495128f71d3","resolution":{"observed_at":"2026-08-07T05:28:11.162864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T05:28:11.146164Z","title":"J., Wang, Z., Wang, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.146164Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:5eb98f8acee44844e5efcf23367a76b42788c987eaaee33f7c0e2e32f7cdb95f","observation_id":"147bf186-03e4-45d1-ab88-b11ee143e6be","resolution":{"observed_at":"2026-08-07T05:28:11.146164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.01134","last_updated":"2019-12-20T20:03:56Z","snapshot_observed_at":"2026-07-06T06:07:35.627707Z","submitted_at":"2017-11-03T12:54:51Z","title":"Accountability of AI Under the Law: The Role of Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.01134","snapshot_observed_at":"2026-08-07T05:28:11.135904Z","title":"Accountability of ai under the law: The role of explanation.arXiv preprint arXiv:1711.01134,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.135904Z"},"links":{"cited_paper":"/paper/1711.01134","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:41afd088947e6088448aa76b5aeccd7839f66539a06fb98254202083145e326f","observation_id":"e67ac1fe-e122-4f2a-bcdb-f818cd8f996f","resolution":{"observed_at":"2026-08-07T05:28:11.135904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11484","last_updated":"2025-01-10T02:18:01Z","snapshot_observed_at":"2026-08-07T19:18:05.527101Z","submitted_at":"2024-07-16T08:20:39Z","title":"The Oscars of AI Theater: A Survey on Role-Playing with Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11484","snapshot_observed_at":"2026-08-07T05:28:11.128582Z","title":"The oscars of ai theater: A survey on role-playing with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.128582Z"},"links":{"cited_paper":"/paper/2407.11484","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:aa77f6e0e84a74c0ea1a44f6e5c9c982bce819dfd55db01a6a2c5860d62ca469","observation_id":"85c28076-f0a8-4bda-96a6-365fa331faa0","resolution":{"observed_at":"2026-08-07T05:28:11.128582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.374910Z","title":"Nuanced metrics for measuring unintended bias with real data for text classification","venue":null,"work_id":"7801e97b-8c6b-4e45-a3bc-efb763cf443a","year":2019},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.124720Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:ebaf603ff9d270f844b9456a076c24cd225c17aa3a4b3f9aadaf2a5fe8fe1bf8","observation_id":"d4e88715-6dc5-4cf4-8afd-4b96ce44151b","resolution":{"observed_at":"2026-08-07T05:28:11.377978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.356472Z","title":"H., and Beutel, A","venue":null,"work_id":"a3287eca-cd73-4469-8fe1-c126cf1b9983","year":2019},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.139337Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:47078619d1a3a597e42b4286cb18c8d53c5efd07337fac2ae8bde1ef530eb02d","observation_id":"d28078df-5dbd-4f44-8ddd-96eab8434b9c","resolution":{"observed_at":"2026-08-07T05:28:11.359472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.05807","last_updated":"2016-11-17T16:41:21Z","snapshot_observed_at":"2026-08-07T03:32:58.857419Z","submitted_at":"2016-09-19T16:08:51Z","title":"Inherent Trade-Offs in the Fair Determination of Risk Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.05807","snapshot_observed_at":"2026-08-07T05:28:11.149472Z","title":"Inherent trade-offs in the fair determination of risk scores.arXiv preprint arXiv:1609.05807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.149472Z"},"links":{"cited_paper":"/paper/1609.05807","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:bed29bf2249daffe5991baa8f962a64de655bf37509601bcd6312f6cab73977f","observation_id":"0f2037af-455c-43a2-ba48-929b64b276c9","resolution":{"observed_at":"2026-08-07T05:28:11.149472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.365867Z","title":"Measuring and mitigating unintended bias in text classification","venue":null,"work_id":"9e6f83af-11f5-4a1f-8148-af6a8a4a2d90","year":2018},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.132613Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:5e16d5e8214248446680a0888488f11457cd95b9297170f6633417a03182950d","observation_id":"cc23a211-5d07-40e3-ab79-55eafc25767c","resolution":{"observed_at":"2026-08-07T05:28:11.368946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.345173Z","title":"Dollar amounts are shown in parentheses for costs exceeding 100¢ (1 USD)","venue":null,"work_id":"3ae3588d-f5a2-4361-8848-a13481618a1b","year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.181361Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:5a4eae07f704ac60c500914bdeff1beeea69bd52c0968198380cb43a61f711ae","observation_id":"4664fcd8-01d4-434f-8881-e3dba60bafb1","resolution":{"observed_at":"2026-08-07T05:28:11.349868Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T03:48:54.049290Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2506.07947."}