{"as_of":"2026-08-11T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:712a792124fe8257c1b608a9d45cd010a89d13271391c8cd44cba6fe65dde08e","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:29.947321Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03112/citation-record","integrity":"/paper/2501.03112/integrity","json":"/paper/2501.03112/citation-record.json","paper":"/paper/2501.03112"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.03521","last_updated":"2021-06-07T11:22:39Z","snapshot_observed_at":"2026-08-09T21:47:12.651874Z","submitted_at":"2021-06-07T11:22:39Z","title":"RedditBias: A Real-World Resource for Bias Evaluation and Debiasing of Conversational Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03521","snapshot_observed_at":"2026-08-10T21:56:29.645946Z","title":"Redditbias: A real-world resource for bias evaluation and debiasing of conversational language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.645946Z"},"links":{"cited_paper":"/paper/2106.03521","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:116035254376687b937056ef9d77679306378c1d9bb20b46d3c759d82ab705b1","observation_id":"4c9fda61-dc49-401a-9e11-4c24594b01e9","resolution":{"observed_at":"2026-08-10T21:56:29.645946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:31.065819Z","title":"Unmasking contextual stereotypes: Measuring and mitigating bert's gender bias","venue":null,"work_id":"23cf9b13-71ef-4d4e-865a-30cf2fdc0188","year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.653295Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:6d232c8540ded0b9f656b786315756db0d25f41455e946bc04f3421cbe7b165b","observation_id":"9a8cf0d2-c30b-4544-9dd5-fd1948583f4b","resolution":{"observed_at":"2026-08-10T21:56:31.073526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.01943","last_updated":"2018-10-03T20:18:35Z","snapshot_observed_at":"2026-07-06T07:05:57.302799Z","submitted_at":"2018-10-03T20:18:35Z","title":"AI Fairness 360: An Extensible Toolkit for Detecting, Understanding, and Mitigating Unwanted Algorithmic Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.01943","snapshot_observed_at":"2026-08-10T21:56:29.659976Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.659976Z"},"links":{"cited_paper":"/paper/1810.01943","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:c040445ca26d19b18cb09595cf5ada30f925a110b3e05056677eb72e29103d23","observation_id":"cad1ae51-b69d-4b53-b338-f53e74001943","resolution":{"observed_at":"2026-08-10T21:56:29.659976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10853","last_updated":"2026-05-09T22:12:14Z","snapshot_observed_at":"2026-07-06T18:46:35.304901Z","submitted_at":"2024-07-15T16:04:44Z","title":"Bring Your Own Prompts: Use-Case-Specific Bias and Fairness Evaluation for LLMs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10853","snapshot_observed_at":"2026-08-10T21:56:29.682192Z","title":"An actionable framework for assessing bias and fairness in large language model use cases, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.682192Z"},"links":{"cited_paper":"/paper/2407.10853","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:df9e596ee077a00bec63e73f384a07edf0d027ab70d9fca63678125feb203fbd","observation_id":"f4ae09c9-1c15-4ea5-9dd0-9ffc067525ce","resolution":{"observed_at":"2026-08-10T21:56:29.682192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.689412Z","title":"Measuring fairness with biased rulers: A comparative study on bias metrics for pre-trained language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.689412Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:f42245e27b595325aef3c4dae73c9ed8a8d4e080e392258a510047ab64abb1c6","observation_id":"a7b08a19-fa73-42fe-9faa-a04f14db746f","resolution":{"observed_at":"2026-08-10T21:56:29.689412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.696945Z","title":"Bold: Dataset and metrics for measuring biases in open-ended language generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.696945Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:73e01e3c2db1866f3daf2cf4b41d710531e4f6a41fafdfb0372bfbf6cb168d66","observation_id":"6ccbd285-ea54-4a27-aa4c-199f5cc41bc8","resolution":{"observed_at":"2026-08-10T21:56:29.696945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15087","last_updated":"2024-10-17T19:30:08Z","snapshot_observed_at":"2026-08-10T14:51:00.232286Z","submitted_at":"2023-06-26T22:07:33Z","title":"WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15087","snapshot_observed_at":"2026-08-10T21:56:29.706110Z","title":"Felkner, Ho-Chun Herbert Chang, Eugene Jang, and Jonathan May","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.706110Z"},"links":{"cited_paper":"/paper/2306.15087","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:fe4c873ef00de684c7a0a505c132fca5534460e19fc5667cbb99b9b0f9137647","observation_id":"f7e64131-58ca-4fd9-8ce2-1c141981ef97","resolution":{"observed_at":"2026-08-10T21:56:29.706110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00770","last_updated":"2024-07-12T20:29:57Z","snapshot_observed_at":"2026-08-09T13:21:58.456670Z","submitted_at":"2023-09-02T00:32:55Z","title":"Bias and Fairness in Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00770","snapshot_observed_at":"2026-08-10T21:56:29.713205Z","title":"Gallegos, Ryan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.713205Z"},"links":{"cited_paper":"/paper/2309.00770","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:ce6819d45d3c87a354f860354cd8dca26709487c7fc073199f8b513d35f60181","observation_id":"3a690209-2f9a-48e4-bd28-6d01caf4ec52","resolution":{"observed_at":"2026-08-10T21:56:29.713205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.724103Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.724103Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:ad70d27ce110eb482593c4fc861c8c2918e255a6f930d1e22036451fb7aebe75","observation_id":"4bdd822a-57a9-4424-b93d-41a57a1ebc84","resolution":{"observed_at":"2026-08-10T21:56:29.724103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.730905Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.730905Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:82620b3426d2a8eb794a6757d759591ff3c77b7d2cdc5940332f17cd980d21e7","observation_id":"5565d9f3-385c-4908-9b50-741e18d0bd7a","resolution":{"observed_at":"2026-08-10T21:56:29.730905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15859","last_updated":"2021-06-08T15:03:11Z","snapshot_observed_at":"2026-08-08T06:20:42.179098Z","submitted_at":"2020-12-31T18:59:44Z","title":"Intrinsic Bias Metrics Do Not Correlate with Application Bias","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15859","snapshot_observed_at":"2026-08-10T21:56:29.739223Z","title":"Intrinsic bias metrics do not correlate with application bias, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.739223Z"},"links":{"cited_paper":"/paper/2012.15859","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:fd10af5986217695ff4c8271cf51848847303050e23303cee47fc1ac5ca74970","observation_id":"00efa17b-4fdc-406d-b8ca-a9836e3f6977","resolution":{"observed_at":"2026-08-10T21:56:29.739223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03064","last_updated":"2020-10-08T17:58:35Z","snapshot_observed_at":"2026-07-06T08:35:28.740170Z","submitted_at":"2019-11-08T05:56:01Z","title":"Reducing Sentiment Bias in Language Models via Counterfactual Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03064","snapshot_observed_at":"2026-08-10T21:56:29.746666Z","title":"Reducing sentiment bias in language models via counterfactual evaluation, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.746666Z"},"links":{"cited_paper":"/paper/1911.03064","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:5cadea4eb13453840bc57247898986af629935fae77a0e1281df80e24ae2f378","observation_id":"97821cb3-e1e0-47f9-a9b7-3a3469659a34","resolution":{"observed_at":"2026-08-10T21:56:29.746666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11507","last_updated":"2023-06-20T12:53:39Z","snapshot_observed_at":"2026-08-10T23:17:37.809729Z","submitted_at":"2023-06-20T12:53:39Z","title":"TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11507","snapshot_observed_at":"2026-08-10T21:56:29.752606Z","title":"Y, and Lichao Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.752606Z"},"links":{"cited_paper":"/paper/2306.11507","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:88cb0a679bae6a07c09a9027ba90180e2e8f8bd36881dfaafd3557645885ac4e","observation_id":"d2119278-9c00-4249-a600-99afeee24c86","resolution":{"observed_at":"2026-08-10T21:56:29.752606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.758598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.758598Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:9efdd38d54ebb08c80cdd26d1c1e5a6186bb8869d8528020e81a50c61e6ff603","observation_id":"68680030-ec2d-4e23-8e31-0b53ccdcf196","resolution":{"observed_at":"2026-08-10T21:56:29.758598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.997724Z","title":"Github - huggingface/evaluate: Evaluate: A library for easily evaluating machine learning models and datasets., 2022","venue":null,"work_id":"f835d337-e980-4e84-9304-91916e58c85f","year":2022},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.765396Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:b08c179b1ce8cc8bbb9227c55025013169aee5bc1995a5d401db4629ba48bed1","observation_id":"52e182ca-f00b-4c40-93d4-9c2f3d14b018","resolution":{"observed_at":"2026-08-10T21:56:31.005615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04508","last_updated":"2018-05-11T17:57:40Z","snapshot_observed_at":"2026-07-06T06:38:38.795414Z","submitted_at":"2018-05-11T17:57:40Z","title":"Examining Gender and Race Bias in Two Hundred Sentiment Analysis Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04508","snapshot_observed_at":"2026-08-10T21:56:29.771119Z","title":"Mohammad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.771119Z"},"links":{"cited_paper":"/paper/1805.04508","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:11f78c5325da20e7709e44e1ae6ce047d42b015242b5ef993c891ccb319f7c86","observation_id":"8cf5299e-17f9-466f-a770-c3dd834d990a","resolution":{"observed_at":"2026-08-10T21:56:29.771119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.781277Z","title":"Grep-biasir: A dataset for investigating gender representation bias in information retrieval results","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.781277Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:919ed4826feaecda54098f8ecfe85f748a497fd90283c7d650facdeb01951161","observation_id":"0ac66915-078e-400a-9b3e-3fce3a818d18","resolution":{"observed_at":"2026-08-10T21:56:29.781277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.975703Z","title":"Collecting a large-scale gender bias dataset for coreference resolution and machine translation, 2021","venue":null,"work_id":"014eb74d-ff62-4aff-b079-d05ea52beec2","year":2021},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.787116Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:a596cf1c8e65488aa96942e74a2ece8b006e196b94ff984614883ccb0c4eafcc","observation_id":"6891c092-a895-4fd4-8ea7-1a7739c0315f","resolution":{"observed_at":"2026-08-10T21:56:30.982097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.794081Z","title":"UNQOVER ing stereotyping biases via underspecified questions","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.794081Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:27b8a6941ce5040ff65e9f6b9e175a7d5dea3b2e0c381586735742a6051c71eb","observation_id":"e3adfad6-cde4-4695-b635-57663b786b73","resolution":{"observed_at":"2026-08-10T21:56:29.794081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T21:56:29.802738Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.802738Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:2c482b13c15c72c0f3e2fa533d570a5e0505a9cb8e41803467689523cc1996ef","observation_id":"f7e3189a-48ed-4eda-8eb0-f730cbd65023","resolution":{"observed_at":"2026-08-10T21:56:29.802738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.954828Z","title":"Stereoset: Measuring stereotypical bias in pretrained language models, 2020","venue":null,"work_id":"95c1a3b8-80de-4ab3-8539-e746f450d763","year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.811128Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:3dd4842bb29cf35978d339c19b3c96127c9aa8cec971f1fff62509ae5d0de2dd","observation_id":"89d26502-b61d-4007-93fa-428b87b9dd57","resolution":{"observed_at":"2026-08-10T21:56:30.961503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.935870Z","title":null,"venue":null,"work_id":"212a4fc7-26f9-411b-8d45-8cefb508dbd2","year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.820684Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:8abbe4c618c1eeba3ee3d4c56fa296469bf9e171b9694fd57aefe33568437c2b","observation_id":"18cd6dcc-ee37-4e1e-aa1a-2a595e4a6a10","resolution":{"observed_at":"2026-08-10T21:56:30.941552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.830327Z","title":"LangTest: A comprehensive evaluation library for custom LLM and NLP models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.830327Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:99b07675f691c735c08289b5f91f01060bee7a1fd3434db2ba6699787ec83759","observation_id":"fe8eae3e-1ac9-4348-8c14-3c81d75e7f9b","resolution":{"observed_at":"2026-08-10T21:56:29.830327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.838988Z","title":"HONEST : Measuring hurtful sentence completion in language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.838988Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:7d194b7d8ae968848c5d452fd311a07a56c597466b51c488fcf58fea2031556c","observation_id":"f0107dff-e375-4869-8871-434c589edeab","resolution":{"observed_at":"2026-08-10T21:56:29.838988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.844765Z","title":"BBQ : A hand-built bias benchmark for question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.844765Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:9765abaa916c6fc176e6bc3a26753771b68a12795394d361ffacb6c84bee11b3","observation_id":"f9f01f4c-772b-44fb-8dbe-3fffea2c6aaa","resolution":{"observed_at":"2026-08-10T21:56:29.844765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12586","last_updated":"2022-10-12T21:31:55Z","snapshot_observed_at":"2026-07-06T13:13:44.464408Z","submitted_at":"2022-05-25T09:00:29Z","title":"Perturbation Augmentation for Fairer NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12586","snapshot_observed_at":"2026-08-10T21:56:29.850756Z","title":"Perturbation augmentation for fairer nlp, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.850756Z"},"links":{"cited_paper":"/paper/2205.12586","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:685b61d9bdbb2f5a870935423cc4f7c18a131c4dfad260f8f3b03bec41539651","observation_id":"715ad8aa-5dfd-4830-97f4-399bde5a72f1","resolution":{"observed_at":"2026-08-10T21:56:29.850756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.916046Z","title":"Gender bias in coreference resolution","venue":null,"work_id":"a82a6929-23dd-43ce-a92e-548128e7edca","year":2018},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.858537Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:8855fa519d359e9026e31c2d544d1029cc70de5617723a4b2272b88511933716","observation_id":"9fd43837-e6b2-44a1-8925-a1096084c25c","resolution":{"observed_at":"2026-08-10T21:56:30.921954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.05577","last_updated":"2019-04-29T16:28:23Z","snapshot_observed_at":"2026-07-06T07:14:33.778676Z","submitted_at":"2018-11-14T00:34:01Z","title":"Aequitas: A Bias and Fairness Audit Toolkit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.05577","snapshot_observed_at":"2026-08-10T21:56:29.865472Z","title":"Aequitas: A bias and fairness audit toolkit","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.865472Z"},"links":{"cited_paper":"/paper/1811.05577","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:26a777b2cb75981262dfe3fe751a296609411b43552ea2426f6f2e565e963c98","observation_id":"3945aa4d-f4e7-4e0e-8665-948ad43b9c7d","resolution":{"observed_at":"2026-08-10T21:56:29.865472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-10T21:56:29.872726Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.872726Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:133bc68ae943907c46dcef13e400f295b970c5c960f63de54d5329e5ad6c9b72","observation_id":"c129e532-98a2-453f-8f25-817e4d59fbd4","resolution":{"observed_at":"2026-08-10T21:56:29.872726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.891144Z","title":"GitHub - tensorflow/fairness-indicators: Tensorflow's Fairness Evaluation and Visualization Toolkit , 2020","venue":null,"work_id":"ff7f4830-9503-46c3-94d2-2ecb48754477","year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.879340Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:c32974653ec0b0ab71eceb5bb89b6d0514ae111d20369c9e5a84a33e61f42bbd","observation_id":"792ff61a-c51c-4c07-bf78-5924640d5ed0","resolution":{"observed_at":"2026-08-10T21:56:30.901552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.872796Z","title":"LiFT : A scalable framework for measuring fairness in ml applications","venue":null,"work_id":"af21e6bf-197b-49f0-9e5e-f5fe7ad91f78","year":2020},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.886370Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:c5bae3108f5b4564d252393290f75c6a5af87a385c05ab57b728bd9e43aeb0f6","observation_id":"a9528359-e4ba-4398-af87-d4c757b74e80","resolution":{"observed_at":"2026-08-10T21:56:30.878757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.895025Z","title":"Decodingtrust: A comprehensive assessment of trustworthiness in gpt models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.895025Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:05f09656ccb8a56bb3ee293504cb41c206794024976dc42ac35cb4517d0d0c3c","observation_id":"f61ec470-37ac-4b88-ab3e-a865ba2cf371","resolution":{"observed_at":"2026-08-10T21:56:29.895025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.902568Z","title":"Mind the GAP : A balanced corpus of gendered ambiguous pronouns","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.902568Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:f6aef6f92a0e32c26b5edb95749345d385dee088a848ff61dde67317920f1b57","observation_id":"a8907c67-a482-424d-afb0-4518a25e16f5","resolution":{"observed_at":"2026-08-10T21:56:29.902568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:30.833693Z","title":"Fairlearn: Assessing and Improving Fairness of AI Systems","venue":null,"work_id":"3f422447-ea04-47a5-a858-1a7dcf11ea27","year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.908877Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:e744c0340b65c61a8399fc653cfb32a9c42e03a293e3b589c80723cdbaf43a51","observation_id":"47b071bd-64af-47a3-add0-692071f394ea","resolution":{"observed_at":"2026-08-10T21:56:30.842039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04135","last_updated":"2019-10-03T17:00:59Z","snapshot_observed_at":"2026-07-06T08:06:32.241881Z","submitted_at":"2019-07-09T13:16:24Z","title":"The What-If Tool: Interactive Probing of Machine Learning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04135","snapshot_observed_at":"2026-08-10T21:56:29.915961Z","title":"Vi \\' e gas, and Jimbo Wilson","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.915961Z"},"links":{"cited_paper":"/paper/1907.04135","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:4909bf5be9e01cb3f5e4630d819729358d4e1282d4a4373b22f4b8eb4639ec79","observation_id":"9f95aa82-3cc5-4939-b64e-b9ecb9a5182d","resolution":{"observed_at":"2026-08-10T21:56:29.915961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14126","last_updated":"2023-11-23T17:47:14Z","snapshot_observed_at":"2026-08-10T04:24:05.506670Z","submitted_at":"2023-11-23T17:47:14Z","title":"Towards Auditing Large Language Models: Improving Text-based Stereotype Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14126","snapshot_observed_at":"2026-08-10T21:56:29.929671Z","title":"Towards auditing large language models: Improving text-based stereotype detection, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.929671Z"},"links":{"cited_paper":"/paper/2311.14126","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:963e66c4187511fcf8e384faba4ad1d0b0fd1c16efd5682f4d51369655518bde","observation_id":"7dfe604c-d1e4-4e6f-8dac-f54b617b2dce","resolution":{"observed_at":"2026-08-10T21:56:29.929671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:29.938931Z","title":"Is chatgpt fair for recommendation? evaluating fairness in large language model recommendation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.938931Z"},"links":{"citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:18577bcbc476af7cdd4c1e013a845b450c90ff125ebb3cd4435186ef8be22647","observation_id":"5c395c50-cdcf-4224-aa1f-9bf090041aaf","resolution":{"observed_at":"2026-08-10T21:56:29.938931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06876","last_updated":"2018-04-18T18:51:00Z","snapshot_observed_at":"2026-08-09T02:48:38.758226Z","submitted_at":"2018-04-18T18:51:00Z","title":"Gender Bias in Coreference Resolution: Evaluation and Debiasing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06876","snapshot_observed_at":"2026-08-10T21:56:29.947321Z","title":"Gender Bias in Coreference Resolution: Evaluation and Debiasing methods , 4 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.947321Z"},"links":{"cited_paper":"/paper/1804.06876","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:8aa9f2c6a9aa1d48ab77cc54579b2e4f38c9eaaf1cadde27a1d703a0735fd7ff","observation_id":"84a317fc-c196-4ab8-bdb7-09fb59ce67ea","resolution":{"observed_at":"2026-08-10T21:56:29.947321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T10:05:22.511906Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.03112."}