{"as_of":"2026-08-07T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c24a8c819c238e0e49cc549536b01e8f873ccc0f58f67b8c884de3866d996cf","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:53.885759Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:21:56.069608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02088","snapshot_observed_at":"2026-08-04T11:21:56.069608Z","title":"McBE: A multi-task chinese bias evaluation benchmark for large language models.arXiv preprint arXiv:2507.02088,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05291","last_updated":"2026-05-27T02:09:31Z","snapshot_observed_at":"2026-08-06T15:30:06.407887Z","submitted_at":"2025-10-06T18:59:11Z","title":"Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:21:56.069608Z"},"links":{"cited_paper":"/paper/2507.02088","citing_paper":"/paper/2510.05291"},"observation_digest":"sha256:e421a71489b4f33c78a3fff460635afedf07307854a40e9064f7236671de1a72","observation_id":"dcb47e15-903c-4418-9f64-2f1fc147d8d6","resolution":{"observed_at":"2026-08-04T11:21:56.069608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02088/citation-record","integrity":"/paper/2507.02088/integrity","json":"/paper/2507.02088/citation-record.json","paper":"/paper/2507.02088"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.123150Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.123150Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:61cd6089e2029905040d85063657cf55405277b054afbefe2644c73e65535c15","observation_id":"70abc207-a1eb-458a-8883-cd69d079d4f5","resolution":{"observed_at":"2026-08-06T20:43:49.123150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.226291Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.226291Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:ec76dc36d6d88f13fc91de44e4979edb49f74d0692baf1f4ad285587edb9be0d","observation_id":"11fc4adf-2604-49d5-9d04-3ac95f35fba7","resolution":{"observed_at":"2026-08-06T20:43:49.226291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.707422Z","title":null,"venue":null,"work_id":"5d4b76c9-d7d4-4aca-becc-5ff01563e3c1","year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.315950Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:969ad430bbd4527c141c8a4e31b7e4176fa07199cf93bf89218c8ba88ead061c","observation_id":"b37ad127-5536-4c43-a507-75a2e287896c","resolution":{"observed_at":"2026-08-06T20:43:57.783403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.561020Z","title":null,"venue":null,"work_id":"2c1bcd1a-e625-4eb5-9f74-77dff426cb72","year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.425837Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:975dff7ae35c3a8df1a54950a261dc460c039f851cdabfa0042bf3fd89e60512","observation_id":"140c1b4a-2550-4dd6-9fcc-5f6760e6fdd9","resolution":{"observed_at":"2026-08-06T20:43:57.633355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.358757Z","title":null,"venue":null,"work_id":"fdbe07d1-d35b-4000-9f41-4c65751e6b11","year":2016},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.527301Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:e09283c680f558bcea4474f9ff3357d0ba987ad6fc5d301c7d161a2151261ced","observation_id":"579d1fd5-ec8d-41fb-ba9f-0ca66bfbdd6b","resolution":{"observed_at":"2026-08-06T20:43:57.451103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.206856Z","title":null,"venue":null,"work_id":"ee60a314-63a2-4dac-9386-1a6ffd3c45fe","year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.639647Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:4a47aa7920e4961f77f0bab274396613d943ebf534a63446ffec775bcf166e6d","observation_id":"c00e381d-2a85-450b-abe4-4ce14f24f5e6","resolution":{"observed_at":"2026-08-06T20:43:57.259950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.752463Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.752463Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:92648f3f7be15a581c5334baec6794bd6fbe21c40e781ff583664b43647bcbf6","observation_id":"c74d4ac1-3d19-4634-b0ba-f2bf0f9e0a96","resolution":{"observed_at":"2026-08-06T20:43:49.752463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T20:43:49.853394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.853394Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:b36b86f691bf160accbfdc23e22dfdceb6eefe83efa40a28d5477209a0dc8adc","observation_id":"5857c4b6-59ff-4de3-9e51-24ceca7200f1","resolution":{"observed_at":"2026-08-06T20:43:49.853394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:49.938219Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:49.938219Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:f4324db8c242ed9133eca8631fbf005d796410d0d7d2f1e6f7d9c4b664805f20","observation_id":"19d5d1f3-28f0-48ef-9d4e-5c1800b785ee","resolution":{"observed_at":"2026-08-06T20:43:49.938219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15087","last_updated":"2024-10-17T19:30:08Z","snapshot_observed_at":"2026-07-06T15:47:03.002949Z","submitted_at":"2023-06-26T22:07:33Z","title":"WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15087","snapshot_observed_at":"2026-08-06T20:43:50.098492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.098492Z"},"links":{"cited_paper":"/paper/2306.15087","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:c44c5eb31d3021bd8feba80c3fbbf91b1e9751b332c0927e5c04e920953dd4cb","observation_id":"50fd2ee8-154e-4584-9183-5a498eb5753b","resolution":{"observed_at":"2026-08-06T20:43:50.098492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T20:43:50.227498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.227498Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:8bd0c3aaee877b24ec797ad0439677eab372ae5f13a9e38de87f61e8f3df3cc4","observation_id":"0a67863e-e0d6-411c-b7e0-bc8d4ec444bc","resolution":{"observed_at":"2026-08-06T20:43:50.227498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.015123Z","title":null,"venue":null,"work_id":"d72111eb-7863-4331-911d-69b624461b57","year":2016},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.433474Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:778ebb4a6cb58ed3cef0523d9023fc7e0d1415f98d70ace544db74cb51b7fa76","observation_id":"711881eb-41c9-4394-8e25-1bb9cf8f1e5e","resolution":{"observed_at":"2026-08-06T20:43:57.084220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17553","last_updated":"2024-03-26T10:01:01Z","snapshot_observed_at":"2026-07-06T17:50:54.472429Z","submitted_at":"2024-03-26T10:01:01Z","title":"RuBia: A Russian Language Bias Detection Dataset","version":1},"cited_work":{"arxiv_id":"2403.17553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17553","snapshot_observed_at":"2026-08-06T20:43:54.486987Z","title":"RuBia: A Russian Language Bias Detection Dataset","venue":"cs.CL","work_id":"51d4fe2c-7b87-443d-8371-113bce06ce77","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.584453Z"},"links":{"cited_paper":"/paper/2403.17553","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:719960f6986205b3b8f7a4d090a1ee2fd14b1eb3e55e5563184d9ed0ac23a2e3","observation_id":"eea9c54a-c79d-48d7-98e3-56ffa50cceb0","resolution":{"observed_at":"2026-08-06T20:43:54.557581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.839678Z","title":null,"venue":null,"work_id":"1516e203-4fb4-4e3a-b4f9-e7a7ae1a854c","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.740044Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:67999658831c6dc04f342e100cc36cec6c963874bd77ba2c73122289e7eaf2c8","observation_id":"b7655efe-803e-4065-804a-cc4b883dbd81","resolution":{"observed_at":"2026-08-06T20:43:56.929909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:50.823334Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.823334Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:cebc8c25c5726fbc6c4d5d9c3eb41c298efb1747134ad34b692e9031cae78f95","observation_id":"60f3b0c1-5e71-4e43-a9aa-8466e799799e","resolution":{"observed_at":"2026-08-06T20:43:50.823334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.589190Z","title":null,"venue":null,"work_id":"08084bc1-5b48-431e-9101-34b1990b1fff","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:50.920491Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:af49c8ebafc81eb3bdacaa1332742487277a8ca0c6271876e2ea331df6c1457c","observation_id":"4d597594-5ac7-44a8-87f2-1a412b48ff08","resolution":{"observed_at":"2026-08-06T20:43:56.722708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.459448Z","title":null,"venue":null,"work_id":"a5a865b9-b771-4f55-89f6-d97d10c2ba16","year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.026171Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:33d2e1efb663215a5e78ce7a6908b185706c855ed654328127a516f98d47a4c3","observation_id":"21b1fcfc-3760-4be6-9caa-dbbbb477bad0","resolution":{"observed_at":"2026-08-06T20:43:56.520559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.347690Z","title":null,"venue":null,"work_id":"187a5aaa-e147-4f1c-85c2-d3acb751ac64","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.129634Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:5c2a4fa855961344785b14d3ccbd814c05b1bf8f4867b280d93dd77774a15af6","observation_id":"414bec75-ebbf-4aea-a2d0-dc4def6fd23c","resolution":{"observed_at":"2026-08-06T20:43:56.401960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16244","last_updated":"2023-06-28T14:14:44Z","snapshot_observed_at":"2026-07-06T15:47:49.817608Z","submitted_at":"2023-06-28T14:14:44Z","title":"CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16244","snapshot_observed_at":"2026-08-06T20:43:51.221195Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.221195Z"},"links":{"cited_paper":"/paper/2306.16244","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:608b5e455fe2b489f67a6d7d7882e2152749f1ba7a56597c1045bb6fac63eb7a","observation_id":"b6ca40df-5202-4e74-9d4c-d7ccea68f00e","resolution":{"observed_at":"2026-08-06T20:43:51.221195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T20:43:51.288121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.288121Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:7b5eb2f969847f795a919420d70a1eeee082c307869037e3fb9fe7acbfa0874f","observation_id":"a11af52c-2bf3-4bf4-be6b-59a079bfd91a","resolution":{"observed_at":"2026-08-06T20:43:51.288121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.200234Z","title":null,"venue":null,"work_id":"7a8d1512-57d3-4290-9dc6-987160e9f754","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.461104Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:1cec19da87aae2cdfd8a990465504bab433abce11382c1cc7ebba4587d127399","observation_id":"c5a13ecc-504a-4c5f-b138-7ef275f6a922","resolution":{"observed_at":"2026-08-06T20:43:56.259778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.041007Z","title":null,"venue":null,"work_id":"5c930b7c-22e6-4dc5-bc2f-014d0a92440f","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.569770Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:02814e1a537576efb4bee3e64534f461b5be6bab2d484a6e2450636d4eb41e8c","observation_id":"c98fa4de-2435-4b8c-82be-5c4916487221","resolution":{"observed_at":"2026-08-06T20:43:56.116278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07213","last_updated":"2019-05-17T11:39:21Z","snapshot_observed_at":"2026-07-06T07:53:43.025392Z","submitted_at":"2019-05-17T11:39:21Z","title":"Adaptation of Deep Bidirectional Multilingual Transformers for Russian Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07213","snapshot_observed_at":"2026-08-06T20:43:51.655254Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.655254Z"},"links":{"cited_paper":"/paper/1905.07213","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:2b63b8521b4b58c51b2f0505df930048ad1cab628607dbbfc5f18fad95519e9f","observation_id":"5ad80883-d926-42b7-9fb2-81e0fe2de551","resolution":{"observed_at":"2026-08-06T20:43:51.655254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.890810Z","title":null,"venue":null,"work_id":"285121d6-e56f-4ec7-a69b-e2a149d6db32","year":2015},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.735395Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:858e57bca17810c87ae1f08fa9793a16e67e68419df52e4fac7a1fa14b66f14a","observation_id":"27243f0e-bde1-493f-bec9-c19cc552c9b8","resolution":{"observed_at":"2026-08-06T20:43:55.959436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04419","last_updated":"2026-05-05T09:32:34Z","snapshot_observed_at":"2026-07-30T08:21:36.901013Z","submitted_at":"2025-02-06T15:20:58Z","title":"Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04419","snapshot_observed_at":"2026-08-06T20:43:51.814181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.814181Z"},"links":{"cited_paper":"/paper/2502.04419","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:9102e2f27273e20140c5482718f11cde50049d3dc7e07beefe0acf7ccacdad39","observation_id":"339dddbf-8122-4751-8ac9-b2e0d8799660","resolution":{"observed_at":"2026-08-06T20:43:51.814181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.729862Z","title":null,"venue":null,"work_id":"bf41bb53-ca14-49c6-961c-f6fc7e3f05ea","year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.877921Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:a6bed62cb0186a36d0246adf4252b6b963feda9128158441837092b76c3ecfe8","observation_id":"67dae05b-d3a9-4b9a-872b-4e1f2c8e8f8b","resolution":{"observed_at":"2026-08-06T20:43:55.791668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:43:51.950417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:51.950417Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:e778581501cdaeebf1999900b0d4068440c485d6644c2b2e428765a447793c83","observation_id":"13fa5e33-fe40-4336-a0d7-54fcc4c693e7","resolution":{"observed_at":"2026-08-06T20:43:51.950417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09456","last_updated":"2020-04-20T17:14:33Z","snapshot_observed_at":"2026-07-06T09:13:46.854094Z","submitted_at":"2020-04-20T17:14:33Z","title":"StereoSet: Measuring stereotypical bias in pretrained language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09456","snapshot_observed_at":"2026-08-06T20:43:52.015253Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.015253Z"},"links":{"cited_paper":"/paper/2004.09456","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:136c8da9c13d263f0bbcb08f1ffedeba61721d688f7a99584334bdc26bef5319","observation_id":"15aaa887-d913-426b-b5e8-10cec00af024","resolution":{"observed_at":"2026-08-06T20:43:52.015253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00133","last_updated":"2020-09-30T22:38:40Z","snapshot_observed_at":"2026-08-01T09:26:19.649537Z","submitted_at":"2020-09-30T22:38:40Z","title":"CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00133","snapshot_observed_at":"2026-08-06T20:43:52.107028Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.107028Z"},"links":{"cited_paper":"/paper/2010.00133","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:08598ba8a8c0915d3b077d7369a5c9b481e2ecd7153fab453fc250dd3064398c","observation_id":"956799bb-5b48-4886-a37a-afef76e8b8bd","resolution":{"observed_at":"2026-08-06T20:43:52.107028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.617493Z","title":null,"venue":null,"work_id":"354cda4c-f2c8-4bed-a556-819b6cc9839b","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.191096Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:459cec850bb2d48dd3f4724a0272fdcc2e3237dceed7ab6e3203c941d0ecd0c9","observation_id":"822d56e8-7382-462d-8647-94fbd17a5cfe","resolution":{"observed_at":"2026-08-06T20:43:55.668459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-06T20:43:52.282476Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.282476Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:85ebe7d12f4c42768c8e6897a6d48f0ca422ef2458138df455defb931d9230f6","observation_id":"95106ad7-492a-481e-be92-a869e79e368f","resolution":{"observed_at":"2026-08-06T20:43:52.282476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.502268Z","title":null,"venue":null,"work_id":"e1108d7c-9f8d-4651-baf6-686ad5aad991","year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.373254Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:c7c8fb545eac610388c035fcaf04978c0ae3ea34ba24747c988866e0c4fee051","observation_id":"5ed5d67c-23b9-472e-99fb-0df4755d1218","resolution":{"observed_at":"2026-08-06T20:43:55.571998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09301","last_updated":"2018-04-25T00:46:14Z","snapshot_observed_at":"2026-07-06T06:35:16.414488Z","submitted_at":"2018-04-25T00:46:14Z","title":"Gender Bias in Coreference Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09301","snapshot_observed_at":"2026-08-06T20:43:52.465611Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.465611Z"},"links":{"cited_paper":"/paper/1804.09301","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:32efc10a13601b940e178027a75d504880d0416a3a51b55ad92a19f6408466a3","observation_id":"b79a0352-d996-4431-84c1-4747ed27f94c","resolution":{"observed_at":"2026-08-06T20:43:52.465611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20147","last_updated":"2024-04-03T11:59:19Z","snapshot_observed_at":"2026-08-06T11:50:57.527244Z","submitted_at":"2024-03-29T12:32:06Z","title":"IndiBias: A Benchmark Dataset to Measure Social Biases in Language Models for Indian Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20147","snapshot_observed_at":"2026-08-06T20:43:52.544990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.544990Z"},"links":{"cited_paper":"/paper/2403.20147","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:296856d33a7f1ddf296b313cf81497d94e7b00a3d9fe7f4b694a35dcc2ff848f","observation_id":"495eeaea-a1db-40cf-9318-d9bb0771aa49","resolution":{"observed_at":"2026-08-06T20:43:52.544990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.336058Z","title":null,"venue":null,"work_id":"5d5543f7-8a91-4ee9-ba6f-9c13c794d25e","year":2025},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.646131Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:d3eb26c58814e9329042ed4531333bad9c915c12ece7a7873f036db29a2b8b4d","observation_id":"660fae65-61ce-4433-ab83-96b4d6077ec1","resolution":{"observed_at":"2026-08-06T20:43:55.417463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02453","last_updated":"2023-02-05T18:35:21Z","snapshot_observed_at":"2026-08-01T15:59:16.515750Z","submitted_at":"2023-02-05T18:35:21Z","title":"FineDeb: A Debiasing Framework for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02453","snapshot_observed_at":"2026-08-06T20:43:52.727546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.727546Z"},"links":{"cited_paper":"/paper/2302.02453","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:838277e332000607f8806b26fd84be5326acf623a43a257b6965eae85f262419","observation_id":"188f3a01-cd5b-4912-8827-6a5a68477e9d","resolution":{"observed_at":"2026-08-06T20:43:52.727546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.218940Z","title":null,"venue":null,"work_id":"5d7c47b4-1be4-4342-90f9-05414a7f7293","year":2014},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.818717Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:f0f1aa4036b785f3eee07b36e4aa099e8a3497a2822c67cdd069dd6815cc8a2e","observation_id":"33389b95-9cd5-4c41-a542-d58029060d49","resolution":{"observed_at":"2026-08-06T20:43:55.274110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.072391Z","title":null,"venue":null,"work_id":"552a9755-968c-43f9-82e4-08a415670cbe","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.864756Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:2dcd02b0f5920b3f3372a6584d34ae97c90a04e0a3c9a866f889ae21021df34b","observation_id":"c50c5c8d-83b8-4e69-9b03-7946e5c9643b","resolution":{"observed_at":"2026-08-06T20:43:55.160238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:54.930754Z","title":null,"venue":null,"work_id":"bfdc2160-487c-450c-aafa-31b057475ad9","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:52.940549Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:4de9e575fe51eaed5d8902ef406f9a92bb3b1bf8c526fd6437dc513701d08bf1","observation_id":"d8eafa20-d2bf-47d2-b74a-483033cb4afa","resolution":{"observed_at":"2026-08-06T20:43:55.004800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09860","last_updated":"2022-06-20T15:52:40Z","snapshot_observed_at":"2026-07-06T13:22:46.220372Z","submitted_at":"2022-06-20T15:52:40Z","title":"Fewer Errors, but More Stereotypes? The Effect of Model Size on Gender Bias","version":1},"cited_work":{"arxiv_id":"2206.09860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.09860","snapshot_observed_at":"2026-08-06T20:43:54.152512Z","title":"Fewer Errors, but More Stereotypes? The Effect of Model Size on Gender Bias","venue":"cs.CL","work_id":"aca33c21-cd0a-46db-8ea3-a42704c5863e","year":2022},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.025679Z"},"links":{"cited_paper":"/paper/2206.09860","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:625a982f3de96d629f925d6b330dbcc2bc15b3ac8cdd127d937222e9aa15d995","observation_id":"5072e452-4ab7-462d-91a6-0ed79477adcb","resolution":{"observed_at":"2026-08-06T20:43:54.221961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:54.817398Z","title":null,"venue":null,"work_id":"4d105d62-52ee-41e1-bcdb-a0bed5d8bda1","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.083634Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:7ebef3e1663a02b3d6f6635807ce43875f3580d9569bf319f4ad94e4c253f455","observation_id":"8477accb-86c4-4061-846b-7bb701530001","resolution":{"observed_at":"2026-08-06T20:43:54.870070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:43:53.162694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.162694Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:54619d4dd3f424d33a00fe690c5cde33d9fb1434dbc58422e9295190d0cdd33d","observation_id":"c61b1df8-725e-4e2f-aba9-29824afb4487","resolution":{"observed_at":"2026-08-06T20:43:53.162694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02463","last_updated":"2023-02-14T21:34:34Z","snapshot_observed_at":"2026-07-06T14:48:33.256993Z","submitted_at":"2023-02-05T19:15:33Z","title":"Nationality Bias in Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02463","snapshot_observed_at":"2026-08-06T20:43:53.240019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.240019Z"},"links":{"cited_paper":"/paper/2302.02463","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:4b9660376f4cbbfde2d2f2472ef5dd49588d1153540f5288f2f37ee0e7dc86ba","observation_id":"4a1e8297-fdc4-4be5-ac49-e0b56ca7201d","resolution":{"observed_at":"2026-08-06T20:43:53.240019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10508","last_updated":"2025-05-30T22:39:05Z","snapshot_observed_at":"2026-08-03T08:00:57.733951Z","submitted_at":"2024-04-16T12:27:54Z","title":"White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10508","snapshot_observed_at":"2026-08-06T20:43:53.300456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.300456Z"},"links":{"cited_paper":"/paper/2404.10508","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:7aab116168bea222dfbb601d8523bd5eee12b98b92b0375eed84f659477d9da8","observation_id":"70271fd1-06bf-41e7-8540-248463cab8de","resolution":{"observed_at":"2026-08-06T20:43:53.300456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09219","last_updated":"2023-12-01T19:21:20Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T16:12:57Z","title":"\"Kelly is a Warm Person, Joseph is a Role Model\": Gender Biases in LLM-Generated Reference Letters","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09219","snapshot_observed_at":"2026-08-06T20:43:53.367103Z","title":"kelly is a warm person, joseph is a role model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.367103Z"},"links":{"cited_paper":"/paper/2310.09219","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:375a570dfe9683e8a45ccc917798ce78eea1b20cea0f6386e4f8601ee5c2f5bd","observation_id":"877703ff-2ac7-4b28-be53-30272425dd63","resolution":{"observed_at":"2026-08-06T20:43:53.367103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02408","last_updated":"2025-02-22T02:44:54Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T16:31:37Z","title":"CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02408","snapshot_observed_at":"2026-08-06T20:43:53.456321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.456321Z"},"links":{"cited_paper":"/paper/2407.02408","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:4f9129ec9b81bd038cb7aa072ba774ad185974ad779742b3bfe3b17a99c38831","observation_id":"ff44f5cd-30d7-4cb2-83c9-1110f53c9b92","resolution":{"observed_at":"2026-08-06T20:43:53.456321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-06T20:43:53.513331Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.513331Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:8f50d1353311c369219271466f3f4477d8da91f96c56911d273bddac414582f4","observation_id":"1c487782-603d-477f-9d56-0034ad23110a","resolution":{"observed_at":"2026-08-06T20:43:53.513331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02050","last_updated":"2025-06-13T09:44:56Z","snapshot_observed_at":"2026-07-06T18:24:56.906947Z","submitted_at":"2024-06-04T07:31:06Z","title":"JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02050","snapshot_observed_at":"2026-08-06T20:43:53.588373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.588373Z"},"links":{"cited_paper":"/paper/2406.02050","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:79fae95097b425515caeed9c3d5543a753f771b9cd92f2cf125a28d958eed391","observation_id":"7ff40210-2587-489d-a6db-d2b757d2e7f4","resolution":{"observed_at":"2026-08-06T20:43:53.588373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-06T20:43:53.690428Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.690428Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:ff7e4ccf024380ccdee65e7fb30b5d528aaa6f5dfbede7fd69f5f13bdc5ea388","observation_id":"9137be06-1e66-4d95-857b-bebef2820f60","resolution":{"observed_at":"2026-08-06T20:43:53.690428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11262","last_updated":"2023-05-18T18:58:30Z","snapshot_observed_at":"2026-07-06T15:29:24.259073Z","submitted_at":"2023-05-18T18:58:30Z","title":"CHBias: Bias Evaluation and Mitigation of Chinese Conversational Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11262","snapshot_observed_at":"2026-08-06T20:43:53.769413Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.769413Z"},"links":{"cited_paper":"/paper/2305.11262","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:8e6bb9c8a9ec56972a162ab6ba83a6e54cfdf0476699a43b9cec1d416f52d9a1","observation_id":"f7a8b70f-23c1-4cb3-9ad5-aeab1bcf4259","resolution":{"observed_at":"2026-08-06T20:43:53.769413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06876","last_updated":"2018-04-18T18:51:00Z","snapshot_observed_at":"2026-08-02T22:35:53.671852Z","submitted_at":"2018-04-18T18:51:00Z","title":"Gender Bias in Coreference Resolution: Evaluation and Debiasing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06876","snapshot_observed_at":"2026-08-06T20:43:53.846796Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.846796Z"},"links":{"cited_paper":"/paper/1804.06876","citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:5c3daff4209dd237bb889d02b1ba0511fb835442c2c1e1329b5860ca853957bf","observation_id":"221ed02f-c165-45ca-8ca4-c281abc1fa5f","resolution":{"observed_at":"2026-08-06T20:43:53.846796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:53.858313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.858313Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:52f594c8f691c7d8a6fb9ec4d672aaffdaebdfe51f65b1075fa9c902d6e96ddd","observation_id":"163053ac-8f4e-47d8-a93c-afba362ab467","resolution":{"observed_at":"2026-08-06T20:43:53.858313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:54.660976Z","title":"Markov, Vladislav Mikhailov, and Alena Fenogenova","venue":null,"work_id":"4ca51db1-d3b3-4f2c-850e-8b3f34930ee3","year":2024},"citing_paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:53.885759Z"},"links":{"citing_paper":"/paper/2507.02088"},"observation_digest":"sha256:119f024f8fb7eaa76bc12349488413043a37cc313490aa28bc08c9a9c402f8cc","observation_id":"7cbd701e-4012-4d63-8239-d3eb8b1d673c","resolution":{"observed_at":"2026-08-06T20:43:54.739474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02088","last_updated":"2025-08-07T11:09:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:36:08.392526Z","submitted_at":"2025-07-02T19:04:56Z","title":"McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2507.02088."}