{"as_of":"2026-08-08T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcbcb42368013a46e4f74c3c4c5a5f67072f762fbdae18024555e1a57a63bc46","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:14:42.439045Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03024/citation-record","integrity":"/paper/2506.03024/integrity","json":"/paper/2506.03024/citation-record.json","paper":"/paper/2506.03024"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:43.881054Z","title":"Biasfinder: Metamorphic test generation to uncover bias for sentiment analysis systems","venue":null,"work_id":"2bdc4176-a1de-478d-960c-b660715c46c7","year":2021},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.496354Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:9208486c1cd91a1d026bfca9bfcc989a3deee4a6a9914b6837ae2d7018d436c3","observation_id":"390f38e2-a4f9-4b78-8507-1a01991a92a3","resolution":{"observed_at":"2026-08-07T11:14:43.944542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:43.726008Z","title":"Metamorphic testing: A review of challenges and opportunities","venue":null,"work_id":"1089cf70-69b1-405b-b399-61e3f693769d","year":2018},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.585061Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:a62944fba57ad64b18d19baeecba54cc8e77b92b83700706f9d622ca79fc87f4","observation_id":"4ccbb963-c9f5-42cc-8a75-a47fa4f0eb18","resolution":{"observed_at":"2026-08-07T11:14:43.806403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:41.677245Z","title":"Bias of ai-generated content: an examination of news produced by large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.677245Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:53513df79ef330d2911ad10c3ae5f0cd0c6c4405c19f80a379c191a559420280","observation_id":"e80e6cc6-7fee-415c-8a28-34e6e629f564","resolution":{"observed_at":"2026-08-07T11:14:41.677245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:43.574106Z","title":"Exploring the potential of llm to enhance teaching plans through teaching simulation","venue":null,"work_id":"901d8549-f7d9-496e-9b34-ab4e66581e86","year":2025},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.770606Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:0ac5d67b8b9afd013565cd53640cdd58fb819a70aa29c5d09bcd5f1c7b856cb4","observation_id":"525814a0-8204-43d1-b11b-a7227314cf1c","resolution":{"observed_at":"2026-08-07T11:14:43.644813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:43.398897Z","title":"Evaluation of chinese natural language processing system based on metamorphic testing","venue":null,"work_id":"b517ec2e-e948-4344-b6e7-4f82a879b826","year":2022},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.847090Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:e0749b0bc085b7c01b50cd25af108a67424c71a67814ae3bd91fadfcd7078b1c","observation_id":"156aa36b-75cf-4ce5-888e-d75972ec3fc2","resolution":{"observed_at":"2026-08-07T11:14:43.484457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:41.914478Z","title":"Large language models in law: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.914478Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:3b0846c60ed969b89530f10b5a161cea7dcb53f76b724042e6e6c61529f2449c","observation_id":"af3426ee-986d-4d35-bd62-0dc96c82e73f","resolution":{"observed_at":"2026-08-07T11:14:41.914478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:43.255731Z","title":"Metamorphic testing and certified mitigation of fairness violations in nlp models","venue":null,"work_id":"a5d042f6-cbc8-4e42-8005-7a87e4dd72ac","year":2020},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:41.981395Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:433a2c7d081d72cf0a5800012c47fc7061c0d90937e31f94338181c465128be8","observation_id":"60de564c-cbf0-4462-9d11-7fe792ec45e6","resolution":{"observed_at":"2026-08-07T11:14:43.321970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:43.081148Z","title":"Metamorphic testing of classification program for the covid-19 intelligent diagnosis","venue":null,"work_id":"843a82cf-d4bc-4cd8-ab9a-06fe7a2bdd23","year":2022},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.056465Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:d94a21dcb4ca541be2d200fc9c1e3ceabf4e0a2a8722ac2e2ef0be2ad4de6913","observation_id":"6c22aa88-0fde-4586-895a-0a2e799e99d6","resolution":{"observed_at":"2026-08-07T11:14:43.152326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:42.934156Z","title":"Codegen: An open large language model for code with multi-turn program synthesis","venue":null,"work_id":"3e199abc-cd2d-4a53-9a6c-01ba980940e5","year":null},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.152863Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:287cf2cf793133b9e9e1864f2cb965276a0f34c862e52f2778aa141685a8f959","observation_id":"667aebe8-22ec-4d0d-af9b-0ac1b90e4880","resolution":{"observed_at":"2026-08-07T11:14:43.003394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04118","last_updated":"2020-05-08T15:48:31Z","snapshot_observed_at":"2026-07-06T09:18:47.555571Z","submitted_at":"2020-05-08T15:48:31Z","title":"Beyond Accuracy: Behavioral Testing of NLP models with CheckList","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04118","snapshot_observed_at":"2026-08-07T11:14:42.214448Z","title":"Beyond accuracy: Behavioral testing of nlp models with check- list","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.214448Z"},"links":{"cited_paper":"/paper/2005.04118","citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:2669cb35fbf4e84876e03afd1115ba26ec14a4d149275dad12574657c16bb310","observation_id":"44185dd5-4404-45c2-b8e8-5e3dcf2f7052","resolution":{"observed_at":"2026-08-07T11:14:42.214448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:42.834019Z","title":"Evaluation framework of large language models in medical documentation: Development and usability study","venue":null,"work_id":"3c1f5eb2-dba9-4035-ab6d-7879993b0553","year":2024},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.293480Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:9dd3e297c740ac672f8b18f4afc0f05f494858d22237724b88bc4581bf33a317","observation_id":"6f11fbb5-044d-4f85-a3a9-a1ef35e68029","resolution":{"observed_at":"2026-08-07T11:14:42.881682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:42.691189Z","title":"As- traea: Grammar-based fairness testing","venue":null,"work_id":"1b9f3e9b-3b99-483d-b53c-09818a5d590a","year":2022},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.362874Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:6b00b6321ede7b59dcf58ce38fdc7f533135b2d1e2d96353eb0a0a9a46917fee","observation_id":"a993704b-7ce8-4788-98e8-66b52177faa9","resolution":{"observed_at":"2026-08-07T11:14:42.736267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:42.569992Z","title":"Quality assurance of bioinformatics software: a case study of testing a biomedical text processing tool using metamorphic testing","venue":null,"work_id":"c7c56cae-c3d1-44cb-84da-bcad3a3e5d7d","year":2018},"citing_paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.439045Z"},"links":{"citing_paper":"/paper/2506.03024"},"observation_digest":"sha256:80c39646452f8ff272499b5a0632ed0182b333028485ada87225c70cd461d4ba","observation_id":"dbd2430d-0f47-496d-86d5-5c8839d30380","resolution":{"observed_at":"2026-08-07T11:14:42.626601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03024","last_updated":"2025-06-03T16:00:30Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T11:08:12.082205Z","submitted_at":"2025-06-03T16:00:30Z","title":"GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.03024."}