{"as_of":"2026-08-13T02:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d0d2fab6e820fe7c1c0d5ea1ee449765c1d7d674fed8e6c3edc5142d962a3ae","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:13:17.824953Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T06:34:54.572363Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:36:43.165501Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"cited_work":{"arxiv_id":"2411.16391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16391","snapshot_observed_at":"2026-07-02T06:36:43.165501Z","title":null,"venue":null,"work_id":"d62ae6aa-783b-4a3a-80bc-171ac0af9291","year":2024},"citing_paper":{"arxiv_id":"2607.01040","last_updated":"2026-07-01T15:05:10Z","snapshot_observed_at":"2026-08-12T12:25:07.714021Z","submitted_at":"2026-07-01T15:05:10Z","title":"As It Was: Aligning LLM Search Evaluation with Historical User Preferences","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T06:34:54.572363Z"},"links":{"cited_paper":"/paper/2411.16391","citing_paper":"/paper/2607.01040"},"observation_digest":"sha256:babce8318f3ff043bda934957dc2fd1bc9f55756d37e0e5419ba7f4dfab7317c","observation_id":"19fe34e4-4d2f-4d07-ac69-b5e58bd3892a","resolution":{"observed_at":"2026-07-02T06:36:43.167106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16391/citation-record","integrity":"/paper/2411.16391/integrity","json":"/paper/2411.16391/citation-record.json","paper":"/paper/2411.16391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.506102Z","title":null,"venue":null,"work_id":"6e782124-f367-4446-9c31-84ea31b59c2c","year":2023},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.672139Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:0ca764b435d70bed4e928b99996439c1e1af132855b908b0ba520c5a3e37febb","observation_id":"d475b582-1108-4126-afba-4325da029882","resolution":{"observed_at":"2026-08-12T13:13:18.514309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.479140Z","title":"D., Dhariwal, P.,","venue":null,"work_id":"3270755b-71ad-4845-8cc2-05d7db984503","year":2020},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.678908Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:0c7e6bae3f945b790fd2156224dc3fdbdc747214e4ab74e19233752fd6257766","observation_id":"f4e9db51-8048-48bd-81f7-79874e3db957","resolution":{"observed_at":"2026-08-12T13:13:18.486573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18163","last_updated":"2024-11-07T16:31:48Z","snapshot_observed_at":"2026-08-12T23:14:44.429817Z","submitted_at":"2024-07-25T16:25:10Z","title":"Statistical optimal transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18163","snapshot_observed_at":"2026-08-12T13:13:17.685051Z","title":"and Rigollet, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.685051Z"},"links":{"cited_paper":"/paper/2407.18163","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:668835585168340e44d52b2b4c7e35990abcf8b816df82b2ed7311373cad9498","observation_id":"18cd92b3-c97c-4d80-98cd-ff469246b953","resolution":{"observed_at":"2026-08-12T13:13:17.685051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.457460Z","title":"W., Lee, K","venue":null,"work_id":"b7e8d77c-68a8-4273-b4d8-33304dd7dac5","year":2019},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.691030Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:de47995fcc11dd1eda30648800bcae6026a57f878bf09353162246823d2c649c","observation_id":"73125079-3cb5-4ff4-bf98-5705f4736c16","resolution":{"observed_at":"2026-08-12T13:13:18.463189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.435112Z","title":"and Chen, D","venue":null,"work_id":"8defaea1-8938-450c-8592-ef7985d9a734","year":2021},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.697137Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:0fffa12e19310e357e8655beada93040f901081e08f3d364bb739559d71f63c2","observation_id":"9829d707-54cf-4392-be4b-13c53b976abb","resolution":{"observed_at":"2026-08-12T13:13:18.442102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-12T13:13:17.705744Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.705744Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:36555984e38029c6f4e98ab3d90441c7b967f32085ee8bd19fa36be2033e8d2f","observation_id":"79110c0c-b98b-4f87-8de6-d018d239278d","resolution":{"observed_at":"2026-08-12T13:13:17.705744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.414597Z","title":"and Unitary team","venue":null,"work_id":"33548326-5a81-4317-8b1d-64938dc8e32b","year":2020},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.712305Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:64788fdcf64ec12244475d809da2206ac268b4048720903d63f32c73981aee24","observation_id":"f29a58c7-0128-4e4c-a7fc-9c186e572ecc","resolution":{"observed_at":"2026-08-12T13:13:18.421197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08542","last_updated":"2022-04-29T16:02:14Z","snapshot_observed_at":"2026-08-06T15:05:15.035432Z","submitted_at":"2021-12-16T00:38:35Z","title":"QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08542","snapshot_observed_at":"2026-08-12T13:13:17.717427Z","title":", and Weld, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.717427Z"},"links":{"cited_paper":"/paper/2112.08542","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:d531cf3734a2e19a1415c1b3b6dbf48173fd1a52ec3a254175b1fc9e9be4d530","observation_id":"f16d3497-1404-4d1c-abd1-b4c3790b73ac","resolution":{"observed_at":"2026-08-12T13:13:17.717427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04228","last_updated":"2020-04-08T20:01:09Z","snapshot_observed_at":"2026-08-11T07:38:56.129301Z","submitted_at":"2020-04-08T20:01:09Z","title":"Asking and Answering Questions to Evaluate the Factual Consistency of Summaries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04228","snapshot_observed_at":"2026-08-12T13:13:17.723487Z","title":"and Socher, R","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.723487Z"},"links":{"cited_paper":"/paper/2004.04228","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:0e5d742cb966711cbd340b17ac57431d5b5d8894892ba3c5b03d866478f1d6f1","observation_id":"4fd2f648-8b76-4966-a9f2-d8d820dc4b68","resolution":{"observed_at":"2026-08-12T13:13:17.723487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-12T13:13:17.729889Z","title":"and Zhang, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.729889Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:1590ba9495380004116911b2c1e29c635a722cb47c0a78e96db18f630e4a51a9","observation_id":"7f4a565d-eaee-4efa-872f-9024cd6dd397","resolution":{"observed_at":"2026-08-12T13:13:17.729889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.387139Z","title":"and Bansal, M","venue":null,"work_id":"fb8316b4-49d4-4e8b-9f49-b1dbedb446b8","year":2022},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.736659Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:a77691ee05bb3f3d154fb571de96af4398deb9240d2074b7530fa5ad278a8a60","observation_id":"bb7369d6-7286-4e19-b069-69e2639c038b","resolution":{"observed_at":"2026-08-12T13:13:18.394189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.363398Z","title":", and Kiela, D","venue":null,"work_id":"470eabbf-ff69-4a67-a550-29f9c9d59f50","year":2020},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.741914Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:daac809842b353219fee1a62189f0e1cc59a7ebe92a70c43d08627853a295bf1","observation_id":"374488d9-b290-4812-a200-40547505b47b","resolution":{"observed_at":"2026-08-12T13:13:18.370811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.342048Z","title":", and Koreeda, Y","venue":null,"work_id":"f0d4a10b-3589-4dae-89e5-f1dd77557d0d","year":2023},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.746694Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:59971eed163f98c945ddec35aca67e9cbb4683a9f758a8edbbd5d7dc0d4b0562","observation_id":"3e2c512d-5986-47aa-a197-d6837d1f50b2","resolution":{"observed_at":"2026-08-12T13:13:18.349617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.311495Z","title":"and Evans, O","venue":null,"work_id":"c7662321-89f0-4855-9f7c-9026fb31391a","year":2022},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.752246Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:ef43c0d172d6f5f3a6b6f16ed0451f189d5dee74450efd04d92091fbdb3e3fd1","observation_id":"fc479bc5-748b-4df0-b67b-67e5d5fc5843","resolution":{"observed_at":"2026-08-12T13:13:18.323646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00161","last_updated":"2024-08-08T16:31:05Z","snapshot_observed_at":"2026-08-12T23:10:39.643125Z","submitted_at":"2024-07-31T21:12:21Z","title":"Automatic Generation of Behavioral Test Cases For Natural Language Processing Using Clustering and Prompting","version":2},"cited_work":{"arxiv_id":"2408.00161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.00161","snapshot_observed_at":"2026-08-12T13:13:17.921843Z","title":"Automatic Generation of Behavioral Test Cases For Natural Language Processing Using Clustering and Prompting","venue":"cs.CL","work_id":"2634142d-77c4-49f6-8bd3-79c1584423c4","year":2024},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.757606Z"},"links":{"cited_paper":"/paper/2408.00161","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:7c5b75de474dfd090e26dc7f6dba9858bebece0176c0ac29f4cbd5d67de781f9","observation_id":"67de1eb9-3f2e-415d-a994-db6e53278f2b","resolution":{"observed_at":"2026-08-12T13:13:17.929626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.275218Z","title":null,"venue":null,"work_id":"99131c81-54df-4b94-89f1-18e5b8437a14","year":2009},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.762900Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:648a9160270e793d83cb697bb46da6484250e505bdafc9ae7ebded4ebe657951","observation_id":"caee6645-1db0-46cd-a39c-1fc25ec914c1","resolution":{"observed_at":"2026-08-12T13:13:18.284067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-12T13:13:17.768083Z","title":"and Melville, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.768083Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:01c0035a249a4ecc45cfc8f9f3787fc5799c3487bad7bac7e48864efcf86885d","observation_id":"b94ccbd7-7136-4986-8e96-7986c982258c","resolution":{"observed_at":"2026-08-12T13:13:17.768083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.255851Z","title":"and Gurevych, I","venue":null,"work_id":"f260f3b1-69fe-46de-bfda-56c100f8f9ab","year":2019},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.773880Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:00e8350e0ce1ed0f8dff48d26c3418fb52cbef370050189831fcd43dc633eafd","observation_id":"d8033f59-25ba-4b49-9212-4e41eee2da74","resolution":{"observed_at":"2026-08-12T13:13:18.261978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.229797Z","title":"T., Wu, T., Guestrin, C","venue":null,"work_id":"d110d10a-ca7c-4752-89c1-ba35fb299f60","year":2020},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.778866Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:d3c36e00197d45b2a1e6dbcbd288a42d23beb65953dbcd4b7dd82db20594b3a4","observation_id":"5d3a9995-e779-420f-82be-5e838272b0e4","resolution":{"observed_at":"2026-08-12T13:13:18.238128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.205030Z","title":"P., and Xu, X","venue":null,"work_id":"0f606011-7914-4b8f-84aa-fd6590199a87","year":2017},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.785378Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:3a7368324a8029cb7bb6bf75da9879b5d2d0fce4e5a1e0a9139c894a2e15e775","observation_id":"c3a03187-3093-4985-a3f8-719fca11cecd","resolution":{"observed_at":"2026-08-12T13:13:18.213127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.179111Z","title":"and Zhang, A","venue":null,"work_id":"19b85f01-9613-4b1e-bed4-7c4d68fd6edf","year":2024},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.791062Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:5947931340aea29295f74829068848c9de9e3e246ef869e72d22c78343065398","observation_id":"2da941b6-e1ba-4601-8468-6df268d54591","resolution":{"observed_at":"2026-08-12T13:13:18.187800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.149767Z","title":"A., Abid, A., Fisch, A.,","venue":null,"work_id":"71e2247f-410d-4d3f-be8a-bbc8e6531437","year":2023},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.797762Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:2f4f44ec469865c9d15291d172fb17a8c062d04b96a138b487874ecbaf93bdf5","observation_id":"f7ee1654-0631-4eff-a88a-a482e2243345","resolution":{"observed_at":"2026-08-12T13:13:18.156961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.120825Z","title":"and Wang, Z","venue":null,"work_id":"507ad2c5-f302-4709-8e71-47fd1c50c7ab","year":2022},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.803096Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:bbcac96d228da4e3783e9bc650aec76d40e1f04291e4c16a3e2a9cf8043d55d8","observation_id":"475f1107-1229-4c5c-8d0d-a64d4b21caf8","resolution":{"observed_at":"2026-08-12T13:13:18.129505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.093792Z","title":"and Shafer, G","venue":null,"work_id":"1b5522cc-d6c3-48d0-892a-33a5961529db","year":2005},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.808402Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:e37a1b087dc4a7bfd30a94b4d9f5f0b21e9e4174034f596d26576746dc796246","observation_id":"ffb5d2f9-2f01-4a0b-ac99-5ad382ad7b3c","resolution":{"observed_at":"2026-08-12T13:13:18.103309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-11T10:35:06.989614Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-12T13:13:17.813782Z","title":"Qi, P., Zhang, S., Bengio, Y., Cohen, W.W., Salakhutdinov, R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.813782Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:e067b15e86d87ee7bddd0e48acb1e4e1b6a86d750d77427d0cad52d5fbb85cdd","observation_id":"834ad3c5-9147-4512-bac3-2a5cbc712681","resolution":{"observed_at":"2026-08-12T13:13:17.813782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:13:18.066529Z","title":null,"venue":null,"work_id":"d592181e-2089-4d78-9648-dfa82d3c591a","year":2020},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.819874Z"},"links":{"citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:59d1a298cfd9270e708f04a7205b9c5c0821d87fde165f422f59717f2c0bfeb5","observation_id":"04f7eaa7-a087-4098-a8bc-fb02e429a0a8","resolution":{"observed_at":"2026-08-12T13:13:18.073918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T13:13:17.824953Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T13:13:17.824953Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.16391"},"observation_digest":"sha256:4cff4bcc4e59e4d1ddf7b9d526ec89d1f0e13900321ebbd59bf5846d83e090a7","observation_id":"d0e46e76-711b-4f72-ad47-c0db79709e49","resolution":{"observed_at":"2026-08-12T13:13:17.824953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16391","last_updated":"2024-12-07T16:12:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T13:07:48.421267Z","submitted_at":"2024-11-25T13:53:36Z","title":"Human-Calibrated Automated Testing and Validation of Generative Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2411.16391."}