{"as_of":"2026-08-08T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d89a6a93611ce2fc4bf58800f2baf60402bb930a1596ea8b35e0defa51e38925","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:35:42.932998Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:59:00.294806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T13:35:26.411399Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09670","snapshot_observed_at":"2026-08-03T20:59:00.294806Z","title":"The science of evaluating foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17826","last_updated":"2026-05-29T02:47:21Z","snapshot_observed_at":"2026-08-07T23:47:18.366376Z","submitted_at":"2025-11-21T22:40:00Z","title":"Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T20:59:00.294806Z"},"links":{"cited_paper":"/paper/2502.09670","citing_paper":"/paper/2511.17826"},"observation_digest":"sha256:79c60c4568334fa912d3781bb674ea101d9135599ddfaca9a79163db1da0696a","observation_id":"2fabdbc0-8037-4596-bd31-d827de9ce9cf","resolution":{"observed_at":"2026-08-03T20:59:00.294806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"cited_work":{"arxiv_id":"2502.09670","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09670","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and mitigating numerical sources of nondeterminism in llm inference","venue":null,"work_id":"5c64ec67-2c63-468f-ad51-72f8eea05879","year":null},"citing_paper":{"arxiv_id":"2604.13413","last_updated":"2026-04-15T02:31:31Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:31:31Z","title":"Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T13:31:46.940449Z"},"links":{"cited_paper":"/paper/2502.09670","citing_paper":"/paper/2604.13413"},"observation_digest":"sha256:ae312337506ae901ae2bfe24c47510c2158714f06981c00f396eece00e9d0439","observation_id":"df984a59-0850-4fc8-88b0-ca88a2f458de","resolution":{"observed_at":"2026-05-10T13:35:26.412843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09670","snapshot_observed_at":"2026-07-12T20:50:53.567415Z","title":"Understanding and mitigating numerical sources of nondeterminism in llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13416","last_updated":"2026-07-06T05:33:02Z","snapshot_observed_at":"2026-08-02T11:35:00.658422Z","submitted_at":"2026-04-15T02:33:44Z","title":"DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T20:50:53.567415Z"},"links":{"cited_paper":"/paper/2502.09670","citing_paper":"/paper/2604.13416"},"observation_digest":"sha256:d201efadd718c1e1e24a577c686dbb5ba7149b937a4c1092846ef096e7978944","observation_id":"817c9b0d-9628-423d-9255-866ac54a79ff","resolution":{"observed_at":"2026-07-12T20:50:53.567415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09670/citation-record","integrity":"/paper/2502.09670/integrity","json":"/paper/2502.09670/citation-record.json","paper":"/paper/2502.09670"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T23:35:42.614892Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.614892Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:57c7456c76eeac5d762b2fc84070f5d2ff4ab098d9c331d56e6cd789fe9196ed","observation_id":"42c9f172-4f43-45bb-a54b-f79576fea6e9","resolution":{"observed_at":"2026-08-07T23:35:42.614892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.619032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.619032Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b9126dd5ddcff9c94bf2d335aaf5956ad8f12cf52a10e32caf671c162a4b0738","observation_id":"7a60ccf5-011b-40cb-a6bf-a6017ed74b60","resolution":{"observed_at":"2026-08-07T23:35:42.619032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09024","snapshot_observed_at":"2026-08-07T23:35:42.621868Z","title":"Zico Kolter, Matt Fredrikson, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.621868Z"},"links":{"cited_paper":"/paper/2410.09024","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9a04f189b07d666bd4afc01056670c0bd469faebd6ef5459bdd8b2bb6a434433","observation_id":"6f7afbaa-a360-4dd2-ad22-312df632e1e6","resolution":{"observed_at":"2026-08-07T23:35:42.621868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T23:35:42.625010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.625010Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d8131799df6439aa9f95d327931a3c94ae4358761fb13ea5da06e8e2ddcc0477","observation_id":"8f75078f-c123-401a-a525-63783e7c7e83","resolution":{"observed_at":"2026-08-07T23:35:42.625010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-07T23:35:42.628193Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.628193Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0c57142dbd3eb5b664a6b8f6df7af09e61b99dfb4b5730393a3b04b499a5c331","observation_id":"1e7b9739-cbf3-4c4b-9f8b-764e250d0aae","resolution":{"observed_at":"2026-08-07T23:35:42.628193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.631123Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.631123Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0fb63c753da2048f9a23b822c6b3697217a6194245f949e6bb5c2d9084090eea","observation_id":"54d987c0-95d4-4044-9d51-e53b33a6e710","resolution":{"observed_at":"2026-08-07T23:35:42.631123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.634066Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.634066Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:1dcff158f7d6f5b4db604cb025c6596f136e014f0783e38880d96bd0aa990780","observation_id":"41511bae-4253-4804-b53a-48a73a38451c","resolution":{"observed_at":"2026-08-07T23:35:42.634066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.05326","last_updated":"2015-08-21T16:17:01Z","snapshot_observed_at":"2026-08-05T22:08:24.004344Z","submitted_at":"2015-08-21T16:17:01Z","title":"A large annotated corpus for learning natural language inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.05326","snapshot_observed_at":"2026-08-07T23:35:42.637213Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.637213Z"},"links":{"cited_paper":"/paper/1508.05326","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:86cf42641970150a34341969f67c027ad1000ce88c589b0a1c9f5b81c9cb3f7d","observation_id":"b85ccb95-4a73-48d2-b1e6-a9281c26e127","resolution":{"observed_at":"2026-08-07T23:35:42.637213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.640482Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.640482Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:fe6172572dc5fae984b4bcd2da079bfc0ea3ebd891a8558b08dbc87dad8a5f9c","observation_id":"5967fedb-279c-4f5d-b6e8-245121c56191","resolution":{"observed_at":"2026-08-07T23:35:42.640482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.643255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.643255Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:03e6421089aee3c4751f6ff48459882f90ad6ccf5ec8d7e228d9be84e84c4452","observation_id":"b9a4d036-ebc9-4ecd-9edd-e3393beb80e4","resolution":{"observed_at":"2026-08-07T23:35:42.643255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08678","last_updated":"2023-07-17T17:41:47Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:41:47Z","title":"Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08678","snapshot_observed_at":"2026-08-07T23:35:42.646158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.646158Z"},"links":{"cited_paper":"/paper/2307.08678","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f7279aba95c19ea4e4e5d99e252786ae181841d7d17313b08b5b072ff69590f1","observation_id":"29df79b0-d079-4839-bd57-ba240b292bfa","resolution":{"observed_at":"2026-08-07T23:35:42.646158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T23:35:42.649410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.649410Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:cfdba691415674937dbd75594611d97173fb1a736472cd00888dd0cf467c1748","observation_id":"7e87e0c8-0110-4424-b767-beb1980c8365","resolution":{"observed_at":"2026-08-07T23:35:42.649410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02657","last_updated":"2021-05-07T15:58:45Z","snapshot_observed_at":"2026-07-06T11:06:51.715697Z","submitted_at":"2021-05-06T13:35:03Z","title":"Improving the Faithfulness of Attention-based Explanations with Task-specific Information for Text Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.02657","snapshot_observed_at":"2026-08-07T23:35:42.652396Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.652396Z"},"links":{"cited_paper":"/paper/2105.02657","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:32d5dbf8d5a6b881370f78cd0d9518ee7b2d4cc67abd689f593617e1c0ed973d","observation_id":"8ab6763d-8366-497c-8cf7-6fd8c8c54b69","resolution":{"observed_at":"2026-08-07T23:35:42.652396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.655458Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.655458Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:691bda582e6de285a40ee01cbe15b2e9f2e4941c44835796acdf488e960b1a51","observation_id":"fe5d6907-4908-4224-bf26-be7280651b14","resolution":{"observed_at":"2026-08-07T23:35:42.655458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09670","last_updated":"2021-10-31T20:03:39Z","snapshot_observed_at":"2026-07-06T10:05:50.314212Z","submitted_at":"2020-10-19T17:06:18Z","title":"RobustBench: a standardized adversarial robustness benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09670","snapshot_observed_at":"2026-08-07T23:35:42.658408Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.658408Z"},"links":{"cited_paper":"/paper/2010.09670","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:66440bdd0622309fe8b24bdb2e3d5125e4ead3e0f7809dec63fa9e25e47fc6c4","observation_id":"1596f007-4aa1-4066-9a88-8c96bc8e9316","resolution":{"observed_at":"2026-08-07T23:35:42.658408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05778","last_updated":"2024-01-11T09:29:56Z","snapshot_observed_at":"2026-08-05T00:16:01.594011Z","submitted_at":"2024-01-11T09:29:56Z","title":"Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05778","snapshot_observed_at":"2026-08-07T23:35:42.661836Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.661836Z"},"links":{"cited_paper":"/paper/2401.05778","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:961ed1bbaf459cfac453141118ea2836172edcdec9cb1c08757aa71a9e02bc17","observation_id":"80be2df7-f961-48de-a6bf-b87100cf0ffb","resolution":{"observed_at":"2026-08-07T23:35:42.661836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.664945Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.664945Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a80d00f06c457cdb825e8ad0b6544e8534436e2952f6ae27f59bc576d2e5699d","observation_id":"3537a145-0e41-4fe3-80e4-182d8abd2937","resolution":{"observed_at":"2026-08-07T23:35:42.664945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03429","last_updated":"2020-04-24T17:25:40Z","snapshot_observed_at":"2026-08-08T21:47:19.189690Z","submitted_at":"2019-11-08T18:29:03Z","title":"ERASER: A Benchmark to Evaluate Rationalized NLP Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03429","snapshot_observed_at":"2026-08-07T23:35:42.667856Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.667856Z"},"links":{"cited_paper":"/paper/1911.03429","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a22d31be6718dc6aeea22a48ed48c7bfb010a55b9137387c0b2f06118279da5e","observation_id":"45b93dc5-4227-475a-9f92-ee852864aeb3","resolution":{"observed_at":"2026-08-07T23:35:42.667856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.671333Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.671333Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:03e3b4fca6be2691a346003987b1c060052b39f5bad34c8b8d1d8d3fb156217f","observation_id":"e5204879-ae56-4307-a2e4-b57e582ad2d3","resolution":{"observed_at":"2026-08-07T23:35:42.671333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.674183Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.674183Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9e4d9fe9e4bc3cf6200c36d4ad42fe001a4fe0f4e4dcf783abed87b96600cd5d","observation_id":"5a6fbcf9-4b9d-4bf2-856e-f4cb37c65970","resolution":{"observed_at":"2026-08-07T23:35:42.674183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.677278Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.677278Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b39ea01afa1e8b2ad5efcb8f72a721b9498832e38f30876b08102d832ac46c29","observation_id":"706442f5-54ec-4af2-82af-ac355f421310","resolution":{"observed_at":"2026-08-07T23:35:42.677278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.08362","last_updated":"2019-09-10T04:12:17Z","snapshot_observed_at":"2026-07-06T06:51:38.176531Z","submitted_at":"2018-07-22T20:37:45Z","title":"An Intersectional Definition of Fairness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.08362","snapshot_observed_at":"2026-08-07T23:35:42.680314Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.680314Z"},"links":{"cited_paper":"/paper/1807.08362","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e6744aafb07f6e2c0fdf00783ba728b3e11ec32b70dc248b99ecdc92cc78bdf6","observation_id":"b512d5ff-cb96-4239-a582-af833ebb7998","resolution":{"observed_at":"2026-08-07T23:35:42.680314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08500","last_updated":"2017-06-01T14:10:34Z","snapshot_observed_at":"2026-07-06T05:43:59.308291Z","submitted_at":"2017-05-23T19:43:56Z","title":"Selective Classification for Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08500","snapshot_observed_at":"2026-08-07T23:35:42.683229Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.683229Z"},"links":{"cited_paper":"/paper/1705.08500","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c3c80c775e5e5185ad4b03246ae558d557e8ec2ce3ae04826b96089319d9fa31","observation_id":"f66b685a-41b0-454b-b26f-954ce8367b2e","resolution":{"observed_at":"2026-08-07T23:35:42.683229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.686588Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.686588Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c01a617228f019d5c84bd7d99ab15bccb102510f1f7c91962a7bebca66029a1c","observation_id":"90609972-6f82-472e-8db8-3423a1fe6404","resolution":{"observed_at":"2026-08-07T23:35:42.686588Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-07T08:05:23.979918Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-08-07T23:35:42.689465Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.689465Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4be5b7e38b951d667b36b7046ecc96b6f87415753fbe2f702958fbe72534e97b","observation_id":"57fca449-93b7-4e35-9ca3-947cb0e00a98","resolution":{"observed_at":"2026-08-07T23:35:42.689465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-06T19:10:15.466826Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-07T23:35:42.692496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.692496Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:60d3fbe93786fe2250a5c6220c1e48a733cbad7a37ea402d37f72387de51d58d","observation_id":"ed300267-aa21-4039-8308-acb5efe10507","resolution":{"observed_at":"2026-08-07T23:35:42.692496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T23:35:42.695574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.695574Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:668774763e10a26a35407e4c29ad0d4fb10cf0d68d526b52bd5b4c2128475016","observation_id":"c49507bc-c841-4861-a8c9-d433c0f1f365","resolution":{"observed_at":"2026-08-07T23:35:42.695574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05904","last_updated":"2024-04-17T07:03:17Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T23:16:22Z","title":"The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05904","snapshot_observed_at":"2026-08-07T23:35:42.698050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.698050Z"},"links":{"cited_paper":"/paper/2404.05904","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:dd308ecdf251826a6c0b2917f3515075b107dcadb442b62b16864f6d0142d8e8","observation_id":"9ae3ded5-0dbb-4794-accb-8e714e4015cf","resolution":{"observed_at":"2026-08-07T23:35:42.698050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.700573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.700573Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a934a7f4d00d3b19a3f592f837b7971230c6f41fa5e0f48be19ae98f340819fc","observation_id":"12b41117-de41-4783-9142-bb499db5a010","resolution":{"observed_at":"2026-08-07T23:35:42.700573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.702763Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.702763Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:777c1db997c00dc07b688ed7b54e93ff28de0c459245f01b70869ac2072c06f3","observation_id":"0a328410-f232-4698-99d7-280aaf548897","resolution":{"observed_at":"2026-08-07T23:35:42.702763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T23:35:42.704954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.704954Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e4db00819007331a9648eb4a7080e12d707586c6d630cb0d1a7f4a2275cc077b","observation_id":"8f579ee1-1005-4ee9-8589-065189ae3929","resolution":{"observed_at":"2026-08-07T23:35:42.704954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11932","last_updated":"2020-04-08T23:10:10Z","snapshot_observed_at":"2026-07-06T08:10:40.079646Z","submitted_at":"2019-07-27T15:07:04Z","title":"Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11932","snapshot_observed_at":"2026-08-07T23:35:42.707286Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.707286Z"},"links":{"cited_paper":"/paper/1907.11932","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a543cac947f6a3b69efef3dab87c3d7b722fa22ead4077202928feb8494e991f","observation_id":"d995213e-6350-442b-842a-42a32a09be59","resolution":{"observed_at":"2026-08-07T23:35:42.707286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.709720Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.709720Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:667f728ad927bc0a64e06336c3080fe40464b8a570816e8dfd85d6f07efda320","observation_id":"53901a15-baae-434b-a914-f309e49e8e35","resolution":{"observed_at":"2026-08-07T23:35:42.709720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.715639Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.715639Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0643298dd7025f5cd5a03e1a0ecc5e0fb546c045a1c8b18425d93c6fa95680c1","observation_id":"972216ea-dae4-4d33-b25f-1cb12a26cb26","resolution":{"observed_at":"2026-08-07T23:35:42.715639Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07421","last_updated":"2021-07-16T17:58:22Z","snapshot_observed_at":"2026-07-06T10:24:09.094124Z","submitted_at":"2020-12-14T11:14:56Z","title":"WILDS: A Benchmark of in-the-Wild Distribution Shifts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07421","snapshot_observed_at":"2026-08-07T23:35:42.718445Z","title":"Earnshaw, Imran S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.718445Z"},"links":{"cited_paper":"/paper/2012.07421","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:ec356eecb906f48c61bcec328766967421c69108e054999549929348e10e6251","observation_id":"552ef713-bd7d-483a-9c03-a35e71a76be5","resolution":{"observed_at":"2026-08-07T23:35:42.718445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.721987Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.721987Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:fcf0f810e42765e0833d07ca03dfd034cc88d9ea43571572b14c81be59e4971d","observation_id":"cad99ac7-c79a-42bf-90e9-c92e65216222","resolution":{"observed_at":"2026-08-07T23:35:42.721987Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.724900Z","title":"Dai, Jakob Uszkor- eit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.724900Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:720614b2e31da9b8b9d81648e396a9c48547a6460540740be182defd232a612d","observation_id":"a59ec1e8-3887-4873-9d5f-81906eb6e7b0","resolution":{"observed_at":"2026-08-07T23:35:42.724900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T23:35:42.727917Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.727917Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e6e815b74b3f3e7349b5932f28a8d8e3cc08c6b28f903947f4f62dfadf3a15dc","observation_id":"075f5f71-150d-420a-a730-4a4277b33180","resolution":{"observed_at":"2026-08-07T23:35:42.727917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.731195Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.731195Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:148397d0b1b7075372a27f86e69c28bb87db8aeed234805adffc4366af7da5ec","observation_id":"a619e8b3-ff6f-4ee2-8d17-20b15e5522da","resolution":{"observed_at":"2026-08-07T23:35:42.731195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09746","last_updated":"2024-01-05T22:09:26Z","snapshot_observed_at":"2026-08-07T21:08:26.315017Z","submitted_at":"2022-12-19T18:59:45Z","title":"Evaluating Human-Language Model Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09746","snapshot_observed_at":"2026-08-07T23:35:42.734153Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.734153Z"},"links":{"cited_paper":"/paper/2212.09746","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0cd4d198c492c8c1d94c8cd608ea348f2d47295878b1ce03c37666ec3246fac6","observation_id":"65441e79-c127-4d2f-b3c1-c41653c992cc","resolution":{"observed_at":"2026-08-07T23:35:42.734153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13788","last_updated":"2023-10-27T11:25:00Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:55:34Z","title":"Can Large Language Models Capture Dissenting Human Voices?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13788","snapshot_observed_at":"2026-08-07T23:35:42.737130Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.737130Z"},"links":{"cited_paper":"/paper/2305.13788","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f8a408ab256b3b68c0c3547300762d8ba08dc19e4708f80163c7cb32f9be573e","observation_id":"6be26943-f8c2-421c-884b-dba5cd61f4c9","resolution":{"observed_at":"2026-08-07T23:35:42.737130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11747","last_updated":"2023-10-23T01:49:32Z","snapshot_observed_at":"2026-08-07T22:56:15.588770Z","submitted_at":"2023-05-19T15:36:27Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11747","snapshot_observed_at":"2026-08-07T23:35:42.740185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.740185Z"},"links":{"cited_paper":"/paper/2305.11747","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0fb5357067e86716768bbb33bb8283b50405a21e56115fde92a55c1a6e4e28b3","observation_id":"90b11f8a-52fb-4b25-9266-8b7ae0f47d75","resolution":{"observed_at":"2026-08-07T23:35:42.740185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.743247Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.743247Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:76ecdceb4987e7758ef4346c40b75be93e2a3565deeb2182c663907c0b487788","observation_id":"2a33283f-1f8c-4b73-8fa4-c8bc1bec5053","resolution":{"observed_at":"2026-08-07T23:35:42.743247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T23:35:42.752311Z","title":"Manning, Christo- pher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.752311Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4f6d44eedbd2be03ef07da05b17b461db1271f92a6a778a0d906260cf02584d5","observation_id":"88eb5930-81a1-40fd-bdd6-eebf5bcb7c84","resolution":{"observed_at":"2026-08-07T23:35:42.752311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06509","last_updated":"2024-03-05T12:07:04Z","snapshot_observed_at":"2026-07-06T17:14:45.068795Z","submitted_at":"2024-01-12T11:18:00Z","title":"AntEval: Evaluation of Social Interaction Competencies in LLM-Driven Agents","version":3},"cited_work":{"arxiv_id":"2401.06509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06509","snapshot_observed_at":"2026-08-07T23:35:43.382397Z","title":"AntEval: Evaluation of Social Interaction Competencies in LLM-Driven Agents","venue":"cs.CL","work_id":"6ccdbfa8-a569-49da-8b5d-d6840605834a","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.755226Z"},"links":{"cited_paper":"/paper/2401.06509","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:820719aef79c7358db15f15e79094ae3c7a7f09f783f2b798e68f7ee4773f37c","observation_id":"f4539750-84aa-460b-904f-863ae408ad74","resolution":{"observed_at":"2026-08-07T23:35:43.385959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.758625Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.758625Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a425c80181986c8fee2adb976596e72cdf8b1a73571d1d06030f5d66b89554af","observation_id":"f9d79ee3-df9a-4330-8066-1f8c920c6163","resolution":{"observed_at":"2026-08-07T23:35:42.758625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13809","last_updated":"2024-06-05T07:40:54Z","snapshot_observed_at":"2026-08-04T06:11:31.626301Z","submitted_at":"2023-03-24T05:05:03Z","title":"Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13809","snapshot_observed_at":"2026-08-07T23:35:42.761353Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.761353Z"},"links":{"cited_paper":"/paper/2303.13809","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:848157adaf62f5dd7704e75fc86984d055218826d7748966986c8ec59daa4fb0","observation_id":"6338a6ff-677a-4838-86d6-58c4a007de11","resolution":{"observed_at":"2026-08-07T23:35:42.761353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.764319Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.764319Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:6a12071f721c6b6ce5b1ff8b97aee7d8d748c6b2e609b2b8ee128505de41cf91","observation_id":"358695cd-1638-4b11-81ea-3e5ca8383f1b","resolution":{"observed_at":"2026-08-07T23:35:42.764319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09090","last_updated":"2024-10-07T16:01:06Z","snapshot_observed_at":"2026-07-06T16:48:01.451153Z","submitted_at":"2023-11-15T16:35:59Z","title":"Social Bias Probing: Fairness Benchmarking for Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09090","snapshot_observed_at":"2026-08-07T23:35:42.767138Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.767138Z"},"links":{"cited_paper":"/paper/2311.09090","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a40d12e493bc06c7963e48e7a14dcdda46d29600bd012a4ef8984dd5b299a1c4","observation_id":"3620ce70-def8-4509-b833-ea60b5484b25","resolution":{"observed_at":"2026-08-07T23:35:42.767138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.770006Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.770006Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:288d87bebdd44a7ac92ed4ab1cbce6a0f335d1753f1ee9888ab2e3ee9034da4b","observation_id":"9ad605d3-0278-4cc8-9617-9aee498174d5","resolution":{"observed_at":"2026-08-07T23:35:42.770006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09456","last_updated":"2020-04-20T17:14:33Z","snapshot_observed_at":"2026-07-06T09:13:46.854094Z","submitted_at":"2020-04-20T17:14:33Z","title":"StereoSet: Measuring stereotypical bias in pretrained language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09456","snapshot_observed_at":"2026-08-07T23:35:42.774783Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.774783Z"},"links":{"cited_paper":"/paper/2004.09456","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:5616a2a6ba8a2c33b97922d28e331711c30a51e7d27e627e9d35de228c72d22c","observation_id":"c116ac70-da36-4744-993d-1caae578a27c","resolution":{"observed_at":"2026-08-07T23:35:42.774783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.777377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.777377Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b32785f2e4082430f2d28f45ca7da84e0174166268338993409438d91059f0b5","observation_id":"e110ec71-f37a-4eee-bcae-08209c44724d","resolution":{"observed_at":"2026-08-07T23:35:42.777377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T23:35:42.772371Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.772371Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f0a41110bc0b68f3cfa3fd26ee19bb81cd31e5d96a5521a0710e3f6d1bd888f5","observation_id":"d9a87917-5e9f-4fd5-9f10-1e37eab5d1a8","resolution":{"observed_at":"2026-08-07T23:35:42.772371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.787601Z","title":"Cohen, and Mirella Lapata","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.787601Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0e0ed7d679c196a55a3741a20cf9fc84362116db637f9e78aaec4979b9734d24","observation_id":"b030956a-0cfb-4015-96ce-8a20373fa5e8","resolution":{"observed_at":"2026-08-07T23:35:42.787601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.790559Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.790559Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:32802437aac5c27a7b974350d4e5e6b153ec2036e376f7d4dd0cd103a35a956e","observation_id":"1f715672-1eff-412e-8e4c-c29850f55252","resolution":{"observed_at":"2026-08-07T23:35:42.790559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06023","last_updated":"2016-08-26T16:13:13Z","snapshot_observed_at":"2026-07-30T19:30:50.474373Z","submitted_at":"2016-02-19T02:04:18Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.06023","snapshot_observed_at":"2026-08-07T23:35:42.779786Z","title":"arXiv preprint arXiv:1602.06023 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.779786Z"},"links":{"cited_paper":"/paper/1602.06023","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:72c7abeda9a8ef2d769d8061e01c2c173a12178e5f55f6396531cbe9068a34b4","observation_id":"fe1fa383-b0af-4bd7-befa-bbc665696e72","resolution":{"observed_at":"2026-08-07T23:35:42.779786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.782282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.782282Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:58f8b2889488c1f9e101436c47d3959fd392f33928d440e3bc333ef7ad832561","observation_id":"81653e57-c00c-4a4a-9b16-663d87670804","resolution":{"observed_at":"2026-08-07T23:35:42.782282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.802455Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.802455Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f653bdaf78f70601c2c5a002b605d71722fcf8c54b735465636275b4e20fa91f","observation_id":"90319e29-dc75-449c-87b7-3c6aa7c23604","resolution":{"observed_at":"2026-08-07T23:35:42.802455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06476","last_updated":"2023-11-19T15:43:58Z","snapshot_observed_at":"2026-08-06T16:59:58.620330Z","submitted_at":"2023-02-08T09:44:51Z","title":"Is ChatGPT a General-Purpose Natural Language Processing Task Solver?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06476","snapshot_observed_at":"2026-08-07T23:35:42.805153Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.805153Z"},"links":{"cited_paper":"/paper/2302.06476","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e77bae0b932dc7301c8e47cbdea5eef1121a150572cb5a25e3ad5725a3294591","observation_id":"98b069ff-6c98-47d4-8c32-b0b209f1ef16","resolution":{"observed_at":"2026-08-07T23:35:42.805153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.808366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.808366Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f950f79977234f14076d1d2502e0d02e0be13e386a27a11d4194ff213e5689b1","observation_id":"bb7c04e8-9804-4129-8c8b-a96455d5984a","resolution":{"observed_at":"2026-08-07T23:35:42.808366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.793354Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.793354Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:6320b3a565b2d9b1a3e222d53aeafb2225ded3d6ee747c2d7931278c6c086626","observation_id":"2d65a7e5-c86c-47ff-9d8a-40cf58e7980a","resolution":{"observed_at":"2026-08-07T23:35:42.793354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11768","last_updated":"2023-07-25T04:01:43Z","snapshot_observed_at":"2026-07-06T15:57:04.900537Z","submitted_at":"2023-07-17T00:54:10Z","title":"Question Decomposition Improves the Faithfulness of Model-Generated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11768","snapshot_observed_at":"2026-08-07T23:35:42.817579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.817579Z"},"links":{"cited_paper":"/paper/2307.11768","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:80fd7c21c4c1a3aecbd271ed1ad5e42070f04fa7b25a16139aef5f06d17602b6","observation_id":"23278487-8ae8-4dd8-b04e-786112a023a7","resolution":{"observed_at":"2026-08-07T23:35:42.817579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00936","last_updated":"2024-06-03T02:20:03Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T02:20:03Z","title":"A Survey of Useful LLM Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00936","snapshot_observed_at":"2026-08-07T23:35:42.799324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.799324Z"},"links":{"cited_paper":"/paper/2406.00936","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0ee8763b3b7e4ed552bf2af591ba1974729841cf6b2c69aab3167184a53f6531","observation_id":"b750a0c5-1e45-4cf6-bb69-966979345786","resolution":{"observed_at":"2026-08-07T23:35:42.799324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.823750Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.823750Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:64e910a4b7bf4b1c1e8c7470b96f109e4950576598127b5ec72f8acd8dd54ed8","observation_id":"2c0b10e6-86cd-480f-9519-3439a79e9530","resolution":{"observed_at":"2026-08-07T23:35:42.823750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.829679Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.829679Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:19de2f16be0da62520699d818230651b9579e6ae20ba18e2ef5edb84a79ef2c0","observation_id":"a1f5741e-f9c0-45b3-a459-22c647d2a224","resolution":{"observed_at":"2026-08-07T23:35:42.829679Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.832607Z","title":"Rush, Sumit Chopra, and Jason Weston","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.832607Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:8627ba9f33eb838244c5bf3b913e7cf77778e3eb42b08fd90180309de1666766","observation_id":"dec6e7cb-b5c9-48f1-8070-dfe70d40a234","resolution":{"observed_at":"2026-08-07T23:35:42.832607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0306050","last_updated":"2003-06-12T12:35:00Z","snapshot_observed_at":"2026-08-01T18:48:46.592760Z","submitted_at":"2003-06-12T12:35:00Z","title":"Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0306050","snapshot_observed_at":"2026-08-07T23:35:42.835466Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.835466Z"},"links":{"cited_paper":"/paper/cs/0306050","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:3ce09de5e7eacdf2ede27df219bcb5b3bcf19c0b019355f2f0c412be31a73fbd","observation_id":"13445a94-7ada-472e-be00-90bbbe398e95","resolution":{"observed_at":"2026-08-07T23:35:42.835466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09962","last_updated":"2024-10-15T16:10:26Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T18:59:58Z","title":"LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09962","snapshot_observed_at":"2026-08-07T23:35:42.814464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.814464Z"},"links":{"cited_paper":"/paper/2410.09962","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f452bbf482322b0e3a239c2c3d3e92f8d39f67d1f5eacf0c910fad3ccd70a90c","observation_id":"01e16b8e-c3f9-4db7-b028-afd108b7d7fe","resolution":{"observed_at":"2026-08-07T23:35:42.814464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13948","last_updated":"2022-07-28T08:28:09Z","snapshot_observed_at":"2026-07-06T13:36:14.246767Z","submitted_at":"2022-07-28T08:28:09Z","title":"An Interpretability Evaluation Benchmark for Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":"2207.13948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.13948","snapshot_observed_at":"2026-08-07T23:35:43.255695Z","title":"An Interpretability Evaluation Benchmark for Pre-trained Language Models","venue":"cs.CL","work_id":"c51bea4b-d53b-4b6e-99da-9d96796ccefc","year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.841478Z"},"links":{"cited_paper":"/paper/2207.13948","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:3a5e9fd67611dd9aa2998ba895f6f15cee9809de0e07104b26352bbe92989344","observation_id":"5f764ef2-c647-432d-b8c1-e4e3a3f9e7d0","resolution":{"observed_at":"2026-08-07T23:35:43.259889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-07T23:35:42.820557Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.820557Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d6c00660a9a94eee5986be89801ab7ab44b78ce026ab4d640a43d9a1010ad2af","observation_id":"5e1c44a6-b37c-4e66-a242-719aa6949594","resolution":{"observed_at":"2026-08-07T23:35:42.820557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.847446Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.847446Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:cb0445c417b7288a94604cfb3c0dcec55c7fa04b44585b75ce8a7f487f086fc5","observation_id":"781e5b33-a901-4679-8be3-d59c8d9d1e48","resolution":{"observed_at":"2026-08-07T23:35:42.847446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.826508Z","title":"In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing , Jian Su, Kevin Duh, and Xavier Car- reras (Eds.)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.826508Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:13db2b1b2a6064494fbcad318b1d5be119ab6d725ab9751a473a1971a2b71ed2","observation_id":"4bd856cc-13c9-4883-9f6b-0f6a181f49bb","resolution":{"observed_at":"2026-08-07T23:35:42.826508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.852413Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.852413Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d2591590406bb9ea3ff33685a8dd7bd1bedc83b8a49390c095f2413de4411a98","observation_id":"3a20dc31-a722-4aef-8497-83847d01c642","resolution":{"observed_at":"2026-08-07T23:35:42.852413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.854802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.854802Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:6217df8f6446adb8dadba722d998bc37e84712b360cd92ee74c27c78246d6d72","observation_id":"70765af2-18bd-473d-ab69-26c73a29e4ad","resolution":{"observed_at":"2026-08-07T23:35:42.854802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T23:35:42.856940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.856940Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:3b3b94b3eefabfd0c220770b4b4f16e05de2aed9547ac64781c80812840b3706","observation_id":"d7c248df-e0b5-46e8-a888-d41c432aec1b","resolution":{"observed_at":"2026-08-07T23:35:42.856940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12872","last_updated":"2024-07-15T12:15:08Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-15T12:15:08Z","title":"Evaluating Large Language Models with fmeval","version":1},"cited_work":{"arxiv_id":"2407.12872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12872","snapshot_observed_at":"2026-08-07T23:35:43.268689Z","title":"Evaluating Large Language Models with fmeval","venue":"cs.CL","work_id":"cfabd0bb-44a7-4e5c-83ca-b25613ddac37","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.838370Z"},"links":{"cited_paper":"/paper/2407.12872","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:44c9fe7e75554c4a7fff20c0eb4e93fb47e09b02e5c183189a47afd1131fa5c0","observation_id":"eb1aeec2-bb7d-4074-a21e-c13535ff7ecc","resolution":{"observed_at":"2026-08-07T23:35:43.272176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T23:35:42.863898Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.863898Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e482c4d0ff0b5809b511265ef8a187e0281bdd7551ab283ed1f2e0602c7911dd","observation_id":"e5469b24-71e6-4831-9b20-84825d9d63c7","resolution":{"observed_at":"2026-08-07T23:35:42.863898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.844395Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.844395Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c3ad0f0b2f96199d0dd870b87d42141e3fca7a42e271675525686d8138cd7b3a","observation_id":"6bd40893-61f8-4de3-ae64-01645250aaba","resolution":{"observed_at":"2026-08-07T23:35:42.844395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11698","last_updated":"2024-02-26T20:41:01Z","snapshot_observed_at":"2026-08-07T02:34:39.980213Z","submitted_at":"2023-06-20T17:24:23Z","title":"DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11698","snapshot_observed_at":"2026-08-07T23:35:42.869827Z","title":"Truong, Simran Arora, Mantas Mazeika, Dan Hendrycks, Zinan Lin, Yu Cheng, Sanmi Koyejo, Dawn Song, and Bo Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.869827Z"},"links":{"cited_paper":"/paper/2306.11698","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d399793517691aad6b391c0877be5d0df2b40748a24ba42f1102896b2bd9af3c","observation_id":"0955883b-c37d-4f8a-a42f-19e68cc01e40","resolution":{"observed_at":"2026-08-07T23:35:42.869827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13338","last_updated":"2024-08-23T19:12:45Z","snapshot_observed_at":"2026-07-06T19:05:18.260091Z","submitted_at":"2024-08-23T19:12:45Z","title":"LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models","version":1},"cited_work":{"arxiv_id":"2408.13338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13338","snapshot_observed_at":"2026-08-07T23:35:43.241106Z","title":"LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models","venue":"cs.HC","work_id":"1233b1e4-0bf5-48a7-9df6-6917ae5c37b3","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.849901Z"},"links":{"cited_paper":"/paper/2408.13338","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:16f37195199346b2c08af79010c602d6303893740db2ecaa4126b06aebae0560","observation_id":"9dab2ad0-c7f6-4b39-8ac3-479ce16c67f5","resolution":{"observed_at":"2026-08-07T23:35:43.246503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-07T23:35:42.876049Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.876049Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d37eb2f6d683775482af05fc42a574e3a22ef2919688c3ac1e3420c7f52bd8ce","observation_id":"3e92f87e-2686-455f-83f1-4bca005cd247","resolution":{"observed_at":"2026-08-07T23:35:42.876049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02210","last_updated":"2023-10-24T14:00:21Z","snapshot_observed_at":"2026-07-06T15:12:22.395669Z","submitted_at":"2023-04-05T03:49:06Z","title":"Document-Level Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02210","snapshot_observed_at":"2026-08-07T23:35:42.879026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.879026Z"},"links":{"cited_paper":"/paper/2304.02210","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f9ba647913f07ae942c347df0470092c9340374a40275af8d57d05fe978b58ec","observation_id":"b31ecd82-ff6f-4bce-8643-30eec429bcf5","resolution":{"observed_at":"2026-08-07T23:35:42.879026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.882205Z","title":"Smith, and Teruko Mitamura","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.882205Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b9d8f1ce36dfa3f5cfa9b10df08bc2d54b31ccd16e9ed6d7e47e2a9702158e95","observation_id":"58fd2708-310c-406b-a025-44a2c6c04a52","resolution":{"observed_at":"2026-08-07T23:35:42.882205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.859441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.859441Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d10a39fc7ec079d8ffaf9e34bc92b1f8a30ddbb5715a7416aafedf0063fe21ae","observation_id":"5df30076-7d26-4ce6-8d0c-9d2f199cec50","resolution":{"observed_at":"2026-08-07T23:35:42.859441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.861678Z","title":"Advances in Neural Information Processing Systems 36 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.861678Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:96c6fa703d979bc79090c416c245cb454814dbb99c45b426d4c89b70d16da6da","observation_id":"6ce5459a-8839-4d48-9da7-b3cf16f2b55f","resolution":{"observed_at":"2026-08-07T23:35:42.861678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13704","last_updated":"2025-02-25T01:51:06Z","snapshot_observed_at":"2026-07-06T19:05:36.210400Z","submitted_at":"2024-08-25T02:01:38Z","title":"DHP Benchmark: Are LLMs Good NLG Evaluators?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13704","snapshot_observed_at":"2026-08-07T23:35:42.891112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.891112Z"},"links":{"cited_paper":"/paper/2408.13704","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:2a7e720fa791010c83a714d5eae16a9324f257fc993235567b5edaa848845ac6","observation_id":"ba2eda73-8fe5-4972-a8bd-8add8a617f16","resolution":{"observed_at":"2026-08-07T23:35:42.891112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.867035Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.867035Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a25b24570a7817bb817a7ee4350aca3d2598bf2414966993f80a12e2627a8fee","observation_id":"43dc27af-db77-471d-9052-f793109c05f7","resolution":{"observed_at":"2026-08-07T23:35:42.867035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05426","last_updated":"2018-02-19T19:19:51Z","snapshot_observed_at":"2026-08-08T22:26:58.590242Z","submitted_at":"2017-04-18T17:10:13Z","title":"A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05426","snapshot_observed_at":"2026-08-07T23:35:42.897234Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.897234Z"},"links":{"cited_paper":"/paper/1704.05426","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9e5e7d1c5dbadcb2100376fef33baab00d2263d678b107b34259bc3100aff8a5","observation_id":"6fd23ec5-6389-4d9a-92ee-cd3f27240be0","resolution":{"observed_at":"2026-08-07T23:35:42.897234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-07T23:35:42.872968Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.872968Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0a236d1d91ba79e58ab6cc0076178ad7e0e23e92b89f723cffa038892be42239","observation_id":"51a6cad7-7eab-4dbe-9466-5731b9e54fb6","resolution":{"observed_at":"2026-08-07T23:35:42.872968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.595506Z","title":null,"venue":null,"work_id":"3d831d4e-14c8-48ee-aaef-560235610463","year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.903121Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e4ecc7924f08c2ac19028c7b71e0a907ea346806d16ce93aea6e773585b11bdb","observation_id":"6b7b782d-e3d9-49aa-8842-b8816314797e","resolution":{"observed_at":"2026-08-07T23:35:43.598649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.586834Z","title":null,"venue":null,"work_id":"01e3c28d-93f8-43db-9a83-c4334207b0e2","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.909203Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4a2cabe345d3943cdefd5a0d8973e095c260d45068907746ab58da951b771060","observation_id":"10a31815-2774-45dd-9871-f3e508c4e89f","resolution":{"observed_at":"2026-08-07T23:35:43.589935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10019","last_updated":"2024-10-05T06:50:15Z","snapshot_observed_at":"2026-08-06T04:21:24.397587Z","submitted_at":"2024-01-18T14:40:46Z","title":"R-Judge: Benchmarking Safety Risk Awareness for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10019","snapshot_observed_at":"2026-08-07T23:35:42.912130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.912130Z"},"links":{"cited_paper":"/paper/2401.10019","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:04c012519ad1c7f462887284e537aa344e1ccc8e582c1a65f20c7ed55d04e14e","observation_id":"2639926f-7a1a-44a4-bd2a-1327389db7fa","resolution":{"observed_at":"2026-08-07T23:35:42.912130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.885080Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.885080Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:fe056b2b7097d5fc8a5b472258af249322b797294a9f644675659adf65a7304a","observation_id":"a40c18e0-4c67-4b32-bd52-1fb541fbcbcf","resolution":{"observed_at":"2026-08-07T23:35:42.885080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1304.6480","last_updated":"2013-04-24T04:08:23Z","snapshot_observed_at":"2026-07-06T03:11:51.813034Z","submitted_at":"2013-04-24T04:08:23Z","title":"A Theoretical Analysis of NDCG Type Ranking Measures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1304.6480","snapshot_observed_at":"2026-08-07T23:35:42.887915Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.887915Z"},"links":{"cited_paper":"/paper/1304.6480","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b1688c8a5cff4faf4a146899158a9c5ddfb1659fd7d0623d27aaecc147865b7e","observation_id":"ffce3c16-92b4-40d9-a5a9-e9114ee65dc5","resolution":{"observed_at":"2026-08-07T23:35:42.887915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.578058Z","title":null,"venue":null,"work_id":"41213ce9-8bb5-46b2-9247-330cba0634a7","year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.922646Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:10072d12fc24cc1ad557324390a75d5918529f50592d015ddc353edbfdb35fe9","observation_id":"8a072e5a-e6ea-4d15-8dcd-93e24a914f35","resolution":{"observed_at":"2026-08-07T23:35:43.581098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-07T23:35:42.894068Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.894068Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:2401fa9d31fb39c36645b04ebb1287ac68a645dff9e24b36610e1c2795fd77ad","observation_id":"9ea7a298-1b5d-4e66-81fa-4c2d9a97de88","resolution":{"observed_at":"2026-08-07T23:35:42.894068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-07T23:35:42.927960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.927960Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d4c052fa724ca47200b131a6997d80b42ba436f97f347dedbefd1f4f0696340e","observation_id":"defb6ea1-6aed-4bd9-b8e7-c2bba422d85b","resolution":{"observed_at":"2026-08-07T23:35:42.927960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.604019Z","title":null,"venue":null,"work_id":"9c859881-8695-41e0-863a-27bd0efcd057","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.900246Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b8b4033a1929df0d49d1aef986e77955a2fc809c62bf459f4405817a79e48ec9","observation_id":"3a059a11-00b6-45aa-9180-3e42089465e4","resolution":{"observed_at":"2026-08-07T23:35:43.606460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.06724","last_updated":"2015-06-22T19:26:56Z","snapshot_observed_at":"2026-08-06T16:37:38.107677Z","submitted_at":"2015-06-22T19:26:56Z","title":"Aligning Books and Movies: Towards Story-like Visual Explanations by Watching Movies and Reading Books","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.06724","snapshot_observed_at":"2026-08-07T23:35:42.932998Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.932998Z"},"links":{"cited_paper":"/paper/1506.06724","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a49a12b7a088a022cfcee59e51a6e74f915abcb476154411ed73e77e82aa9496","observation_id":"4c8835d8-bdec-40c5-981d-85d628bf4a3b","resolution":{"observed_at":"2026-08-07T23:35:42.932998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11805","last_updated":"2024-03-18T14:03:23Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:03:23Z","title":"LLM as a System Service on Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11805","snapshot_observed_at":"2026-08-07T23:35:42.905965Z","title":"arXiv preprint arXiv:2403.11805 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.905965Z"},"links":{"cited_paper":"/paper/2403.11805","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4912b3b208aa10d814953cde2d73f9a513fbe1dcba91b56debbc60f2bb8ad321","observation_id":"32c74742-06d8-4d11-b2cf-0bad6dd002e1","resolution":{"observed_at":"2026-08-07T23:35:42.905965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T21:35:35.619418Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 3 inbound Pith citation observations for arXiv:2502.09670."}