{"as_of":"2026-08-07T22:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e08b27fc9e462603b6e408e7bc02e98f4c3b11c7f2da52ba06fd6f2b7f8e04d","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:36:10.926833Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:59:53.097164Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:25:41.538596Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01793","snapshot_observed_at":"2026-08-07T11:59:53.097164Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-07T12:18:52.747304Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:53.097164Z"},"links":{"cited_paper":"/paper/2506.01793","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:27949d5b1cc0f8c4c98cb4f4f35111ada5b1e476d333d6d555355af626c70356","observation_id":"9e614170-5bc0-409a-a2c2-1da423bb0e56","resolution":{"observed_at":"2026-08-07T11:59:53.097164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01793","snapshot_observed_at":"2026-07-01T10:25:41.538596Z","title":"Human-centric evaluation for foundation models","venue":null,"work_id":"ffbc6bce-1643-490f-8ae0-46dad7d2e99d","year":2025},"citing_paper":{"arxiv_id":"2604.18038","last_updated":"2026-04-20T10:02:38Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T10:02:38Z","title":"First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T03:47:54.377400Z"},"links":{"cited_paper":"/paper/2506.01793","citing_paper":"/paper/2604.18038"},"observation_digest":"sha256:1828ab098a04277fbe15fd10765944e19d755c404c6de1133178b79a13fca05a","observation_id":"6a1415e8-4082-45cf-a4ea-ad53bda88d4d","resolution":{"observed_at":"2026-05-11T12:21:06.094847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01793","snapshot_observed_at":"2026-07-01T10:25:41.538596Z","title":"Human-centric evaluation for foundation models","venue":null,"work_id":"ffbc6bce-1643-490f-8ae0-46dad7d2e99d","year":2025},"citing_paper":{"arxiv_id":"2606.31608","last_updated":"2026-06-30T12:56:42Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:56:42Z","title":"CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-01T05:33:52.027771Z"},"links":{"cited_paper":"/paper/2506.01793","citing_paper":"/paper/2606.31608"},"observation_digest":"sha256:ae7c4820e0ecda1ccbda50af1845645c6dbe722814df1da79b73a64f5b199da1","observation_id":"548330fb-bdcc-40f8-b0eb-a81748eef3eb","resolution":{"observed_at":"2026-07-01T10:25:41.540358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01793/citation-record","integrity":"/paper/2506.01793/integrity","json":"/paper/2506.01793/citation-record.json","paper":"/paper/2506.01793"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-07T11:36:08.031077Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.031077Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:2367590f0a4faca5e728e2fc81843af45d2e993ccdc9edc9d5b4d2476ff2a6c5","observation_id":"0925fa6d-86b5-4107-91d1-39b216dd577b","resolution":{"observed_at":"2026-08-07T11:36:08.031077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.102859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.102859Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:85b8168ac1c8fa26fde5864f4abae99d746692ce0eb30679d7d18ed96c8d2e19","observation_id":"6a0d0b08-ad7f-49d6-b64d-7f052af9b507","resolution":{"observed_at":"2026-08-07T11:36:08.102859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.224321Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.224321Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:55c397ee37ee0e1b41600f7a3bdd28944c92786ddaf92857ab6a7d2420bc8a46","observation_id":"10f8423d-b43e-4101-9f64-c10296dc7f76","resolution":{"observed_at":"2026-08-07T11:36:08.224321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.474041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.474041Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:f25ddb520834abda9f97909e79b71c6bd490db0a6832420d4f50b316a67dac41","observation_id":"7cb0088f-27c9-4efb-89af-fd601b966365","resolution":{"observed_at":"2026-08-07T11:36:08.474041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T11:36:08.593518Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.593518Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:af8f2c88133c82b55c37ffd91666556bb111bbd0484a3a954acd47b5b78db347","observation_id":"cb08326d-a2b4-4860-bddf-5e5d0d273b09","resolution":{"observed_at":"2026-08-07T11:36:08.593518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.706899Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.706899Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:bfcc271804d3aaeb1301ab367e0e6863e3f52e70f233b09273b4f8c473e8094b","observation_id":"c9ef97ce-3767-40b3-b057-acc3948f46e0","resolution":{"observed_at":"2026-08-07T11:36:08.706899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T11:36:08.792029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.792029Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:152e3ce94b4f4e708d74edadd45199b6a6183a5c1c9bb8faad33e0c09201e33d","observation_id":"42158aae-ee92-4301-92d9-8ff88a539e89","resolution":{"observed_at":"2026-08-07T11:36:08.792029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:12.098822Z","title":null,"venue":null,"work_id":"fb130ce6-bd1a-4993-a053-f7d446dca061","year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.874604Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:7eb7f1554d8e3b594e15c6ebc91bba52d4f826591e28727e9b819f8d1a4a0b2b","observation_id":"8ee8cdb2-dfa9-42af-9b33-144ce5b9461d","resolution":{"observed_at":"2026-08-07T11:36:12.166425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:36:08.961655Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.961655Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:4ae695fc6474560fcbf6f633bb675b38c2fa960e5e593f9390385ea5205fe35e","observation_id":"a17b21af-4cf2-4fc7-a023-0c07623c5ad2","resolution":{"observed_at":"2026-08-07T11:36:08.961655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T11:36:09.124209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.124209Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:95fabcbfa5868c32724f754f57c2ec800eb866993cfd8110f63832a9d601404a","observation_id":"8b0f499c-efa2-4a89-b27c-39659bdb72cf","resolution":{"observed_at":"2026-08-07T11:36:09.124209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:36:09.278576Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.278576Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:9cc28d4bb6dd00166f72792c7bf6855372f39cc24d82b75e0ff347ff7ed2130a","observation_id":"d97275f3-aeb7-4259-beb4-4f5b339d4c49","resolution":{"observed_at":"2026-08-07T11:36:09.278576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.935515Z","title":null,"venue":null,"work_id":"eeb8f856-e89c-4d8a-8380-df8c935224b7","year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.435590Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:7a922ba6b31d830314affd77e816e1ee3ac03cddf071183e6c1770b061765052","observation_id":"5b1ff2b2-0971-427a-8e64-d414fca976d8","resolution":{"observed_at":"2026-08-07T11:36:12.015503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T11:36:09.544344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.544344Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:fa2c73775ea58b6a466e87b9697449eb1d5dc2ca7571f52786d832adc22f3fab","observation_id":"25ade072-4507-4075-b16b-4c97191acf3a","resolution":{"observed_at":"2026-08-07T11:36:09.544344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:09.708758Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.708758Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:60108e60a5a75ab0c80346219f88c38c94af5247b5e6aff68a522ab8fd7c11ce","observation_id":"151c695c-ddd2-49fe-9a92-79b3978cd901","resolution":{"observed_at":"2026-08-07T11:36:09.708758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07545","last_updated":"2024-06-11T17:59:47Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:47Z","title":"Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07545","snapshot_observed_at":"2026-08-07T11:36:10.030772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.030772Z"},"links":{"cited_paper":"/paper/2406.07545","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:57f89ba53132b79b7acf4de4564ac17e447eb1d75d4f395d058d517f01123760","observation_id":"d031f4f1-005b-4baf-8be1-021ff3e3a4fa","resolution":{"observed_at":"2026-08-07T11:36:10.030772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.734592Z","title":null,"venue":null,"work_id":"147b2098-f3af-45de-b124-300b2d41ec54","year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.154302Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:e02633a226522967c47b1be96ed62d5c4464b03081d985ba3cd0faa082cc922c","observation_id":"919e515e-177e-4bd9-aeb6-75efb7ded9e5","resolution":{"observed_at":"2026-08-07T11:36:11.856502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T11:36:10.296684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.296684Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:24ec3ca11ba628c1672d7d56e18bd29820be29de079e37a5fb290932298d2c24","observation_id":"260f860c-a932-449e-8e9a-da62a1004ff0","resolution":{"observed_at":"2026-08-07T11:36:10.296684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:10.369987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.369987Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:5a6667652a7393de5d0842dd34b9723cc643b45500f62ff3cbc4662725b06ec9","observation_id":"b1bfe8b1-1829-4482-91fa-ee62fedbcd31","resolution":{"observed_at":"2026-08-07T11:36:10.369987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:10.453562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.453562Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:6fc6759c01481d78f966935e51df9cc386a8241b6078ce9f4f8a5c9741da24da","observation_id":"0c8d298b-56b9-4d13-bb50-b23deab3d747","resolution":{"observed_at":"2026-08-07T11:36:10.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T11:36:10.624298Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.624298Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:e49d24782b9b5fca4d9cb2bbc1c136378012d00b22c600375cde3a5e31bfdc8e","observation_id":"12fd8df5-1cc1-44d1-8fb9-895e0f64c910","resolution":{"observed_at":"2026-08-07T11:36:10.624298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.299881Z","title":null,"venue":null,"work_id":"c1145e66-d149-4d8b-959a-1a73bb73d392","year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.706120Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:ba9d13e51208059f14672ae598256dacd9b084bac13c2dfdd9569095329c8868","observation_id":"34896e7b-0bd2-4806-bb20-04bc90db23c2","resolution":{"observed_at":"2026-08-07T11:36:11.406036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:36:10.812719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.812719Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:276678d9a85d0c4e6a0d053a328f69320ad9eef3bf32e65a1078577de6f0b53d","observation_id":"e1633281-b1ea-4bbf-b403-de3c5dbe2028","resolution":{"observed_at":"2026-08-07T11:36:10.812719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.132580Z","title":null,"venue":null,"work_id":"dc019316-fdc2-405b-a7d0-70bfc0fcaebc","year":2025},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.926833Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:c9dc89cdd6b8a6af2d0397286e90b7a2305f1f781c0e5ac42545a0904cf9abce","observation_id":"6efeae68-bae3-4bbb-98a0-2fe772516df6","resolution":{"observed_at":"2026-08-07T11:36:11.186918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-07-06T11:43:15.244747Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-07T11:36:08.350199Z","title":"arXiv preprint arXiv:2109.00122 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.350199Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:48bef2b25818055f3ba73a3e8e35745a3ad7d9d37f59a7eef7f9c505a1dc1fa7","observation_id":"dd24c201-aef2-4daa-9cec-1c0213776a6f","resolution":{"observed_at":"2026-08-07T11:36:08.350199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:36:09.881359Z","title":"arXiv preprint arXiv:2211.09110 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.881359Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:e0e918df00368aadbdbf5fca33dc7625ef8964624370ea1a694e08bb0c4993ed","observation_id":"fcb0f193-1d3f-4d51-bf99-f699c382f548","resolution":{"observed_at":"2026-08-07T11:36:09.881359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.519067Z","title":"Nature Machine Intelligence 5, 1 (2023), 46–57","venue":null,"work_id":"95220aea-1c57-4fe3-b760-b6101a821b49","year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.530656Z"},"links":{"citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:8b88b9bc693c7b48faadee6f3b32c41a0e2bfa4693ee90750af6d88081d5410c","observation_id":"b7d07220-01ed-4edf-855e-d4ed56d2bb6a","resolution":{"observed_at":"2026-08-07T11:36:11.617747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 3 inbound Pith citation observations for arXiv:2506.01793."}