{"as_of":"2026-08-08T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0110a98afb765a28fb33467ed8aa5e2b32a01c3bc74cd36a18edc2ada011e7c1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:35:36.355786Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:49:41.498619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T07:21:39.440092Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2404.13501"},"observation_digest":"sha256:f2f7f035dc124022deab2d2fd15b27d2cbebdfa7a06c72113856d1b6a9b1e0cd","observation_id":"f25dd113-06c5-482c-85d7-af39db2e81b7","resolution":{"observed_at":"2026-05-15T07:21:39.777329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:f224e969b8738bc0931421c0e4c32bc7e35490fbe28cab05b885cd4fc329bf0c","observation_id":"9e34b787-346b-4e4c-b9b9-2ffb293d6fa7","resolution":{"observed_at":"2026-05-11T23:08:36.614193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2501.09775","last_updated":"2026-05-03T15:15:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T10:27:51Z","title":"Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T05:37:22.955895Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2501.09775"},"observation_digest":"sha256:807e04dbc933018668b415c57ee7b0edcc46dcb04940b52b238cef1aa78acf4b","observation_id":"c5cee3cf-8b6c-408a-bb3a-5ad66676cb23","resolution":{"observed_at":"2026-05-23T05:37:36.032998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-08T05:35:36.355786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08333","last_updated":"2025-02-12T11:57:11Z","snapshot_observed_at":"2026-08-08T05:29:34.567357Z","submitted_at":"2025-02-12T11:57:11Z","title":"Foundation Models in Computational Pathology: A Review of Challenges, Opportunities, and Impact","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:35:36.355786Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2502.08333"},"observation_digest":"sha256:bb7408552ab63e58769fbc2eddc25413bfa4bf8af0955bbdb7ecc49c139b0a61","observation_id":"a24a0a9f-4ac6-4fea-9d7a-f8c312a689e8","resolution":{"observed_at":"2026-08-08T05:35:36.355786Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T23:35:42.695574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-07T23:46:48.896211Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.695574Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:96a4617e016965e283bcb7378f63fce9dba7afaff713ee38e842be946b723089","observation_id":"c49507bc-c841-4861-a8c9-d433c0f1f365","resolution":{"observed_at":"2026-08-07T23:35:42.695574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T14:35:03.725406Z","title":", Jin, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18464","last_updated":"2025-05-24T02:07:32Z","snapshot_observed_at":"2026-08-07T18:04:52.579875Z","submitted_at":"2025-05-24T02:07:32Z","title":"From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:35:03.725406Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2505.18464"},"observation_digest":"sha256:2280c5b403ec108ac7bb5dbd5ab1ab940ed64b0fb39c18e7bc7e132bdb269441","observation_id":"06f07d09-4a10-4598-9100-985f02458367","resolution":{"observed_at":"2026-08-07T14:35:03.725406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T11:36:09.124209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.124209Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:95fabcbfa5868c32724f754f57c2ec800eb866993cfd8110f63832a9d601404a","observation_id":"8b0f499c-efa2-4a89-b27c-39659bdb72cf","resolution":{"observed_at":"2026-08-07T11:36:09.124209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T10:54:26.263848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-07T21:43:19.257599Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:26.263848Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.04142"},"observation_digest":"sha256:9ebe699fe2de94bc7c8355a807217f5115bf50f47acc0a3b3b1c9d3ae18f781f","observation_id":"ae2a5157-fa04-47d9-af21-e7a9e5c61a1a","resolution":{"observed_at":"2026-08-07T10:54:26.263848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T10:17:26.624960Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.624960Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:374c088f9624fdc44f85b8bd7e7c97b8e91a230181bacd2d01a1d1a4ef706a38","observation_id":"d8a0c089-0661-4617-a4b5-db7137f29cea","resolution":{"observed_at":"2026-08-07T10:17:26.624960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T06:00:16.603597Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11102","last_updated":"2025-06-06T17:52:18Z","snapshot_observed_at":"2026-08-07T05:54:56.593167Z","submitted_at":"2025-06-06T17:52:18Z","title":"Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:16.603597Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.11102"},"observation_digest":"sha256:8b20b0cd20b0db2917186434b6ce75ae9e354c5038800b5d9b64a3c2b901b093","observation_id":"a6a852ba-7372-4622-9b0c-2306905712da","resolution":{"observed_at":"2026-08-07T06:00:16.603597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T23:20:18.098093Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-07T15:40:10.165789Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.098093Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:082c7d9ba5408d8b3251b9a0917f4aaad32fa3deffeb79196ca11dddadeeadfc","observation_id":"b0f66b31-b1ae-4858-8d25-f3f518ecbbc3","resolution":{"observed_at":"2026-08-06T23:20:18.098093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T12:41:39.388006Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22439","last_updated":"2025-05-29T20:56:48Z","snapshot_observed_at":"2026-08-07T12:35:44.372305Z","submitted_at":"2025-05-29T20:56:48Z","title":"Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:41:39.388006Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.22439"},"observation_digest":"sha256:525bac89a87643ea8d20f55c3b7feef60dec5d996cc93c264c1359dfe60868fc","observation_id":"f3488155-84cf-43bb-8959-c2b068c75164","resolution":{"observed_at":"2026-08-07T12:41:39.388006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T21:36:31.666043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-06T21:29:49.550137Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:31.666043Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:e3d6376805bc2c8c1b32f38be075ca7d1545ed9cc0eadb2a517b4e79670dc1e3","observation_id":"360b283c-c81c-4884-a279-da2d7e445a4c","resolution":{"observed_at":"2026-08-06T21:36:31.666043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T21:43:34.962660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05266","last_updated":"2025-06-30T06:14:32Z","snapshot_observed_at":"2026-08-06T21:36:14.853232Z","submitted_at":"2025-06-30T06:14:32Z","title":"User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:43:34.962660Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2507.05266"},"observation_digest":"sha256:38a340ab433f3c38ef86ac90cacfc9f9dd4f0b34ca7d72b18a487077943f79fa","observation_id":"528253e7-3801-47df-a54b-7e0035840e8d","resolution":{"observed_at":"2026-08-06T21:43:34.962660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T19:20:16.530237Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05965","last_updated":"2025-07-08T13:19:00Z","snapshot_observed_at":"2026-08-06T19:11:49.254960Z","submitted_at":"2025-07-08T13:19:00Z","title":"OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:20:16.530237Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2507.05965"},"observation_digest":"sha256:4a6c6e874876f2d7e4a5c1c5a0da526cd5e5fbd5b32498869c374c8da685f9bd","observation_id":"5be48bf6-ad10-44dc-9d1a-6adb070acf96","resolution":{"observed_at":"2026-08-06T19:20:16.530237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T14:58:57.803410Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17178","last_updated":"2025-08-29T06:52:20Z","snapshot_observed_at":"2026-08-07T04:04:05.944205Z","submitted_at":"2025-07-23T03:52:24Z","title":"SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:58:57.803410Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2507.17178"},"observation_digest":"sha256:987836632e58330f6dcfe8f5fe6536f2bfd281caefa996125966cc74abcd03f6","observation_id":"c4bcdf86-1881-40d4-9496-8652eec1d50a","resolution":{"observed_at":"2026-08-06T14:58:57.803410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-05T17:59:24.676630Z","title":"Evaluating Large Language Models: A Comprehensive Survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16678","last_updated":"2025-08-21T09:19:08Z","snapshot_observed_at":"2026-08-07T21:50:37.799943Z","submitted_at":"2025-08-21T09:19:08Z","title":"Cognitive Agents Powered by Large Language Models for Agile Software Project Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:59:24.676630Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2508.16678"},"observation_digest":"sha256:50b370ca377ecfd87d045f2b77129394d329b21833c183718db2156df250e7b3","observation_id":"1187c08b-4c1b-4e7e-bd62-b098dec4c48b","resolution":{"observed_at":"2026-08-05T17:59:24.676630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-05T15:44:14.813109Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-08-05T15:44:13.449330Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:44:14.813109Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2508.19598"},"observation_digest":"sha256:19cb652640954b92618d677fe65013da16e13bcfef9b3c788182874dbc8f51b9","observation_id":"ae6c1ce3-75fb-492e-a33a-e27906e55ab4","resolution":{"observed_at":"2026-08-05T15:44:14.813109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2602.17170","last_updated":"2026-04-27T13:58:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-19T08:37:21Z","title":"When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T21:09:29.669360Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2602.17170"},"observation_digest":"sha256:f120a96efcf4f003b49e410d0997a0de119c61f34fef3689bd3ed218705469c2","observation_id":"7bf470c6-62b3-40cb-8c0c-45de6b616bc7","resolution":{"observed_at":"2026-05-15T21:10:18.500779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.07883","last_updated":"2026-05-08T15:33:54Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:33:54Z","title":"Beyond \"I cannot fulfill this request\": Alleviating Rigid Rejection in LLMs via Label Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:10.245859Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.07883"},"observation_digest":"sha256:4b6f75e2191d1ebe32a27db229fdd7fec78cda13556ac8b3ea7a9223a28aba7c","observation_id":"9877ca53-ae81-4513-ad56-8ba2ef3c504e","resolution":{"observed_at":"2026-05-11T04:15:55.758821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.10851","last_updated":"2026-05-11T17:00:18Z","snapshot_observed_at":"2026-08-03T03:33:06.244554Z","submitted_at":"2026-05-11T17:00:18Z","title":"The Generalized Turing Test: A Foundation for Comparing Intelligence","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T03:25:48.145137Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.10851"},"observation_digest":"sha256:ae74fead2923f5e8337849688cde0e20b71918b34cb7527e9fa37823e76afc24","observation_id":"aa005585-e4db-472f-8abe-51cfaac554ca","resolution":{"observed_at":"2026-05-12T03:26:18.923707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.12055","last_updated":"2026-05-14T07:07:27Z","snapshot_observed_at":"2026-07-31T12:10:28.537993Z","submitted_at":"2026-05-12T12:37:06Z","title":"Do Language Models Encode Knowledge of Linguistic Constraint Violations?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:16.157548Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.12055"},"observation_digest":"sha256:631cdbff4162d5d828ce31ed17c46842511f3502625141d3026b512ed553d2fc","observation_id":"aebc6e71-8859-4a49-bc08-35f047881fe5","resolution":{"observed_at":"2026-05-13T06:27:24.749420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.12055","last_updated":"2026-05-14T07:07:27Z","snapshot_observed_at":"2026-07-31T12:10:28.537993Z","submitted_at":"2026-05-12T12:37:06Z","title":"Do Language Models Encode Knowledge of Linguistic Constraint Violations?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T05:44:52.491280Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.12055"},"observation_digest":"sha256:814457073808a475e66640fa1965e0c06cf860195e5195a9adbc96a10f838c1c","observation_id":"dc48d998-456e-4a0f-8bf0-7edb31d9a7e4","resolution":{"observed_at":"2026-05-15T05:45:05.695669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.15761","last_updated":"2026-05-15T09:21:33Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:21:33Z","title":"A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T21:26:13.698051Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.15761"},"observation_digest":"sha256:ad61f5435fd525462e2de66f07667b468797b93a7ab1358f8bc82a311702e9f0","observation_id":"ea682319-30d1-4e82-9876-74b6fad82272","resolution":{"observed_at":"2026-05-20T21:29:03.254380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2606.21939","last_updated":"2026-06-20T08:15:41Z","snapshot_observed_at":"2026-08-05T14:43:01.168641Z","submitted_at":"2026-06-20T08:15:41Z","title":"Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T12:13:12.018506Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2606.21939"},"observation_digest":"sha256:c91c9bcdcad1d0469610cb238419633bd9173d755daabf1f46fa403cae5963a6","observation_id":"111567ad-3fca-4fe1-a757-df8f0a1fddfe","resolution":{"observed_at":"2026-07-04T08:09:40.882307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2606.22329","last_updated":"2026-06-21T04:35:43Z","snapshot_observed_at":"2026-07-31T23:50:31.635694Z","submitted_at":"2026-06-21T04:35:43Z","title":"BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T11:06:07.303335Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2606.22329"},"observation_digest":"sha256:e90d2177b01ea5843b5bf91ce11835846c23758f98d8f792f7d7c816c7cbfd6b","observation_id":"99f47601-be53-42f7-8a80-d43eb53c6843","resolution":{"observed_at":"2026-07-04T08:49:41.500046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-01T18:08:18.676413Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17409","last_updated":"2026-07-19T21:01:34Z","snapshot_observed_at":"2026-08-07T07:49:46.040713Z","submitted_at":"2026-07-19T21:01:34Z","title":"Efficient Sequential Evaluation of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:08:18.676413Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2607.17409"},"observation_digest":"sha256:c993b8028bbc205cb86d1a824d01b51f895ca5bafaa2686da2406b6d5b618b2b","observation_id":"edd30526-0248-4d70-8c0d-f389042da49e","resolution":{"observed_at":"2026-08-01T18:08:18.676413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-01T02:21:22.521574Z","title":"arXiv preprint arXiv:2310.19736 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25485","last_updated":"2026-07-28T09:24:04Z","snapshot_observed_at":"2026-08-08T05:57:13.194969Z","submitted_at":"2026-07-28T09:24:04Z","title":"PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:22.521574Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2607.25485"},"observation_digest":"sha256:52a76e58e27d2370863aa1dad0b71190551f04ec38fa647364da758419017200","observation_id":"f3c6c9d6-cbec-4b73-bb34-fc4e24f7b3d7","resolution":{"observed_at":"2026-08-01T02:21:22.521574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.19736/citation-record","integrity":"/paper/2310.19736/integrity","json":"/paper/2310.19736/citation-record.json","paper":"/paper/2310.19736"},"outbound":[],"paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2310.19736."}