{"as_of":"2026-08-16T09:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f13679452a61b007d2f6e5e9c4ebede3bc97f90d51866917d8f70b1ec481fc1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":63,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:13:04.662883Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":33,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:59.033645Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2306.05685"},"observation_digest":"sha256:98ab24aeffc95fda2624ae3386629ce0bae086aaa043e75e8135f2800fe6b96a","observation_id":"814939cf-b7f6-4969-91c5-9e1bec2f57ff","resolution":{"observed_at":"2026-05-10T18:52:59.159832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-16T13:21:24.297836Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2309.03883"},"observation_digest":"sha256:634af3abb0203bcd7da553bd142ac82c3982a13fb4a1d08258693ab80a151555","observation_id":"6a5e10f4-5fc1-42c1-9d2c-97dd29ea5f00","resolution":{"observed_at":"2026-05-16T13:21:24.419213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T02:46:26.957539Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2311.05232"},"observation_digest":"sha256:43ce68c6cfa60d92125565335a0a5d86ffe6e5890a8246de3a51bee5bcfff4b0","observation_id":"858940d4-8f27-42d8-a754-5512b4e099b5","resolution":{"observed_at":"2026-05-13T02:46:27.484024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-24T05:34:04.002648Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2311.07911"},"observation_digest":"sha256:3a9fcde087473bac15e5f0e1466a2fb19b7716cdefa6e19e2a797951d720ec56","observation_id":"1587904f-5c1b-4a5b-85f6-e4ca2379b93e","resolution":{"observed_at":"2026-05-24T05:36:00.925197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":260,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:ababbe738eb2d548d7b235bb86b36dd5e1f4759a1c2f4ad7b0ba5510dd97c36c","observation_id":"91bdb0e5-5a3c-4906-9c5b-d5406d963c07","resolution":{"observed_at":"2026-05-16T09:46:10.036499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2401.02458","last_updated":"2026-04-29T07:43:10Z","snapshot_observed_at":"2026-07-29T23:57:44.096283Z","submitted_at":"2024-01-04T08:00:32Z","title":"Data-Centric Foundation Models in Computational Healthcare: A Survey","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-24T04:13:05.328492Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2401.02458"},"observation_digest":"sha256:573b65e0a77c4149059616367727040bbb4bb5b4a48596b871995948d5c9c6d5","observation_id":"3fa4798e-cce5-4d98-9c6a-7e808df44b3b","resolution":{"observed_at":"2026-05-24T04:13:53.198466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T21:16:25.212599Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08977","last_updated":"2024-11-22T16:22:35Z","snapshot_observed_at":"2026-08-12T21:09:52.074108Z","submitted_at":"2024-11-13T19:08:23Z","title":"Robustness and Confounders in the Demographic Alignment of LLMs with Human Perceptions of Offensiveness","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T21:16:25.212599Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2411.08977"},"observation_digest":"sha256:0ac286a62b851ffecf8c8e6af7038667d2f123816d09c61e759fa1cb60e80ab4","observation_id":"c30be60d-47ca-4eb8-bd7e-a1d0dfa99e6d","resolution":{"observed_at":"2026-08-12T21:16:25.212599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T15:12:03.398720Z","title":"Can large language models be an alternative to human evaluations?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14574","last_updated":"2024-11-21T20:41:55Z","snapshot_observed_at":"2026-08-15T17:29:43.729213Z","submitted_at":"2024-11-21T20:41:55Z","title":"SRSA: A Cost-Efficient Strategy-Router Search Agent for Real-world Human-Machine Interactions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:12:03.398720Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2411.14574"},"observation_digest":"sha256:d2a697b01e1c7024e0d86c30423e6dcbb17fbe19340eeb6f7e6fe86bcc289bad","observation_id":"628ca227-a898-4afd-9e45-72f0461c960c","resolution":{"observed_at":"2026-08-12T15:12:03.398720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T14:12:47.277502Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-13T15:23:41.008148Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.277502Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:88907714165b619a18478a720468845f16253a6655a05eb2c320efcd34dc5bbe","observation_id":"cc76682c-2a6e-4f13-8195-8cc0f480d730","resolution":{"observed_at":"2026-08-12T14:12:47.277502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T12:21:08.583992Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17301","last_updated":"2025-02-13T12:25:54Z","snapshot_observed_at":"2026-08-15T14:59:38.118455Z","submitted_at":"2024-11-26T10:48:55Z","title":"ReFINE: A Reward-Based Framework for Interpretable and Nuanced Evaluation of Radiology Report Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:21:08.583992Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2411.17301"},"observation_digest":"sha256:855021bc1b076bd62f708c984e626cc608ca537eb18ad17a73cc14346f2f5042","observation_id":"c7038c9c-3323-4c76-8d93-48edf064a7e2","resolution":{"observed_at":"2026-08-12T12:21:08.583992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T05:35:51.335834Z","title":"Can large language models be an alterna- tive to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00314","last_updated":"2024-11-30T01:49:25Z","snapshot_observed_at":"2026-08-14T09:47:55.531196Z","submitted_at":"2024-11-30T01:49:25Z","title":"Human-Like Code Quality Evaluation through LLM-based Recursive Semantic Comprehension","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:35:51.335834Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.00314"},"observation_digest":"sha256:b57766bc267db5dd2f3ea275dd5a2031c06ab2e53e258f2d290c73bd1b2f1da1","observation_id":"24059aa6-2376-47a7-9ebe-1ebf7aeeb741","resolution":{"observed_at":"2026-08-12T05:35:51.335834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T04:32:03.124672Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01333","last_updated":"2024-12-02T09:56:18Z","snapshot_observed_at":"2026-08-13T14:04:07.660512Z","submitted_at":"2024-12-02T09:56:18Z","title":"Can Large Language Models Serve as Evaluators for Code Summarization?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:32:03.124672Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.01333"},"observation_digest":"sha256:b0de4ffa01dddd9f03a19be7bdabdf5c51d0523d0509a91faeaee2832f6a4885","observation_id":"035363bf-f34a-4f15-9bfe-707d3331831b","resolution":{"observed_at":"2026-08-12T04:32:03.124672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T04:27:02.267505Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01443","last_updated":"2024-12-02T12:32:19Z","snapshot_observed_at":"2026-08-12T22:42:20.823187Z","submitted_at":"2024-12-02T12:32:19Z","title":"Multi-Facet Blending for Faceted Query-by-Example Retrieval","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T04:27:02.267505Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.01443"},"observation_digest":"sha256:1ef0eac6965efe1fdaa0591b5baea598fbafb17fd7b74bfdcb8d8636de1411fc","observation_id":"3c9a7192-0623-4bfc-b300-bbd626bb44d8","resolution":{"observed_at":"2026-08-12T04:27:02.267505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-11T23:15:28.563407Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02674","last_updated":"2025-02-25T16:59:11Z","snapshot_observed_at":"2026-08-14T20:58:55.959220Z","submitted_at":"2024-12-03T18:47:26Z","title":"Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:15:28.563407Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.02674"},"observation_digest":"sha256:2c54714d6b49ce41740a206a06b6c6b1c0d36531681493a5e2d2a71ca631bab0","observation_id":"e7f030f7-35dc-4570-97ee-63008b05c85a","resolution":{"observed_at":"2026-08-11T23:15:28.563407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T00:04:55.423085Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03597","last_updated":"2024-12-02T20:49:21Z","snapshot_observed_at":"2026-08-13T12:04:56.750188Z","submitted_at":"2024-12-02T20:49:21Z","title":"The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:55.423085Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.03597"},"observation_digest":"sha256:36c60cbbfb81350f02905acb969982e0f5a93427bdc84ecfd6717ad989130500","observation_id":"ef857637-bd29-48a3-be1b-afe3df0fbd8c","resolution":{"observed_at":"2026-08-12T00:04:55.423085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-11T18:35:56.195540Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09645","last_updated":"2025-08-20T18:39:27Z","snapshot_observed_at":"2026-08-16T07:01:57.667216Z","submitted_at":"2024-12-10T18:52:39Z","title":"Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T18:35:56.195540Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.09645"},"observation_digest":"sha256:c2165d0f589a2b271e66fc499e3706c72187b79d8191165484ae959c5b6ad29d","observation_id":"9074c8f0-f0f8-4576-a9f0-12d9021e1673","resolution":{"observed_at":"2026-08-11T18:35:56.195540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-11T19:57:43.472128Z","title":"Can large language models be an alternative to human evalu- ations? arXiv preprint arXiv:2305.01937,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10415","last_updated":"2024-12-09T06:58:17Z","snapshot_observed_at":"2026-08-15T09:28:46.290713Z","submitted_at":"2024-12-09T06:58:17Z","title":"Generative Adversarial Reviews: When LLMs Become the Critic","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:57:43.472128Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2412.10415"},"observation_digest":"sha256:4c8a20d7461cd51c6b197581354a21b5c5c99c1f207d74464e326057a525dfa3","observation_id":"803fb350-3e91-419d-bb69-400314a11faf","resolution":{"observed_at":"2026-08-11T19:57:43.472128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-10T23:01:05.024146Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00257","last_updated":"2024-12-31T03:56:17Z","snapshot_observed_at":"2026-08-14T08:35:19.921704Z","submitted_at":"2024-12-31T03:56:17Z","title":"EQUATOR: A Deterministic Framework for Evaluating LLM Reasoning with Open-Ended Questions. # v1.0.0-beta","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:01:05.024146Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.00257"},"observation_digest":"sha256:d59d26d97db484a588ccc24704a141b177d2cba8048926d4726add079d67b470","observation_id":"30aa11da-13e1-4ed8-ab8d-c1c7a56d4f0e","resolution":{"observed_at":"2026-08-10T23:01:05.024146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-10T22:27:15.501335Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.501335Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:fd59f25c5bd133abc4f15a493861ead9bf83e75f852547459b6829b398d1801a","observation_id":"90df8baa-0b88-4629-973b-b0de585f97bf","resolution":{"observed_at":"2026-08-10T22:27:15.501335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-10T21:35:14.027629Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04543","last_updated":"2025-08-04T20:52:56Z","snapshot_observed_at":"2026-08-11T16:53:09.374522Z","submitted_at":"2025-01-08T14:46:37Z","title":"The Impostor is Among Us: Can Large Language Models Capture the Complexity of Human Personas?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:35:14.027629Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.04543"},"observation_digest":"sha256:5dedd1a0aa916097e6bde2e5205b842e22fa6f1fce61444548e6724dd1194a5e","observation_id":"21417018-4d95-476d-aa08-613aab922500","resolution":{"observed_at":"2026-08-10T21:35:14.027629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-10T20:22:38.447618Z","title":"Can large language models be an alterna- tive to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09768","last_updated":"2025-02-28T18:27:21Z","snapshot_observed_at":"2026-08-14T14:39:36.844189Z","submitted_at":"2025-01-15T11:32:35Z","title":"Can Large Language Models Predict the Outcome of Judicial Decisions?","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:38.447618Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.09768"},"observation_digest":"sha256:62830d95ab7101791e1d837b628f7a9de45f5d1fd87ed0cf6da189bd2ac2303f","observation_id":"0c757a55-1016-4b16-9f7b-7da69d37863e","resolution":{"observed_at":"2026-08-10T20:22:38.447618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-10T15:08:51.682665Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14499","last_updated":"2025-01-24T13:59:14Z","snapshot_observed_at":"2026-08-12T17:26:26.409757Z","submitted_at":"2025-01-24T13:59:14Z","title":"Automated Assignment Grading with Large Language Models: Insights From a Bioinformatics Course","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:08:51.682665Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.14499"},"observation_digest":"sha256:52a25c451eb1c3b859a188f69dd7ca57be098e6989789157450cd80369905fce","observation_id":"f0fe5bfd-b6eb-4b82-9d8e-d5ee28e22c34","resolution":{"observed_at":"2026-08-10T15:08:51.682665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-09T23:21:01.959032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18493","last_updated":"2025-05-12T21:48:40Z","snapshot_observed_at":"2026-08-15T04:40:48.620408Z","submitted_at":"2025-01-30T17:06:56Z","title":"Examining the Expanding Role of Synthetic Data Throughout the AI Development Pipeline","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T23:21:01.959032Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.18493"},"observation_digest":"sha256:357564d195a99d52431b530425456b0d0ead1ebef4861635a4064aa5ce1a1c92","observation_id":"9d837da3-c0d3-443b-909c-2ddfa06d830f","resolution":{"observed_at":"2026-08-09T23:21:01.959032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-09T10:44:41.079145Z","title":"Chiang, H.-y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02896","last_updated":"2025-02-05T05:37:26Z","snapshot_observed_at":"2026-08-16T06:44:33.935398Z","submitted_at":"2025-02-05T05:37:26Z","title":"A Benchmark for the Detection of Metalinguistic Disagreements between LLMs and Knowledge Graphs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T10:44:41.079145Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2502.02896"},"observation_digest":"sha256:8bc1789ae3e98e86e46b0478482c55698eea048ddb606bbcd6568dc9aa256364","observation_id":"2044898d-6f81-4aa9-bd60-dcbe72f24209","resolution":{"observed_at":"2026-08-09T10:44:41.079145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T23:44:11.154001Z","title":"and Lee, H.-y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08788","last_updated":"2025-06-21T09:22:22Z","snapshot_observed_at":"2026-08-16T05:53:45.987477Z","submitted_at":"2025-02-12T21:01:10Z","title":"Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:44:11.154001Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2502.08788"},"observation_digest":"sha256:c576cbaeed08b0dc827c00ad395ddd8f7e9ae1e0fbe26c56ad11b8a2734cff73","observation_id":"bbdd4d8d-e2d6-4a3b-a199-1cbd65dcac8e","resolution":{"observed_at":"2026-08-07T23:44:11.154001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T19:25:33.558270Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-12T16:25:44.853270Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.558270Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:be12a870a251697bf7db81b8c5255db7baa05a9c524e0107ff1ce08edcd6a6a2","observation_id":"3ea38642-fee4-454e-b912-af096972d4fa","resolution":{"observed_at":"2026-08-07T19:25:33.558270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T22:13:04.662883Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07664","last_updated":"2025-05-12T15:31:16Z","snapshot_observed_at":"2026-08-15T22:08:36.280447Z","submitted_at":"2025-05-12T15:31:16Z","title":"A Case Study Investigating the Role of Generative AI in Quality Evaluations of Epics in Agile Software Development","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:13:04.662883Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.07664"},"observation_digest":"sha256:de953ed720e6d9d6a827c1a456b89f708f022418a03ee177cb7df2b623acb5d8","observation_id":"a07b68d6-5bd8-492b-8d20-59ae78ec3ea7","resolution":{"observed_at":"2026-08-15T22:13:04.662883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T20:17:05.343649Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13794","last_updated":"2025-05-20T01:02:29Z","snapshot_observed_at":"2026-08-16T04:06:52.991637Z","submitted_at":"2025-05-20T01:02:29Z","title":"LLM-based Evaluation Policy Extraction for Ecological Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:05.343649Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.13794"},"observation_digest":"sha256:a6e964e2d63a95f16eaed04c4b0d703afcc8cac463a242cc647a7c72472a0811","observation_id":"08f3ac31-599a-4de1-8131-e768ee4afaa5","resolution":{"observed_at":"2026-08-15T20:17:05.343649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T15:28:08.594167Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-14T04:01:55.895222Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.594167Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:58be484923f389be9e7c0a4ef6db0797e933b5afc378154c976ea3736c0ea8e6","observation_id":"f9799cb4-970b-4e35-ba8e-c3918c478614","resolution":{"observed_at":"2026-08-07T15:28:08.594167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T14:31:36.992431Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21537","last_updated":"2025-05-24T09:07:13Z","snapshot_observed_at":"2026-08-13T18:49:31.787472Z","submitted_at":"2025-05-24T09:07:13Z","title":"OpenReview Should be Protected and Leveraged as a Community Asset for Research in the Era of Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:31:36.992431Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.21537"},"observation_digest":"sha256:b62f58c21ac92ea532655d1286b3e6d22b2163452b2b6e4eee49e62756754257","observation_id":"3f1316c7-326e-40a5-b1d3-2277807b866d","resolution":{"observed_at":"2026-08-07T14:31:36.992431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T12:52:38.647469Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23239","last_updated":"2025-05-29T08:40:10Z","snapshot_observed_at":"2026-08-12T14:55:19.260190Z","submitted_at":"2025-05-29T08:40:10Z","title":"OSS-UAgent: An Agent-based Usability Evaluation Framework for Open Source Software","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.647469Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.23239"},"observation_digest":"sha256:27c5679f1c5f8e1b470975c846314491536b04052b703a3a477b092c275f3ccb","observation_id":"65579d38-8691-4034-aace-16374b079272","resolution":{"observed_at":"2026-08-07T12:52:38.647469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T12:09:53.297574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06331","last_updated":"2025-05-31T03:36:16Z","snapshot_observed_at":"2026-08-10T16:55:31.107825Z","submitted_at":"2025-05-31T03:36:16Z","title":"How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:53.297574Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.06331"},"observation_digest":"sha256:dfc49c0e7545f56855fe4671a76fd16c86df38ad14bc6ecdace826aa434d0b67","observation_id":"c1933a8e-b3d0-405c-be0a-094c8a48f047","resolution":{"observed_at":"2026-08-07T12:09:53.297574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T10:17:27.194667Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-13T12:53:10.459412Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:27.194667Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:6c06e056bf3c786682044c78ec3a92f0339d27c229e1113b0c653b57a5a92775","observation_id":"7578f62b-ed4b-4f24-bfe9-852e61ef515b","resolution":{"observed_at":"2026-08-07T10:17:27.194667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T19:48:46.903746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15068","last_updated":"2025-06-18T02:16:53Z","snapshot_observed_at":"2026-08-16T02:20:41.417724Z","submitted_at":"2025-06-18T02:16:53Z","title":"Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:46.903746Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.15068"},"observation_digest":"sha256:c5868cd060b851617b81be95c65d6ccf6410a8a531fc4d76ca453128549495b7","observation_id":"c5652fe0-37c2-4443-9162-5b0b1bb0ad3d","resolution":{"observed_at":"2026-08-15T19:48:46.903746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T19:15:21.950376Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-15T19:08:12.643716Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.950376Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:5be854919b8147126cd1f6e20062ed49421278661616193b0815c1f641df578b","observation_id":"42676804-f7d6-42ac-bd6e-d2e393d58ebf","resolution":{"observed_at":"2026-08-15T19:15:21.950376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-06T23:20:04.677606Z","title":"Can large language models be an alternative to human evalua- tions? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18387","last_updated":"2025-06-23T08:19:21Z","snapshot_observed_at":"2026-08-14T20:49:08.002693Z","submitted_at":"2025-06-23T08:19:21Z","title":"Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:04.677606Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.18387"},"observation_digest":"sha256:c244256be0070cbb1cdbc86e4c717b83c51e73ad88a9b0eaf2750f6c8687ce72","observation_id":"54074dbd-16a8-45eb-a163-1ff7bc0d7026","resolution":{"observed_at":"2026-08-06T23:20:04.677606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-06T23:01:35.183306Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20128","last_updated":"2025-06-25T04:49:03Z","snapshot_observed_at":"2026-08-13T14:47:24.800735Z","submitted_at":"2025-06-25T04:49:03Z","title":"CCRS: A Zero-Shot LLM-as-a-Judge Framework for Comprehensive RAG Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:35.183306Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.20128"},"observation_digest":"sha256:3bbfb4bd79fe09f0b863b82db3dfcc74f54277dbb90aa47b341499013de335c2","observation_id":"59cc03f1-7b1c-493d-99d9-46e76a6d7f5b","resolution":{"observed_at":"2026-08-06T23:01:35.183306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-06T22:40:14.996568Z","title":"and Lee, H.-y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21362","last_updated":"2025-06-26T15:13:35Z","snapshot_observed_at":"2026-08-13T21:34:46.977141Z","submitted_at":"2025-06-26T15:13:35Z","title":"Counterfactual Voting Adjustment for Quality Assessment and Fairer Voting in Online Platforms with Helpfulness Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:40:14.996568Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.21362"},"observation_digest":"sha256:7007485c21e97a4b6b6db5303ff579159658bb441bdce13ab07617288865640e","observation_id":"e38fc80c-7501-41f6-b8ba-bf5a816c9c98","resolution":{"observed_at":"2026-08-06T22:40:14.996568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-06T22:22:39.652733Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21805","last_updated":"2025-06-26T23:11:42Z","snapshot_observed_at":"2026-08-14T19:41:21.659275Z","submitted_at":"2025-06-26T23:11:42Z","title":"CitySim: Modeling Urban Behaviors and City Dynamics with Large-Scale LLM-Driven Agent Simulation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:22:39.652733Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.21805"},"observation_digest":"sha256:6b418f86c1132710e09739cf8427ba0b93660accdbe5c31e14b7ad588fbb9f75","observation_id":"ec2ed023-6672-463e-b71c-a4a9d244423d","resolution":{"observed_at":"2026-08-06T22:22:39.652733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-06T05:12:32.559295Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02209","last_updated":"2025-08-04T09:00:01Z","snapshot_observed_at":"2026-08-16T01:22:07.666776Z","submitted_at":"2025-08-04T09:00:01Z","title":"Balancing Information Accuracy and Response Timeliness in Networked LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:12:32.559295Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2508.02209"},"observation_digest":"sha256:c5c3e162adbc4daa011d838579ec2590360f76d64eed9265301aec8d56c33c4b","observation_id":"b1d6d28a-d741-4c4b-8ab3-f1fac97bed19","resolution":{"observed_at":"2026-08-06T05:12:32.559295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T22:56:19.869599Z","title":"& author Lee, H.-y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06591","last_updated":"2025-08-08T10:41:03Z","snapshot_observed_at":"2026-08-15T19:13:34.078083Z","submitted_at":"2025-08-08T10:41:03Z","title":"Generative Artificial Intelligence Extracts Structure-Function Relationships from Plants for New Materials","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T22:56:19.869599Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2508.06591"},"observation_digest":"sha256:0fc4043d3d8ecf61a0267ed03dbf2412605b3f07e6c0c2eda7e043767e0c91d2","observation_id":"5f2966d4-d7e1-4d72-a744-79d8b4c41f34","resolution":{"observed_at":"2026-08-05T22:56:19.869599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T20:19:15.326550Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10971","last_updated":"2026-06-22T22:49:25Z","snapshot_observed_at":"2026-08-14T18:39:29.022731Z","submitted_at":"2025-08-14T16:41:47Z","title":"Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:19:15.326550Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2508.10971"},"observation_digest":"sha256:1b9cfec3c95215d4a7e4e67394b8191b907c019dfcfdaeda4a5c2132e9fc7216","observation_id":"170f9278-a099-449f-8b80-b2227c26e93e","resolution":{"observed_at":"2026-08-05T20:19:15.326550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T17:19:10.145233Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16512","last_updated":"2025-08-22T16:35:19Z","snapshot_observed_at":"2026-08-15T21:47:45.565508Z","submitted_at":"2025-08-22T16:35:19Z","title":"Seeing Clearly, Forgetting Deeply: Revisiting Fine-Tuned Video Generators for Driving Simulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:19:10.145233Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2508.16512"},"observation_digest":"sha256:9e36b2c2785c2075f2b3ea73c2474aa1a9a65e831a6f08e932b03dbe8aa9b761","observation_id":"e55e6375-5023-4525-930f-9762a6c464aa","resolution":{"observed_at":"2026-08-05T17:19:10.145233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T16:25:18.214750Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18636","last_updated":"2026-06-10T06:33:48Z","snapshot_observed_at":"2026-08-14T16:07:23.530662Z","submitted_at":"2025-08-26T03:25:49Z","title":"LaQual: An Automated Framework for LLM App Quality Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:25:18.214750Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2508.18636"},"observation_digest":"sha256:35662487ec61d2562ee6b51c29615331a179087346461e47942c4f5b950ec468","observation_id":"53dfcc92-1497-46ac-b364-d3a2c9f783b0","resolution":{"observed_at":"2026-08-05T16:25:18.214750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T11:15:57.397068Z","title":"Can large language models be an alterna- tive to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02998","last_updated":"2025-09-03T04:16:50Z","snapshot_observed_at":"2026-08-14T23:09:07.087511Z","submitted_at":"2025-09-03T04:16:50Z","title":"Integrating Generative AI into Cybersecurity Education: A Study of OCR and Multimodal LLM-assisted Instruction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:15:57.397068Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2509.02998"},"observation_digest":"sha256:1dd9e34afcdd48ef74226c0aedd3988add3b711ca66012330f3bd57e3af9b2ff","observation_id":"65ab60d8-40af-4688-830c-3bfff04da3a1","resolution":{"observed_at":"2026-08-05T11:15:57.397068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-04T20:20:36.683371Z","title":"Can large language models be an alternative to human evaluations?arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-09T06:09:37.758584Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.683371Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:7e738bfc865c70b893fe9cd8d05ac0906413648846bf4b242050619af97187fe","observation_id":"c0b98ba9-1358-48cd-b90a-8588516087d6","resolution":{"observed_at":"2026-08-04T20:20:36.683371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-04T17:40:26.398037Z","title":"Chiang and H.-y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10704","last_updated":"2025-09-12T21:45:16Z","snapshot_observed_at":"2026-08-14T23:44:37.872497Z","submitted_at":"2025-09-12T21:45:16Z","title":"Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T17:40:26.398037Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2509.10704"},"observation_digest":"sha256:862557a782289461c903f79154453a1baaab7bb50b08a95fd0fcd5ef14f75c37","observation_id":"14006fc8-2a4b-4f0d-952e-2f5837b31537","resolution":{"observed_at":"2026-08-04T17:40:26.398037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-07-15T00:10:48.378080Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.09529","last_updated":"2026-05-30T06:49:47Z","snapshot_observed_at":"2026-08-15T07:45:36.403901Z","submitted_at":"2026-03-10T11:36:52Z","title":"RESBev: Making BEV Perception More Robust","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-15T00:10:48.378080Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2603.09529"},"observation_digest":"sha256:9c82b826d5a0f25333cc07cc0311ce526be855942a3d2d0b1d88bd5ba26a97c2","observation_id":"61632217-2d50-409d-b6e5-6a8d682ed4cc","resolution":{"observed_at":"2026-07-15T00:10:48.378080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2604.17114","last_updated":"2026-05-03T12:53:36Z","snapshot_observed_at":"2026-08-11T20:06:50.006911Z","submitted_at":"2026-04-18T19:10:12Z","title":"The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T06:38:26.930020Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2604.17114"},"observation_digest":"sha256:b9a676764cbc02470e83115ca0d93e4bde95d3521c6c29055e0e07f7e4e13a64","observation_id":"a41f30db-f2bb-4359-a9c6-29dfe2f88bb4","resolution":{"observed_at":"2026-05-10T06:41:36.710801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2604.28049","last_updated":"2026-04-30T15:59:28Z","snapshot_observed_at":"2026-08-09T22:21:47.085726Z","submitted_at":"2026-04-30T15:59:28Z","title":"Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T07:05:57.220730Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2604.28049"},"observation_digest":"sha256:5ffcfdde0c3403a3b028f819f58b7a40fc44539aaae99a0ae1969e87a79f3742","observation_id":"1852c7c6-a82c-4588-971c-8b94274622cf","resolution":{"observed_at":"2026-05-12T10:11:28.693906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2605.06283","last_updated":"2026-05-07T13:55:11Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:55:11Z","title":"Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T10:32:15.938575Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2605.06283"},"observation_digest":"sha256:cf0445f5d53a327ebe3434e10216b994505487a782b9ce1e60e4c242065d8a50","observation_id":"9832c778-716b-484b-b9f1-5cc675053839","resolution":{"observed_at":"2026-05-11T20:01:10.260954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2605.15416","last_updated":"2026-08-02T00:54:42Z","snapshot_observed_at":"2026-08-16T01:55:44.908168Z","submitted_at":"2026-05-14T21:01:05Z","title":"Margin-Adaptive Confidence Ranking for Reliable LLM Judgement","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-19T16:05:41.505091Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2605.15416"},"observation_digest":"sha256:9e041514675e1cd2c535987cb34eddcb40d6264ab6fa28e0243422b5d4cca165","observation_id":"677c1e49-b3a3-4693-b411-37b7c88188ff","resolution":{"observed_at":"2026-05-19T16:12:39.511563Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2606.06462","last_updated":"2026-06-04T17:52:04Z","snapshot_observed_at":"2026-08-15T12:40:49.491728Z","submitted_at":"2026-06-04T17:52:04Z","title":"Benchmark Everything Everywhere All at Once","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T01:03:52.964870Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2606.06462"},"observation_digest":"sha256:422557f25eb74adea0558dce2f52219b982db563761b419f70b4fdcb9e703f8a","observation_id":"5db47bd7-7218-4732-b59d-ef9a38d09c68","resolution":{"observed_at":"2026-07-02T13:46:59.078136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2606.12068","last_updated":"2026-06-10T13:32:10Z","snapshot_observed_at":"2026-08-16T09:09:26.052166Z","submitted_at":"2026-06-10T13:32:10Z","title":"StanceNakba Shared Task: Actor and Topic-Aware Stance Detection in Public Discourse","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T10:05:02.300949Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2606.12068"},"observation_digest":"sha256:2f60268582cd3d59cf7b1cfbd3bed5d7166529c5d92811c9432ddac2fb155011","observation_id":"60e96050-0a3d-431a-b6aa-d38f7ce63405","resolution":{"observed_at":"2026-06-27T10:10:48.752648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2606.12924","last_updated":"2026-06-11T05:27:42Z","snapshot_observed_at":"2026-08-12T19:06:59.830988Z","submitted_at":"2026-06-11T05:27:42Z","title":"Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T07:05:31.737761Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2606.12924"},"observation_digest":"sha256:a5a64fc731635bb0928c263da0edc568bdebbca099643851349f867211096a90","observation_id":"0276a202-001e-4943-b76e-e5f0ab254512","resolution":{"observed_at":"2026-07-03T14:18:23.040793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":"2305.01937","doi":"10.48550/arxiv.2305.01937","metadata_source":"pith","pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can large language models be an alternative to human evaluations?","venue":"cs.CL","work_id":"0fb62126-21b0-4011-8072-2f3c760d9669","year":2023},"citing_paper":{"arxiv_id":"2607.08403","last_updated":"2026-07-09T12:28:39Z","snapshot_observed_at":"2026-08-16T02:16:03.733962Z","submitted_at":"2026-07-09T12:28:39Z","title":"Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T07:59:27.313453Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2607.08403"},"observation_digest":"sha256:5e376de5623cbecdb39f243e0085ee22a1ea5d2038de8dfb9d22f574794efe9d","observation_id":"7adfcf79-b2b2-488c-8df2-3c3ed7903b59","resolution":{"observed_at":"2026-07-10T08:06:57.889561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.526659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-02T15:39:36.027708Z","title":"Can large language models be an alternative to human evaluations?arXiv:2305.01937,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-15T22:25:06.811331Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.027708Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:bf4277b096439e4371dd0db64c2031a8d558696934ea9aaebc57ef4d3acf6730","observation_id":"421e9056-0d74-47db-801a-056fae582872","resolution":{"observed_at":"2026-08-02T15:39:36.027708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-01T23:43:09.099487Z","title":"2305.01937 , archiveprefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15277","last_updated":"2026-07-16T17:59:31Z","snapshot_observed_at":"2026-08-13T02:49:08.522823Z","submitted_at":"2026-07-16T17:59:31Z","title":"Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T23:43:09.099487Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2607.15277"},"observation_digest":"sha256:83c8b48d691a9ed4c73e36a1c62607c21bea6ea6274e96c550be87a72ec955c5","observation_id":"87af01b4-7f64-4967-b3e3-62c7fad841f3","resolution":{"observed_at":"2026-08-01T23:43:09.099487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-01T07:48:36.319338Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21340","last_updated":"2026-07-25T01:49:30Z","snapshot_observed_at":"2026-08-13T04:48:40.105355Z","submitted_at":"2026-07-23T14:10:58Z","title":"Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T07:48:36.319338Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2607.21340"},"observation_digest":"sha256:8a0cdfc9ccb2a0fe946884b396d3c1e01b94879189a4f06a5213da461ee4f1eb","observation_id":"dbe6a12e-e9cb-41b0-b30d-e0229ad69db4","resolution":{"observed_at":"2026-08-01T07:48:36.319338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-07-31T12:20:07.027430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28282","last_updated":"2026-07-30T14:31:07Z","snapshot_observed_at":"2026-08-15T08:53:15.216855Z","submitted_at":"2026-07-30T14:31:07Z","title":"(Towards) Scalable Reliable Automated Evaluation with Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T12:20:07.027430Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2607.28282"},"observation_digest":"sha256:5dc6a9b590fbcc627ca480e659a9c1edf16705ac098ebe1c5e58b193a73fc602","observation_id":"22d0fa57-b970-4538-8cce-554746fac9ca","resolution":{"observed_at":"2026-07-31T12:20:07.027430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-08T04:27:33.909559Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02975","last_updated":"2026-08-04T00:24:06Z","snapshot_observed_at":"2026-08-16T02:00:28.349658Z","submitted_at":"2026-08-04T00:24:06Z","title":"TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T04:27:33.909559Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2608.02975"},"observation_digest":"sha256:f1c409bc180ae7b036d81e9fbde27903d5ff4ed522d6a7e9dca9bfba2879c5e7","observation_id":"e1511161-fd7d-413a-83e0-d220d59c6e99","resolution":{"observed_at":"2026-08-08T04:27:33.909559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T14:56:40.104221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03095","last_updated":"2026-08-04T04:13:26Z","snapshot_observed_at":"2026-08-15T21:55:21.650557Z","submitted_at":"2026-08-04T04:13:26Z","title":"VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:56:40.104221Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2608.03095"},"observation_digest":"sha256:2a623652fd9365079c6c7294f086aec2553b47d4c3fa13c60cee2cc01638789d","observation_id":"d72eedcd-f0f0-402f-b029-4a84f6caaacc","resolution":{"observed_at":"2026-08-15T14:56:40.104221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-11T13:10:34.444699Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-15T09:23:37.498742Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.444699Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:815e9032b5c5966d610e1f323f6bedb8c27c2c4c42c9845267565df8283c98db","observation_id":"f360cad3-a1a7-4b5c-820d-9cabe5ff4e23","resolution":{"observed_at":"2026-08-11T13:10:34.444699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.01937/citation-record","integrity":"/paper/2305.01937/integrity","json":"/paper/2305.01937/citation-record.json","paper":"/paper/2305.01937"},"outbound":[],"paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 63 inbound Pith citation observations for arXiv:2305.01937."}