{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:441e333df179aa2813fa10aeb5b5160d7d15c62dacf52eef5a3d3cd12dfb5e64","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:56:38.270220Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:35:22.448174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T04:37:48.221956Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20274","snapshot_observed_at":"2026-08-06T15:35:22.448174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22921","last_updated":"2025-07-21T14:31:16Z","snapshot_observed_at":"2026-08-06T15:24:09.200191Z","submitted_at":"2025-07-21T14:31:16Z","title":"Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:35:22.448174Z"},"links":{"cited_paper":"/paper/2506.20274","citing_paper":"/paper/2507.22921"},"observation_digest":"sha256:d9c1a3c976128ce2c29a1e8e4ea589d6a30aee87a12597253a99d5f0ce3da565","observation_id":"a25457eb-cdac-441f-9f2e-0abbe541a5f3","resolution":{"observed_at":"2026-08-06T15:35:22.448174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"cited_work":{"arxiv_id":"2506.20274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20274","snapshot_observed_at":"2026-07-11T04:37:48.221956Z","title":"Enterprise Large Language Model Evaluation Benchmark","venue":"cs.AI","work_id":"91be2d27-b676-444c-b449-e51e338a2c54","year":2025},"citing_paper":{"arxiv_id":"2607.05638","last_updated":"2026-07-06T20:58:49Z","snapshot_observed_at":"2026-08-06T11:51:45.645813Z","submitted_at":"2026-07-06T20:58:49Z","title":"EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-11T04:31:30.304599Z"},"links":{"cited_paper":"/paper/2506.20274","citing_paper":"/paper/2607.05638"},"observation_digest":"sha256:07cadf7349d628e7cb775c8dda4b9b4bcac52376b8d3ac13d7bfdc67467da275","observation_id":"a7252636-13b0-4af4-bb2e-54afe157cff0","resolution":{"observed_at":"2026-07-11T04:37:48.225034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20274","snapshot_observed_at":"2026-08-01T21:31:51.354468Z","title":"Enterprise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16057","last_updated":"2026-08-03T18:41:38Z","snapshot_observed_at":"2026-08-07T15:14:17.111457Z","submitted_at":"2026-07-17T15:34:51Z","title":"Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T21:31:51.354468Z"},"links":{"cited_paper":"/paper/2506.20274","citing_paper":"/paper/2607.16057"},"observation_digest":"sha256:c737966abda1bad764f07d85c0534b99da4af2fc5bd824d84181351dc7b0649c","observation_id":"c4c7a638-5768-48f9-aafa-92c553d67644","resolution":{"observed_at":"2026-08-01T21:31:51.354468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20274","snapshot_observed_at":"2026-08-03T00:49:50.800327Z","title":"Enterprise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16057","last_updated":"2026-08-03T18:41:38Z","snapshot_observed_at":"2026-08-07T15:14:17.111457Z","submitted_at":"2026-07-17T15:34:51Z","title":"Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T00:49:50.800327Z"},"links":{"cited_paper":"/paper/2506.20274","citing_paper":"/paper/2607.16057"},"observation_digest":"sha256:a962a4014be21268e612b3e2818681b21d78e9441904738a6b795fda6867ad4b","observation_id":"ef1b3020-0499-453e-9b27-624dbdd4423f","resolution":{"observed_at":"2026-08-03T00:49:50.800327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20274/citation-record","integrity":"/paper/2506.20274/integrity","json":"/paper/2506.20274/citation-record.json","paper":"/paper/2506.20274"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.08351","last_updated":"2025-02-28T08:14:49Z","snapshot_observed_at":"2026-07-06T18:44:45.459377Z","submitted_at":"2024-07-11T10:03:47Z","title":"AutoBencher: Towards Declarative Benchmark Construction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08351","snapshot_observed_at":"2026-08-06T22:56:30.682305Z","title":"AutoBencher: Creating Salient, Novel, Difficult Datasets for LanguageModels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:30.682305Z"},"links":{"cited_paper":"/paper/2407.08351","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:5be25be4eb85fa989155f2017fedfe90dcc0b73d4c90285b63db01e2dd8b9480","observation_id":"1d26afb3-7c65-45cf-af7f-f3d6a4f49515","resolution":{"observed_at":"2026-08-06T22:56:30.682305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T22:56:30.775105Z","title":"Measuring Massive Multitask Language Understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:30.775105Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:9e3dbaaf9141b3d7c69470d1765ccf80e3416fa5e85a67a2088b7e4f7f437bbe","observation_id":"c6a15c97-fa48-4dbc-9ddf-8c498d482acb","resolution":{"observed_at":"2026-08-06T22:56:30.775105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T22:56:30.868056Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:30.868056Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:dfb063d8742fa61f2e482d647701617bb1322bd357a7b5555204f930f54b538f","observation_id":"3533b566-c2bd-409a-bdab-a4e8118de933","resolution":{"observed_at":"2026-08-06T22:56:30.868056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-06T22:56:30.935899Z","title":"On the Measure of Intelligence,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:30.935899Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:43c72ecfe497e743546c312403311030f8620fdc421605e4871cd3cf9a7ab06b","observation_id":"14870780-827b-4017-abfd-0c0bcb9f89e8","resolution":{"observed_at":"2026-08-06T22:56:30.935899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T22:56:31.015321Z","title":"Holistic Evaluation of Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.015321Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:418f0c58ee177bae74644d86cbb97f474ea0e110bcb03b04f28f0b35bedf588f","observation_id":"d4c7ccc0-ea19-4d32-8541-39d64b58b2c4","resolution":{"observed_at":"2026-08-06T22:56:31.015321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T22:56:31.088687Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.088687Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:02343d1b947f1a5d83fa95bd52d0e9a64f7fe0516048d8968508984975dc8b41","observation_id":"13bc31fc-f521-45a7-b742-77be8b929ce6","resolution":{"observed_at":"2026-08-06T22:56:31.088687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-06T03:17:52.286711Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-06T22:56:31.178017Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.178017Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:a7fac99bdd0ecac67b651dbaf8b660c2617514059210e13055bb31d53f7bd2ab","observation_id":"95a207cb-5792-4b9d-897f-3cfd1bc98123","resolution":{"observed_at":"2026-08-06T22:56:31.178017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2410.01553","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:39.371354Z","title":"MedQA-CS: Benchmarking Large Language Models Clinical Skills Using an AI- SCE Framework,","venue":null,"work_id":"90560799-8830-4a34-bbc0-30e7c6336ea5","year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.268371Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:0cea035c4c86d6e8a91a13c2ddf91b53c13d99240f20504a6058a369a4f25ef8","observation_id":"3fab65a6-a87f-47b2-9c49-e0a52a4737b1","resolution":{"observed_at":"2026-08-06T22:56:39.440489Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14371","last_updated":"2022-03-27T18:59:16Z","snapshot_observed_at":"2026-07-06T12:52:58.991468Z","submitted_at":"2022-03-27T18:59:16Z","title":"MedMCQA : A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14371","snapshot_observed_at":"2026-08-06T22:56:31.339236Z","title":"MedMCQA :ALarge-scaleMulti-SubjectMulti- Choice Dataset for Medical domain Question Answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.339236Z"},"links":{"cited_paper":"/paper/2203.14371","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:07312ad6580cdbaf8cc814c055dbb363bc924eebecb953fd2bd20c1af8d9653b","observation_id":"133620ab-795b-4615-978d-344bff241c31","resolution":{"observed_at":"2026-08-06T22:56:31.339236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12722","last_updated":"2024-10-16T16:31:24Z","snapshot_observed_at":"2026-07-06T19:34:41.712266Z","submitted_at":"2024-10-16T16:31:24Z","title":"WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12722","snapshot_observed_at":"2026-08-06T22:56:31.407399Z","title":"WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.407399Z"},"links":{"cited_paper":"/paper/2410.12722","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:fc528e32fe4411284d7d0ef1835ba767ccce551f631143f093977e802fb699da","observation_id":"50a3937c-3f72-4d2b-a6e3-f365929ce04a","resolution":{"observed_at":"2026-08-06T22:56:31.407399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:31.496753Z","title":"PubMedQA:ADatasetforBiomedicalResearch Question Answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.496753Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:d707b05efa9018c67e1dd6f50223ba229f162b77068cc1b6f3c1ba0f3b406573","observation_id":"64bb560a-523f-47bf-b193-92442c6303a7","resolution":{"observed_at":"2026-08-06T22:56:31.496753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08833","last_updated":"2024-04-04T15:16:57Z","snapshot_observed_at":"2026-07-06T16:07:10.648879Z","submitted_at":"2023-08-17T07:51:23Z","title":"CMB: A Comprehensive Medical Benchmark in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08833","snapshot_observed_at":"2026-08-06T22:56:31.572070Z","title":"CMB:AComprehensiveMedicalBenchmarkinChinese,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.572070Z"},"links":{"cited_paper":"/paper/2308.08833","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:5de46bee79d983cfa6c1ec790b9499eb4503b84aa74bd10bd0d8ca94d7f3ea72","observation_id":"29b04a36-3183-401a-9980-2e31a5a015ba","resolution":{"observed_at":"2026-08-06T22:56:31.572070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12659","last_updated":"2024-06-19T03:38:56Z","snapshot_observed_at":"2026-08-02T08:16:49.760328Z","submitted_at":"2024-02-20T02:16:16Z","title":"FinBen: A Holistic Financial Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12659","snapshot_observed_at":"2026-08-06T22:56:31.645688Z","title":"The FinBen: An Holistic Financial Benchmark for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.645688Z"},"links":{"cited_paper":"/paper/2402.12659","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:0679c4bbcd38e2dcdb99364eb58c5d119d5cd8b083ea250655e0132f41381cba","observation_id":"808de6df-1352-4d5b-8f3c-b91a92e3faab","resolution":{"observed_at":"2026-08-06T22:56:31.645688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09975","last_updated":"2024-12-08T06:34:31Z","snapshot_observed_at":"2026-08-04T17:59:16.724958Z","submitted_at":"2023-08-19T10:38:00Z","title":"FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09975","snapshot_observed_at":"2026-08-06T22:56:31.714437Z","title":"FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.714437Z"},"links":{"cited_paper":"/paper/2308.09975","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:52bc21c6265e5889d231f7fb3f66b009e9a31ccbaafc2b6c50ce9d2a19e2536c","observation_id":"6ac76429-9aac-4f48-a940-fcf3674db5d0","resolution":{"observed_at":"2026-08-06T22:56:31.714437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00083","last_updated":"2022-10-31T18:35:18Z","snapshot_observed_at":"2026-08-04T22:32:01.595836Z","submitted_at":"2022-10-31T18:35:18Z","title":"WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00083","snapshot_observed_at":"2026-08-06T22:56:31.776768Z","title":"WHEN FLUE MEETS FLANG: Benchmarks and Large Pre-trained Language Model for Financial Domain,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.776768Z"},"links":{"cited_paper":"/paper/2211.00083","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:147119128ea7adecb2166b0260b3023c842a7f364013cf167fbc467bbd67dcb5","observation_id":"9e6287b6-52fe-4e2e-ad5a-024229d2e6e8","resolution":{"observed_at":"2026-08-06T22:56:31.776768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09432","last_updated":"2023-02-26T10:50:09Z","snapshot_observed_at":"2026-08-07T14:13:53.966622Z","submitted_at":"2023-02-18T22:20:37Z","title":"BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09432","snapshot_observed_at":"2026-08-06T22:56:31.843525Z","title":"BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.843525Z"},"links":{"cited_paper":"/paper/2302.09432","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c01de23283fdafa641a8617593bff26491bc0c3be85868050e28faac47af2390","observation_id":"3d95e4e9-f96e-43c7-a6e9-2e31fb50e29c","resolution":{"observed_at":"2026-08-06T22:56:31.843525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12002","last_updated":"2023-05-19T21:01:20Z","snapshot_observed_at":"2026-07-06T15:29:54.267559Z","submitted_at":"2023-05-19T21:01:20Z","title":"XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12002","snapshot_observed_at":"2026-08-06T22:56:31.910853Z","title":"XuanYuan 2.0: A Large Chinese Financial Chat Model with Hundreds of Billions Parameters,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.910853Z"},"links":{"cited_paper":"/paper/2305.12002","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:f423d299e1eefca2db9b08c2c10a1ae4d3269ecbc61b4dffa992a0a6eedcec9a","observation_id":"9facde69-b28d-44f8-a3bc-1d3a07f30978","resolution":{"observed_at":"2026-08-06T22:56:31.910853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05443","last_updated":"2023-06-08T14:20:29Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-08T14:20:29Z","title":"PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05443","snapshot_observed_at":"2026-08-06T22:56:31.976188Z","title":"PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.976188Z"},"links":{"cited_paper":"/paper/2306.05443","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:2bc861ba630df78106331504c200304264acc2f0a97ad0cdb8597eba1ef494a5","observation_id":"015cc8c0-345c-45d6-8f7a-578d5c23c810","resolution":{"observed_at":"2026-08-06T22:56:31.976188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:32.063517Z","title":"LexGLUE: A Benchmark Dataset for Legal Language Understanding in English,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.063517Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:4c559e28afd1823b88e27487d760b187e363a3f711dc10acc504ce51741a4cf8","observation_id":"347076fd-8cd8-417d-a8ac-74666d142968","resolution":{"observed_at":"2026-08-06T22:56:32.063517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05224","last_updated":"2022-10-05T11:08:34Z","snapshot_observed_at":"2026-07-06T13:19:33.903865Z","submitted_at":"2022-06-10T16:51:45Z","title":"A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05224","snapshot_observed_at":"2026-08-06T22:56:32.171821Z","title":"A Multi-Task Benchmark for Korean Legal Language Understanding and Judgement Prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.171821Z"},"links":{"cited_paper":"/paper/2206.05224","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:031bea8fe72b7f31fa527e1db6ab24201bba64ba7eba60b6cb0f6972cf8eb558","observation_id":"6df36f35-623e-40c6-8368-97f94e36972a","resolution":{"observed_at":"2026-08-06T22:56:32.171821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11462","last_updated":"2023-08-20T22:08:03Z","snapshot_observed_at":"2026-08-03T20:35:47.668090Z","submitted_at":"2023-08-20T22:08:03Z","title":"LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11462","snapshot_observed_at":"2026-08-06T22:56:32.246086Z","title":"LegalBench:ACollaborativelyBuiltBenchmarkforMeasuringLegalReasoning in Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.246086Z"},"links":{"cited_paper":"/paper/2308.11462","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:cbf08d0f041fe940e763275b197292b0823febb2d2bc23d2c45856e045c37358","observation_id":"0c23ae7a-5ba5-4c5b-8fa2-fd50e0ddb26d","resolution":{"observed_at":"2026-08-06T22:56:32.246086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16289","last_updated":"2023-09-28T09:35:59Z","snapshot_observed_at":"2026-07-06T16:24:49.716011Z","submitted_at":"2023-09-28T09:35:59Z","title":"LawBench: Benchmarking Legal Knowledge of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16289","snapshot_observed_at":"2026-08-06T22:56:32.291657Z","title":"LawBench: Benchmarking Legal Knowledge of Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.291657Z"},"links":{"cited_paper":"/paper/2309.16289","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:cf69857662a359a16ba6e414ec1d96744628bf08564c30d618cdbc9463c9ff6f","observation_id":"22779890-ffe0-482e-977c-a20e2120b210","resolution":{"observed_at":"2026-08-06T22:56:32.291657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T22:56:32.344640Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.344640Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:7023eb57be3fa31a03a54c6c2e31bd598eb33e6a3362cc0c6f988dcb52a760a0","observation_id":"fd3d96f8-d9ed-4523-ad50-6c26dd1cbdd1","resolution":{"observed_at":"2026-08-06T22:56:32.344640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-02T10:07:31.047425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-06T22:56:32.401251Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.401251Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:f59f5d414a4ba0adf9db1d95c2602fd65cb400f0aea5abb3a2b1e62d200e8e52","observation_id":"b86644a4-87fc-48f9-8936-06d9325cf7b7","resolution":{"observed_at":"2026-08-06T22:56:32.401251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-03T16:27:29.675478Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-06T22:56:32.480672Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.480672Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:6a8f0082a8eacd8838fdd9e092d4eb0579a5909a6bdd536c044684720420ee0d","observation_id":"18399b1f-3b3e-4e5f-ba14-dd2a9e07f63e","resolution":{"observed_at":"2026-08-06T22:56:32.480672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:32.551128Z","title":"Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.551128Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:fda2c3d2804269c4476c6d4bec234dee47eee7055cef0714eaa22c270a1cd066","observation_id":"52654b07-9443-4d22-9af5-fcda18c54227","resolution":{"observed_at":"2026-08-06T22:56:32.551128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05179","last_updated":"2023-11-10T04:11:01Z","snapshot_observed_at":"2026-07-06T15:40:16.429096Z","submitted_at":"2023-06-08T13:21:29Z","title":"M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05179","snapshot_observed_at":"2026-08-06T22:56:32.619412Z","title":"M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.619412Z"},"links":{"cited_paper":"/paper/2306.05179","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:9d20e764286873a50e6d50784f75ed37bdf2b8a971b85e1c6f0972b1518c6c8d","observation_id":"b12a7ce0-23cb-4a3a-8113-06fea8de0083","resolution":{"observed_at":"2026-08-06T22:56:32.619412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-06T22:56:32.689119Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.689119Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:3e9b7743057e63c13af380e013628e8ff596bae51208f38ffb5e6ab56cfc76b1","observation_id":"dcb23d56-9a47-4491-989f-80b31d02cb38","resolution":{"observed_at":"2026-08-06T22:56:32.689119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13446","last_updated":"2024-12-02T20:55:15Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T00:44:04Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13446","snapshot_observed_at":"2026-08-06T22:56:32.777385Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.777385Z"},"links":{"cited_paper":"/paper/2402.13446","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c5c335fa4b8fbdbb138cf7e060b101313859aae85b48364afd612cd0d7f9ac99","observation_id":"28337c23-44fe-46f3-9c7b-8e6ed0cc1f67","resolution":{"observed_at":"2026-08-06T22:56:32.777385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-07-06T18:34:51.641949Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-06T22:56:32.834913Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.834913Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:49f65dbc340a9522166a08e5d7e013cc965d2d1cd8556aac0529663fbbeaf053","observation_id":"c3dea55e-8b96-4cb9-97c7-39ffa85710e5","resolution":{"observed_at":"2026-08-06T22:56:32.834913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02524","last_updated":"2024-02-01T22:06:51Z","snapshot_observed_at":"2026-07-06T17:11:46.822922Z","submitted_at":"2024-01-04T20:23:51Z","title":"Comprehensive Exploration of Synthetic Data Generation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02524","snapshot_observed_at":"2026-08-06T22:56:32.901945Z","title":"Comprehensive Exploration of Synthetic Data Generation: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.901945Z"},"links":{"cited_paper":"/paper/2401.02524","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:e831326f70f179ad22127f4d5d2c5d271ad90877f9647c02ab3a2e50da92042e","observation_id":"2779ed39-6f83-4b3a-9777-762e05bc2e53","resolution":{"observed_at":"2026-08-06T22:56:32.901945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-07-06T17:58:39.485508Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-08-06T22:56:32.969986Z","title":"Best Practices and Lessons Learned on Synthetic Data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:32.969986Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:0925be03e78e244358172c1e81b8853f8e7efe4b21f39ad7b4a79dc95d2309c2","observation_id":"10f2024b-5644-4319-aa21-14e4442a5c3d","resolution":{"observed_at":"2026-08-06T22:56:32.969986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T22:56:33.055751Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.055751Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:13d16fbe51f04395d0d0e56f324e2a15ef922f1c3b772ce4ee2603c818cd74d8","observation_id":"f27ffcb3-2c43-4073-842a-4fc88a577f5b","resolution":{"observed_at":"2026-08-06T22:56:33.055751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08635","last_updated":"2024-03-28T06:06:59Z","snapshot_observed_at":"2026-07-06T14:31:50.328469Z","submitted_at":"2022-12-16T18:23:43Z","title":"Self-Prompting Large Language Models for Zero-Shot Open-Domain QA","version":3},"cited_work":{"arxiv_id":"2212.08635","doi":"10.48550/arxiv.2212.08635","metadata_source":"pith","pith_arxiv_id":"2212.08635","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Self-Prompting Large Language Models for Zero-Shot Open-Domain QA","venue":"cs.CL","work_id":"851b9e46-b050-4b5d-89f9-8ba9367824c9","year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.122478Z"},"links":{"cited_paper":"/paper/2212.08635","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:6873ea637b8f0293fe22022945e7ae8d193a1e5bd54ca95208ccfe0812ead884","observation_id":"23d3d0b9-f0db-4648-8fef-8789b05f1e9b","resolution":{"observed_at":"2026-08-06T22:56:39.032496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:56:33.202456Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.202456Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c880f244cbc92cd8f96553ce4480b86a7ce924e8fbe0dcbedcfc45b00a3d057a","observation_id":"5a2cbb23-2130-4378-9268-c3eaa9f2f25c","resolution":{"observed_at":"2026-08-06T22:56:33.202456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:33.269035Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.269035Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:23969304199f6808cab4a5b039c50041517bf4274ec7ebfa3827351f3842df8f","observation_id":"3080cb20-447a-448d-bb40-8afde03381d6","resolution":{"observed_at":"2026-08-06T22:56:33.269035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08072","last_updated":"2024-12-17T07:30:54Z","snapshot_observed_at":"2026-07-06T19:01:01.881616Z","submitted_at":"2024-08-15T10:44:38Z","title":"I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08072","snapshot_observed_at":"2026-08-06T22:56:33.340671Z","title":"I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self- Enhancement Paradigm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.340671Z"},"links":{"cited_paper":"/paper/2408.08072","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:b7c443828fb1fad027cf6aaa083eb6a96096ebf601c8941d0537c57282275d7e","observation_id":"bb953800-ef19-4e2d-836e-2652df147c47","resolution":{"observed_at":"2026-08-06T22:56:33.340671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-06T22:56:33.409397Z","title":"Self-Rewarding Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.409397Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:e1b89391fc8cb0c7fcdc383c24d96ea500d9f8805fcecc281eebdbfedd99d3c7","observation_id":"d579f04e-ef9b-4f6d-8c31-8dd701c90115","resolution":{"observed_at":"2026-08-06T22:56:33.409397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12086","last_updated":"2024-10-25T12:04:26Z","snapshot_observed_at":"2026-07-06T17:18:52.483885Z","submitted_at":"2024-01-22T16:24:43Z","title":"West-of-N: Synthetic Preferences for Self-Improving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12086","snapshot_observed_at":"2026-08-06T22:56:33.472641Z","title":"West-of-N: Synthetic Preferences for Self-Improving Reward Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.472641Z"},"links":{"cited_paper":"/paper/2401.12086","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:8a21ba6efbda233340d727a72d47d946506974f796b5585b978584e2c99888bf","observation_id":"139a865c-3c99-47d3-bdc5-87120610f228","resolution":{"observed_at":"2026-08-06T22:56:33.472641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-07-06T18:53:00.965448Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-06T22:56:33.549019Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a- Meta-Judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.549019Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:bbf5845daf28d863a0a3d88eb2e27e48c29aae36c336af1266a6f47e24365b4d","observation_id":"c95bc744-5fe4-4afd-8009-e645732914b9","resolution":{"observed_at":"2026-08-06T22:56:33.549019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03188","last_updated":"2023-08-30T03:47:34Z","snapshot_observed_at":"2026-07-06T16:03:10.517945Z","submitted_at":"2023-08-06T18:38:52Z","title":"Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03188","snapshot_observed_at":"2026-08-06T22:56:33.612212Z","title":"Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.612212Z"},"links":{"cited_paper":"/paper/2308.03188","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:a0e5a094f450154e4f349aa0a2aa9b6ea7346b4d845a1ff23f9bf5c7e305c871","observation_id":"11769962-4521-4a78-a9fb-7147203d8028","resolution":{"observed_at":"2026-08-06T22:56:33.612212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12353","last_updated":"2023-03-17T00:52:56Z","snapshot_observed_at":"2026-07-06T14:09:01.413494Z","submitted_at":"2022-10-22T05:04:54Z","title":"Leveraging Large Language Models for Multiple Choice Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12353","snapshot_observed_at":"2026-08-06T22:56:33.668975Z","title":"Leveraging Large Language Models for Multiple Choice Question Answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.668975Z"},"links":{"cited_paper":"/paper/2210.12353","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:39d6119da481275aaa60957f7803d2ee68ea722de178e73f14d40d1115e84b0f","observation_id":"49aad555-c701-4ef5-80e8-962f6355f413","resolution":{"observed_at":"2026-08-06T22:56:33.668975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14334","last_updated":"2022-06-13T05:04:53Z","snapshot_observed_at":"2026-08-03T04:20:54.522222Z","submitted_at":"2022-05-28T05:02:31Z","title":"Teaching Models to Express Their Uncertainty in Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14334","snapshot_observed_at":"2026-08-06T22:56:33.793508Z","title":"Teaching Models to Express Their Uncertainty in Words,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.793508Z"},"links":{"cited_paper":"/paper/2205.14334","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c48429d2f35bae06b50adc694428f156c19d7b173c63fbad44356c79cf6eb204","observation_id":"18075e64-31c7-42fe-a470-82412368bdc9","resolution":{"observed_at":"2026-08-06T22:56:33.793508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:33.873613Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.873613Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:be105c02a7458ca3693f87ce5d61bf41be163d7f46aafaf73c69d580745db355","observation_id":"751f1980-b1fa-4945-b2dd-925e99eee639","resolution":{"observed_at":"2026-08-06T22:56:33.873613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14924","last_updated":"2024-09-23T11:20:20Z","snapshot_observed_at":"2026-07-06T19:20:23.589464Z","submitted_at":"2024-09-23T11:20:20Z","title":"Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14924","snapshot_observed_at":"2026-08-06T22:56:33.954784Z","title":"Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:33.954784Z"},"links":{"cited_paper":"/paper/2409.14924","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:147bd6a6b9d91f9023108d967d533f142f08f855adf0d6f7c8f40d4464d4fdbf","observation_id":"87cfb609-01c4-4750-a836-71ea6394694f","resolution":{"observed_at":"2026-08-06T22:56:33.954784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05591","last_updated":"2025-04-09T09:09:37Z","snapshot_observed_at":"2026-08-06T04:47:05.686440Z","submitted_at":"2024-09-09T13:20:31Z","title":"MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05591","snapshot_observed_at":"2026-08-06T22:56:34.045454Z","title":"MemoRAG: Moving towards Next-Gen RAG Via Memory-Inspired Knowledge Discovery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.045454Z"},"links":{"cited_paper":"/paper/2409.05591","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:86d3c0f241c03f665c2458518604679dcca031c43b23db0bde8df7ae843ed560","observation_id":"b5e3b33e-fcfb-4fc6-981f-52e92037ccf3","resolution":{"observed_at":"2026-08-06T22:56:34.045454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14403","last_updated":"2024-03-28T06:45:11Z","snapshot_observed_at":"2026-08-04T09:23:59.079378Z","submitted_at":"2024-03-21T13:52:30Z","title":"Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14403","snapshot_observed_at":"2026-08-06T22:56:34.123277Z","title":"Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.123277Z"},"links":{"cited_paper":"/paper/2403.14403","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:84f9be83b21bbca7601ed0bdd57279ffafe69004eb90e1ae4cd51ab228ae7ef9","observation_id":"3bb223b9-f6ff-4e39-bc45-c28adff200c8","resolution":{"observed_at":"2026-08-06T22:56:34.123277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-06T22:56:34.211230Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.211230Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:a9c051c6f8c5b10a3faa4e2497e909c9ebd87bbe67a29e41f5c97863fb246ff3","observation_id":"b02df137-4093-4e14-a4bf-7259a7925728","resolution":{"observed_at":"2026-08-06T22:56:34.211230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05002","last_updated":"2023-10-08T04:22:33Z","snapshot_observed_at":"2026-07-31T17:37:37.137449Z","submitted_at":"2023-10-08T04:22:33Z","title":"Self-Knowledge Guided Retrieval Augmentation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05002","snapshot_observed_at":"2026-08-06T22:56:34.287298Z","title":"Self-Knowledge Guided Retrieval Augmentation for Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.287298Z"},"links":{"cited_paper":"/paper/2310.05002","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:e1dc8d2efa2c8e8f122a8d196043b5a256192aa7e6a93fad31773b197d5612e7","observation_id":"3896673e-55e5-450b-a4ae-94d15b69afc7","resolution":{"observed_at":"2026-08-06T22:56:34.287298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01558","last_updated":"2024-05-05T15:58:24Z","snapshot_observed_at":"2026-08-04T12:45:28.903998Z","submitted_at":"2023-10-02T18:52:35Z","title":"Making Retrieval-Augmented Language Models Robust to Irrelevant Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01558","snapshot_observed_at":"2026-08-06T22:56:34.381084Z","title":"Making Retrieval-Augmented Language Models Robust to Irrelevant Context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.381084Z"},"links":{"cited_paper":"/paper/2310.01558","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:903196f36c1841957b1cd614fc54708165bc90f7fa20c3c4f2632979f7816cb2","observation_id":"eee59b13-8eee-4afb-aaac-d1d8f7ddc305","resolution":{"observed_at":"2026-08-06T22:56:34.381084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.242","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:38.741781Z","title":"Search Augmented Instruction Learning,","venue":null,"work_id":"5e0faeac-322e-40ae-8803-895e81fd03fe","year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.500769Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:7ff7606450f25f15d7c2e9cd7cf93806d73bd9a4c56c4f1f61d94e3911af890f","observation_id":"78d826a8-66a8-442f-9236-448efac74d03","resolution":{"observed_at":"2026-08-06T22:56:38.781049Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15884","last_updated":"2024-10-07T02:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-29T04:36:39Z","title":"Corrective Retrieval Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15884","snapshot_observed_at":"2026-08-06T22:56:34.594451Z","title":"Corrective Retrieval Augmented Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.594451Z"},"links":{"cited_paper":"/paper/2401.15884","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:47e9ba8ae54fab8f4b6fe9b6321bd4adef2486d720bb8d7389038d6f4cb481f8","observation_id":"d65dc77f-5b7b-46b8-9715-4b0593eafdd6","resolution":{"observed_at":"2026-08-06T22:56:34.594451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08808","last_updated":"2024-08-20T02:32:58Z","snapshot_observed_at":"2026-07-06T19:01:36.868186Z","submitted_at":"2024-08-16T15:41:43Z","title":"Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08808","snapshot_observed_at":"2026-08-06T22:56:34.674305Z","title":"Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.674305Z"},"links":{"cited_paper":"/paper/2408.08808","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:f24b88ac141cba8afe28a1212ab00eec2b93e4cb8a2a9d1c708042dd8c7cc248","observation_id":"4fdc0035-c199-4ab5-a018-885e7c3b3cd1","resolution":{"observed_at":"2026-08-06T22:56:34.674305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:34.783848Z","title":"LLM-as-a-Judge: Rethinking Model-Based Evaluations in Text Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.783848Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:80be5f212a4269a3228838604dda527332fd0a450e68482ea27a4eb2eed5461b","observation_id":"506c000c-7813-4bb1-afb3-7e68efabdd04","resolution":{"observed_at":"2026-08-06T22:56:34.783848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:34.892126Z","title":"EvaluatingtheEffectivenessofLLM-Evaluators(akaLLM-as-Judge),","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.892126Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:5fc95c9de74fff472dec34dc87bed788244ba679399b0d59820d351b3ffb0f4f","observation_id":"6b79e00d-3d69-47dd-a684-e6f215c232dd","resolution":{"observed_at":"2026-08-06T22:56:34.892126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:34.970117Z","title":"From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:34.970117Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:0def9e01abcdb7c752aff36c884d8d490b3f13ed498b0b572bf5f0bc06c73396","observation_id":"2adcbb2b-ad9c-4e78-9a31-c5ba286a14cf","resolution":{"observed_at":"2026-08-06T22:56:34.970117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-06T22:56:35.063138Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.063138Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:d04e752bbb0b134fb0d96cc89c341627b3578dadfddef75ab0d15847d7eed3fa","observation_id":"2e9102f2-ea1c-4a32-b45b-7953a01a4fe7","resolution":{"observed_at":"2026-08-06T22:56:35.063138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-07T12:09:31.277517Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-06T22:56:35.136253Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.136253Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:e3ee4b9199a902450d0bc1c2e1690087f2d8aba3b9f5cc005180c4571eb0934e","observation_id":"bb5690b6-7ff5-447d-a462-7b390e3e9370","resolution":{"observed_at":"2026-08-06T22:56:35.136253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07641","last_updated":"2024-04-16T04:50:08Z","snapshot_observed_at":"2026-08-06T21:10:28.450711Z","submitted_at":"2023-10-11T16:38:11Z","title":"Evaluating Large Language Models at Evaluating Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07641","snapshot_observed_at":"2026-08-06T22:56:35.224892Z","title":"Evaluating Large Language Models at Evaluating Instruction Following,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.224892Z"},"links":{"cited_paper":"/paper/2310.07641","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:6f13ec2b23c6696cf6296375e5f9ad5bc7779ac48130955dbc3b20a275e3dd75","observation_id":"c167b644-fae9-4b4e-92d4-a899c6265f0a","resolution":{"observed_at":"2026-08-06T22:56:35.224892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-03T19:35:11.838629Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-06T22:56:35.306523Z","title":"Large Language Models are not Fair Evaluators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.306523Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:977938474e3abd07a6251f3839435fb2a91c041aa8abc34c04b5107c924de887","observation_id":"2912892d-3c8e-4ef7-ae87-74764814edad","resolution":{"observed_at":"2026-08-06T22:56:35.306523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05193","last_updated":"2025-04-07T14:42:01Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:50:47Z","title":"RevisEval: Improving LLM-as-a-Judge via Response-Adapted References","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05193","snapshot_observed_at":"2026-08-06T22:56:35.381259Z","title":"RevisEval: Improving LLM-as-a-Judge via Response-Adapted References,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.381259Z"},"links":{"cited_paper":"/paper/2410.05193","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:97b4a884a7a11e20378d94caad0d02cc998f65ae29f04af233cd218658fc453b","observation_id":"830957ef-80a0-49c4-91f6-9dcb9d56bcfd","resolution":{"observed_at":"2026-08-06T22:56:35.381259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-06T22:56:35.487517Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.487517Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:047fedc88fd903ffc3f74a0e98d451f2b458db7dda489a7d0064ff9289a3d33d","observation_id":"585fe516-60ce-4817-84f5-f3f725e0c0a8","resolution":{"observed_at":"2026-08-06T22:56:35.487517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T22:56:35.554583Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.554583Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:649106fc212b4fece74077e79e28c617acb84b46611e29b7b4fdc439853b8517","observation_id":"5773381e-02e9-499a-b183-8c697cc39ff6","resolution":{"observed_at":"2026-08-06T22:56:35.554583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-05T13:54:21.157165Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-08-06T22:56:35.666171Z","title":"A Survey on Evaluation of Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.666171Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:f4dd08bd368117e421a59c652710eecae5b77055d3cc2770aa5a5ee6b94ac81f","observation_id":"4db0726c-e272-4c73-8765-36a3e1716803","resolution":{"observed_at":"2026-08-06T22:56:35.666171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:35.747231Z","title":"A Revision of Bloom’s Taxonomy: An Overview,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.747231Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:47d170de6870282fa797e04d7ed69f17aaa42ab49d801d97d0e0ad974fc7e7e3","observation_id":"38e4ebf3-57ab-4589-864d-4d7ac14a32d5","resolution":{"observed_at":"2026-08-06T22:56:35.747231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:35.835468Z","title":"Bloom’s Taxonomy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.835468Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:4be5c8d057252389729dc23f6a86ce6e1b73487601aad8e82a5020bbdf432445","observation_id":"72f2525d-010e-42d6-ae0a-33d141fcea04","resolution":{"observed_at":"2026-08-06T22:56:35.835468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:35.915905Z","title":"Confluence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.915905Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:df10768376708a4f6b76487c7a0634c827c9dfb6c69370752610183d500fdf7d","observation_id":"86e53d7c-5187-4191-b5ce-34ccb0d64f6b","resolution":{"observed_at":"2026-08-06T22:56:35.915905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:35.964164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.964164Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:edfb208b0803aaecac7bb86d69d7f7b48afc4bbd1eff1c9663864808aeb5acde","observation_id":"46327f36-fe8a-466c-8d28-e594c65326f8","resolution":{"observed_at":"2026-08-06T22:56:35.964164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.038525Z","title":"Paraphrase Mining — Sentence Transformers documentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.038525Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:290ca6694d4a2633c9b3415ed1d024c4f7954b0e691b79bd20ffd314a1fa1647","observation_id":"1d2dbb9d-74a1-44c4-80ac-6d1e777b1a40","resolution":{"observed_at":"2026-08-06T22:56:36.038525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:56:36.198741Z","title":"GPT-4 Technical Report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.198741Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:969686de0319b799bd6fe7d114535a96b7fc3a60687d4d52e3462727bda43fb8","observation_id":"18b27fb4-82a0-4593-b28e-af65f5e1d480","resolution":{"observed_at":"2026-08-06T22:56:36.198741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.250422Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.250422Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:5fbece176d838298674e2bf87eb9775d51bbe5379f9d59a968cccf813efb11ff","observation_id":"089737ed-e306-4e46-a3ca-cbaf44920980","resolution":{"observed_at":"2026-08-06T22:56:36.250422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.315106Z","title":"LLMEvaluationMetrics:TheUltimateLLMEvaluationGuide-ConfidentAI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.315106Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:4ac483ab1c44e55487937911b10d87b4513c938a94b7b80e7934e04e15618986","observation_id":"9ad23cb7-dbf2-4129-aa3e-5d74544709f0","resolution":{"observed_at":"2026-08-06T22:56:36.315106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.395797Z","title":"Bleu: a Method for Automatic Evaluation of Machine Translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.395797Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:b6ae099bc04f015d1d0a45dfc1f5ae688a3fae458f64517ec0a59a89d8a56972","observation_id":"cf5c50a2-fd44-403a-b187-7191d155b612","resolution":{"observed_at":"2026-08-06T22:56:36.395797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.493280Z","title":"ROUGE:APackageforAutomaticEvaluationofSummaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.493280Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:df69a5d68749fe74e705e9aa088a14b97a3c44743966d6bf7c7e5bdd472086ff","observation_id":"b630f755-e53b-4170-92bd-7e9b50a473a6","resolution":{"observed_at":"2026-08-06T22:56:36.493280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.620781Z","title":"BLEU is Not Suitable for the Evaluation of Text Simplification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.620781Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:221d56c0b3996e2ede6e03434f51070c1f3c48f089b634c782e90a3c4f512fe6","observation_id":"8c5a74c5-a64b-458c-b74e-ff1663f8583a","resolution":{"observed_at":"2026-08-06T22:56:36.620781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T22:56:36.720000Z","title":"BERTScore: Evaluating Text Generation with BERT,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.720000Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:84e0c205f187d14fb2f0d762a9f21ba41fdabcf24f58b4d82141b100f4b2a09f","observation_id":"8a80553d-6cf4-42e1-b187-e7343f5001b0","resolution":{"observed_at":"2026-08-06T22:56:36.720000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11520","last_updated":"2021-10-27T11:16:01Z","snapshot_observed_at":"2026-08-06T08:16:58.817744Z","submitted_at":"2021-06-22T03:20:53Z","title":"BARTScore: Evaluating Generated Text as Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11520","snapshot_observed_at":"2026-08-06T22:56:36.789128Z","title":"BARTScore: Evaluating Generated Text as Text Generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.789128Z"},"links":{"cited_paper":"/paper/2106.11520","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:93c8151529cccf00211a3542abc5d4f0674284f2c0639edb3867f02ed6e46c54","observation_id":"684f0aa2-8018-4b07-b488-696038a83d3a","resolution":{"observed_at":"2026-08-06T22:56:36.789128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01383","last_updated":"2025-05-14T06:05:53Z","snapshot_observed_at":"2026-08-05T04:27:47.515943Z","submitted_at":"2024-02-02T13:06:35Z","title":"LLM-based NLG Evaluation: Current Status and Challenges","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01383","snapshot_observed_at":"2026-08-06T22:56:36.905484Z","title":"LLM-based NLG Evaluation: Current Status and Challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.905484Z"},"links":{"cited_paper":"/paper/2402.01383","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:b09e9cce6589c55c314582202b58dcc4fd52ba8550c76a97ac40946a21f356d3","observation_id":"e44ed20f-142a-4064-93a1-b9575306b251","resolution":{"observed_at":"2026-08-06T22:56:36.905484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06588","last_updated":"2023-04-13T14:51:40Z","snapshot_observed_at":"2026-07-06T15:15:22.209954Z","submitted_at":"2023-04-13T14:51:40Z","title":"ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06588","snapshot_observed_at":"2026-08-06T22:56:36.982426Z","title":"ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.982426Z"},"links":{"cited_paper":"/paper/2304.06588","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:f4950fb56f40f8a637f0b586d09acfee56504b0238d8e7f73b971ce88ea09cfd","observation_id":"8f5e9a53-28fc-494a-b246-5746ac0c8b23","resolution":{"observed_at":"2026-08-06T22:56:36.982426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:37.051830Z","title":"ChatGPT Outperforms Crowd-Workers for Text- Annotation Tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.051830Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:fd20ceeca4c73dcaa84195519df5e687f226c319104d82d8b50f73d8570deacd","observation_id":"f4e1cc66-fff6-4764-9e7c-c52b7b34ad10","resolution":{"observed_at":"2026-08-06T22:56:37.051830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:37.176977Z","title":"ChatGPT vs. Crowdsourcing vs. Experts: Annotating Open-Domain Conversations with Speech Functions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.176977Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:7cf435ecfabe90529738f8204c1dd94ea71c9355a4c3b0ed80eac6a7529361b6","observation_id":"11f977b2-5018-4b10-ac06-6977040725fa","resolution":{"observed_at":"2026-08-06T22:56:37.176977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12947","last_updated":"2023-10-19T21:11:53Z","snapshot_observed_at":"2026-07-06T15:30:37.936757Z","submitted_at":"2023-05-22T11:46:32Z","title":"ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness","version":2},"cited_work":{"arxiv_id":"2305.12947","doi":"10.48550/arxiv.2305.12947","metadata_source":"pith","pith_arxiv_id":"2305.12947","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness","venue":"cs.CL","work_id":"ac9d9453-356f-44bc-beb8-1985259dff02","year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.255627Z"},"links":{"cited_paper":"/paper/2305.12947","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:af267261d11b598d192969068350a4bf5d8017bdaa3f2b22c57d7d3e654a727f","observation_id":"c4a18303-5f35-43f6-b77c-6932dd65f3fd","resolution":{"observed_at":"2026-08-06T22:56:38.425927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:37.367742Z","title":"30, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.367742Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:53031426a3d362588bfdbe097eadf5d6eaedb10c62ea53111ded97d17e370ede","observation_id":"aa05dce6-174c-49f4-b14b-12cfb2f233ba","resolution":{"observed_at":"2026-08-06T22:56:37.367742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:40.951975Z","title":"Toxicity","venue":null,"work_id":"20386482-0e79-4a34-819f-a280bc9f9600","year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.459003Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:269608f07aee43e8129161257373ec929077f98ad04d44a9cb461d349847c474","observation_id":"527bb0bd-efe9-4575-9c3f-37f1351c591c","resolution":{"observed_at":"2026-08-06T22:56:41.053684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:40.673569Z","title":"29, 2024","venue":null,"work_id":"e0f35860-3f30-443b-8e8b-0a1d50adc404","year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.539722Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:cdd042e55812f7d945fd7672caba53dfebdd8c49ab405e035daf8e258038e082","observation_id":"c325eaa4-213a-464d-861e-286a8aebfbfc","resolution":{"observed_at":"2026-08-06T22:56:40.828319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:40.557236Z","title":"Hallucination","venue":null,"work_id":"6b17737f-bb04-4001-833c-e5b2968714af","year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.632673Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c7c778c6b30695743fb4f17b2b17ad27fa4bade548faaa29a87c15911332ba36","observation_id":"b11d65e7-f995-402c-8ecc-f316cf02f38a","resolution":{"observed_at":"2026-08-06T22:56:40.638498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:40.404864Z","title":"Spearman’s rank correlation coefficient,","venue":null,"work_id":"e4bb0557-354a-43df-afb1-23f8489253f9","year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.712094Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:ff5f1f94ef220f1f0730b8c9a822067039372040557de175b26c6706a298fe46","observation_id":"b80432e5-4c9f-4d81-93ac-861219ef2bbe","resolution":{"observed_at":"2026-08-06T22:56:40.486401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:40.255293Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models,","venue":null,"work_id":"51335909-2eec-4c42-af54-4949abbf7e12","year":2025},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.849046Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:5253eedeb82c20b4079df06b6ed7c38245a9d0f316fbb0eac681732106be039f","observation_id":"68a7b921-f1ae-4c99-9c67-dec9f938cef5","resolution":{"observed_at":"2026-08-06T22:56:40.318963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:40.105437Z","title":"LLaMA 3.3,","venue":null,"work_id":"04ed881f-87bd-41e3-a664-85128d8382b6","year":null},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:37.933498Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c24e747128e04001eece5a99ac808de41da948c484cdebba6e5b7e9381dcc2bb","observation_id":"99149d66-b16d-4746-b82c-d479a7faab87","resolution":{"observed_at":"2026-08-06T22:56:40.180796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:39.971418Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,","venue":null,"work_id":"7b5dd521-5612-430e-8465-768b626ff863","year":2025},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:38.011275Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:fa84d8cb03b5ae9a690a3558cbaad9a22784778f6f06e28c1e08d69f4386a292","observation_id":"f4985e23-4100-45a8-807b-7053c4c0bbbc","resolution":{"observed_at":"2026-08-06T22:56:40.029006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:56:38.092131Z","title":"Qwen2.5 Technical Report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:38.092131Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:5149bcd750c0732613e569dc517dea52e326b99ea4bec90a6d990e2ad06c133e","observation_id":"899a27e9-f9fa-47c0-a575-8ab80fa01051","resolution":{"observed_at":"2026-08-06T22:56:38.092131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-07-06T20:35:16.369243Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-08-06T22:56:38.165147Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:38.165147Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:281bd3a54988a9be5505929b895faf10b9ab6e2fecfa7714a1fd3df344e3d043","observation_id":"e8087ad6-47ac-4231-a96a-0f83174f9110","resolution":{"observed_at":"2026-08-06T22:56:38.165147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:39.839162Z","title":null,"venue":null,"work_id":"1ad4555c-ba18-426a-876c-2c970e03276d","year":null},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:38.244953Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:77af5931d34108a4864942ad6379b458e3fb26a427c89bb70cbbf6342f4a9387","observation_id":"90c5c1cc-d775-477e-a72f-2e845f4c4ce9","resolution":{"observed_at":"2026-08-06T22:56:39.900943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:39.696421Z","title":"This method has been incorporated into the DeepEval package [72]","venue":null,"work_id":"7d287580-c4e5-4972-b6f3-04066e5cfd1e","year":null},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:38.270220Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:c23e1bfcc66f927cb31159367ab9e971f530ac921e1dbfb1f43d46e340d847b9","observation_id":"79aebb99-6b79-4ce5-a16c-b80d5c7d3f40","resolution":{"observed_at":"2026-08-06T22:56:39.775138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:56:36.111401Z","title":"Available: https://sbert.net/examples/applications/paraphrase-mining/README.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:36.111401Z"},"links":{"citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:2a55c0298e667e42568dba91053736d46230ac00d32ff4c5a7d9ec549bde90e5","observation_id":"24b3ca47-ad68-4b1e-82ab-f56a432a0b7e","resolution":{"observed_at":"2026-08-06T22:56:36.111401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":4,"verified_fuzzy":8},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 4 inbound Pith citation observations for arXiv:2506.20274."}