{"as_of":"2026-08-21T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:690333445e012b18eb0028c4c35edf0aad57a5921236064a215582a435bac887","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:45:45.853992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":29,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-17T12:10:42.248005Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2305.17926"},"observation_digest":"sha256:2427c88c1361fae734d1b400968725850604a5780e6b29950baeba52776b5efa","observation_id":"c7f2840b-0625-461b-b166-3e9f954e8a34","resolution":{"observed_at":"2026-05-17T12:10:42.437190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2403.03920","last_updated":"2024-03-06T18:29:18Z","snapshot_observed_at":"2026-08-06T13:47:15.957564Z","submitted_at":"2024-03-06T18:29:18Z","title":"Enhancing Instructional Quality: Leveraging Computer-Assisted Textual Analysis to Generate In-Depth Insights from Educational Artifacts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-24T03:07:32.103513Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2403.03920"},"observation_digest":"sha256:8182f0e435a17e9b1d6eeecec679de2db58327f2d2d729445354f5ced7cf3c26","observation_id":"8f028035-56a9-427c-97d9-e0cc4538cea5","resolution":{"observed_at":"2026-05-24T03:08:48.314734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2405.19088","last_updated":"2026-04-15T02:26:56Z","snapshot_observed_at":"2026-07-06T18:21:57.091728Z","submitted_at":"2024-05-29T13:51:43Z","title":"Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T00:52:52.056076Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2405.19088"},"observation_digest":"sha256:d7d58643fbb3eb9d829cb65102d898f1806031677ceeb2b62bca3246e1b59bcd","observation_id":"ca9376c1-50fb-4a7c-a3a3-1d12180566b2","resolution":{"observed_at":"2026-05-24T00:53:40.681101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-12T16:58:26.711052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13045","last_updated":"2025-02-08T02:56:02Z","snapshot_observed_at":"2026-08-18T21:20:47.112997Z","submitted_at":"2024-11-20T05:30:15Z","title":"Explainable LLM-driven Multi-dimensional Distillation for E-Commerce Relevance Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:58:26.711052Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2411.13045"},"observation_digest":"sha256:ef92dd4ef90bbcab4413ecf8045e57b799816dfa915d066bc7e6feb7f60178af","observation_id":"5a615d9c-6817-456f-8d16-de2b6575f431","resolution":{"observed_at":"2026-08-12T16:58:26.711052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-12T15:26:45.128901Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14251","last_updated":"2025-05-28T00:04:45Z","snapshot_observed_at":"2026-08-16T18:16:04.602385Z","submitted_at":"2024-11-21T15:57:02Z","title":"Natural Language Reinforcement Learning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:26:45.128901Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2411.14251"},"observation_digest":"sha256:27d120423464e1b4aeedda3503154307ae306cc735b8c9076bb8fdd215b16a89","observation_id":"9fe5d0bf-c40b-462d-a63d-2e5ab29e633f","resolution":{"observed_at":"2026-08-12T15:26:45.128901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-20T12:52:29.141935Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:714c5355e7b3d25c58ea01a6828c3231c7cc8a33aa34dc06e8103e49097957de","observation_id":"01a30c9f-f494-458c-9fd3-d7f26a3bae36","resolution":{"observed_at":"2026-05-23T17:35:44.114172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-12T10:18:01.931025Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19456","last_updated":"2024-11-29T03:57:26Z","snapshot_observed_at":"2026-08-17T03:02:12.127130Z","submitted_at":"2024-11-29T03:57:26Z","title":"Beyond Surface Structure: A Causal Assessment of LLMs' Comprehension Ability","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:18:01.931025Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2411.19456"},"observation_digest":"sha256:377332162b9955b98d931adeb1e5260f1d32a8e8941885276e672e94ca7b62ea","observation_id":"0221db6b-c1de-4d69-a5e6-f1612d27294a","resolution":{"observed_at":"2026-08-12T10:18:01.931025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:0ea15549a9d8175600a3962c6c69f95a984aabb8d743c5b7a7a566efd08701c0","observation_id":"42f1b288-458c-4997-8b0d-d16089b18662","resolution":{"observed_at":"2026-05-11T23:08:35.657694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-11T11:40:13.855139Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-17T11:16:52.279469Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.855139Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:b0a53594efb017ca72d37d8a38ada5d8b027b13f12de153ad3f5191b9ea362e9","observation_id":"bfede6a1-675d-4638-943a-23621287a16e","resolution":{"observed_at":"2026-08-11T11:40:13.855139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-10T14:13:21.969582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-16T22:54:05.918291Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.969582Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:371cf7928eef0475b98d29a56411924a7026712968793715535e1d44815a163a","observation_id":"4774d543-5df4-4e24-886f-d26bcb351cba","resolution":{"observed_at":"2026-08-10T14:13:21.969582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-08T22:36:35.342852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04498","last_updated":"2025-02-06T20:57:36Z","snapshot_observed_at":"2026-08-13T05:00:36.654030Z","submitted_at":"2025-02-06T20:57:36Z","title":"Verifiable Format Control for Large Language Model Generations","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:36:35.342852Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2502.04498"},"observation_digest":"sha256:540a3b3c6e393c2ce56d4a8760998cedcfc4be65c39e2f8f42fd0e79b68e42dd","observation_id":"21bfd10f-c0a8-4abf-8fd7-24edbe2b6879","resolution":{"observed_at":"2026-08-08T22:36:35.342852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2503.23137","last_updated":"2026-04-15T02:38:45Z","snapshot_observed_at":"2026-08-12T16:01:25.076287Z","submitted_at":"2025-03-29T16:08:51Z","title":"When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T22:38:35.969273Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2503.23137"},"observation_digest":"sha256:05846bb3e6a4fa06598ae312d3645ae372c9e39443720e9ed91818a668a5531b","observation_id":"3dd17b74-4b40-49ce-88b7-23af43d7aca5","resolution":{"observed_at":"2026-05-22T22:42:13.657674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-16T11:45:45.853992Z","title":"Pandalm: An automatic evaluation benchmark for llm instruc- tion tuning optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.853992Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:3f88a27563b02773572b96ed6724c2f086d83b55b2baf96292ddbd65326b91ed","observation_id":"6196b8d1-9e22-4a3a-9b08-9494653f8cda","resolution":{"observed_at":"2026-08-16T11:45:45.853992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-16T10:21:26.088890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18413","last_updated":"2025-04-25T15:14:25Z","snapshot_observed_at":"2026-08-18T16:11:20.779302Z","submitted_at":"2025-04-25T15:14:25Z","title":"An Empirical Study of Evaluating Long-form Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:21:26.088890Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2504.18413"},"observation_digest":"sha256:182639f07611af075bba5e76298b521cf1c9a8c0a11d1ef94849a3a839b352e0","observation_id":"ee0e2d8b-5bfd-4410-a804-db642cd30dc2","resolution":{"observed_at":"2026-08-16T10:21:26.088890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-16T01:06:34.317570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02078","last_updated":"2025-05-04T12:06:47Z","snapshot_observed_at":"2026-08-21T10:29:03.057119Z","submitted_at":"2025-05-04T12:06:47Z","title":"LecEval: An Automated Metric for Multimodal Knowledge Acquisition in Multimedia Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T01:06:34.317570Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.02078"},"observation_digest":"sha256:672f467a7f75457b790423da51cb136426c066c9ee488436288f8609d665f774","observation_id":"8856035a-d684-4cf4-bcbf-bc7eb0087672","resolution":{"observed_at":"2026-08-16T01:06:34.317570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T23:58:42.110600Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03475","last_updated":"2025-05-29T08:23:44Z","snapshot_observed_at":"2026-08-18T12:50:14.251276Z","submitted_at":"2025-05-06T12:28:50Z","title":"am-ELO: A Stable Framework for Arena-based LLM Evaluation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T23:58:42.110600Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.03475"},"observation_digest":"sha256:91799996d2944864b73641a057a66d0f461da4d28ab8421021757b58fbc88f12","observation_id":"2ca64449-a955-447c-9d9c-03e911f9d531","resolution":{"observed_at":"2026-08-15T23:58:42.110600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T20:50:10.690874Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-18T20:01:50.393122Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.690874Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9521715551b95c64ac77517263e6524fc016077d26729c3d3e87386356c7583e","observation_id":"d1a924e3-b953-46bb-b261-45d2f70bc1f7","resolution":{"observed_at":"2026-08-15T20:50:10.690874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T20:52:15.971613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11887","last_updated":"2025-05-17T07:44:54Z","snapshot_observed_at":"2026-08-18T08:22:00.747133Z","submitted_at":"2025-05-17T07:44:54Z","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:15.971613Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.11887"},"observation_digest":"sha256:59d79cb9e15b38c84cd3182d50304cda97bad02d8d76d4aa197a741f4545e426","observation_id":"31e83056-c601-4f4b-9e4c-0b4f6bc2ea90","resolution":{"observed_at":"2026-08-15T20:52:15.971613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T20:17:05.526187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13794","last_updated":"2025-05-20T01:02:29Z","snapshot_observed_at":"2026-08-18T16:11:21.177864Z","submitted_at":"2025-05-20T01:02:29Z","title":"LLM-based Evaluation Policy Extraction for Ecological Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:05.526187Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.13794"},"observation_digest":"sha256:2473784a916a451a4c2de7d8c94c9804ff5558bdb0326db790d01a147109672e","observation_id":"4f5947a4-37a9-463a-8ab1-80b4140c2f43","resolution":{"observed_at":"2026-08-15T20:17:05.526187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-07T11:26:06.346963Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02592","last_updated":"2025-06-03T08:12:47Z","snapshot_observed_at":"2026-08-19T04:55:21.081744Z","submitted_at":"2025-06-03T08:12:47Z","title":"Beyond the Surface: Measuring Self-Preference in LLM Judgments","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:06.346963Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2506.02592"},"observation_digest":"sha256:6750a338366c53c4fd7330ed5b614e9a6a2eea0debde6fc0557ad3db793313f7","observation_id":"ce379c9d-1747-46e9-9e0e-bbdd090ed7be","resolution":{"observed_at":"2026-08-07T11:26:06.346963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-07T11:04:06.750627Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.750627Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:07b15ed38fee1e68c68176f645b682190f24f89ce073876bb93cb6351d539811","observation_id":"897d129d-c17a-4482-b52e-b6f713c33977","resolution":{"observed_at":"2026-08-07T11:04:06.750627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-07T06:07:02.101272Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06009","last_updated":"2025-06-06T11:54:06Z","snapshot_observed_at":"2026-08-17T17:43:46.269354Z","submitted_at":"2025-06-06T11:54:06Z","title":"Unlocking Recursive Thinking of LLMs: Alignment via Refinement","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:02.101272Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2506.06009"},"observation_digest":"sha256:d572db05b0eeb6ae22102bab543c0142223dc7038ec7b8e2566cb6aa4bf530fd","observation_id":"95bf17a7-838b-45b7-9e5f-4411dfae52a6","resolution":{"observed_at":"2026-08-07T06:07:02.101272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-06T22:56:35.136253Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-13T01:27:38.995851Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:35.136253Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:1a25bfa594b598b34e7fd940ff527bfe2357b58c76e5dd10621c31e9c4484cfd","observation_id":"bb5690b6-7ff5-447d-a462-7b390e3e9370","resolution":{"observed_at":"2026-08-06T22:56:35.136253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-06T19:43:30.600858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05307","last_updated":"2025-07-07T09:11:16Z","snapshot_observed_at":"2026-08-09T15:39:54.255301Z","submitted_at":"2025-07-07T09:11:16Z","title":"ASSURE: Metamorphic Testing for AI-powered Browser Extensions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:30.600858Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2507.05307"},"observation_digest":"sha256:80471a9f652c0bcfb0494aa9a6fdae8b337724fdf1afe0fc06b9a8513491cf26","observation_id":"2824a9ce-3796-4668-88e5-2ce2bce15d94","resolution":{"observed_at":"2026-08-06T19:43:30.600858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T22:54:25.456372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06225","last_updated":"2025-08-18T12:00:32Z","snapshot_observed_at":"2026-08-19T20:36:06.715982Z","submitted_at":"2025-08-08T11:11:22Z","title":"Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:25.456372Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2508.06225"},"observation_digest":"sha256:03390acf65cd2126de0440d9d5163bb1eb3a92f4b0c8e0e5125335659849aea3","observation_id":"dbaa157b-8620-4055-8c5a-e9776f690c0a","resolution":{"observed_at":"2026-08-05T22:54:25.456372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T17:07:19.828751Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17580","last_updated":"2025-08-25T01:07:59Z","snapshot_observed_at":"2026-08-17T14:10:52.413869Z","submitted_at":"2025-08-25T01:07:59Z","title":"UQ: Assessing Language Models on Unsolved Questions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T17:07:19.828751Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2508.17580"},"observation_digest":"sha256:579bab474381b4ed8ad92d5ad7c9909044ebc09c51641db3a6f0b5a942365399","observation_id":"24f5b672-60a7-49ca-80f8-3ab96fef1669","resolution":{"observed_at":"2026-08-15T17:07:19.828751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-07-15T15:00:25.407602Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimiza- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.04836","last_updated":"2026-07-06T01:38:24Z","snapshot_observed_at":"2026-08-16T11:57:35.748457Z","submitted_at":"2026-03-05T05:43:45Z","title":"Beyond Text: Aligning Vision and Language for Multimodal E-Commerce Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-15T15:00:25.407602Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2603.04836"},"observation_digest":"sha256:e6a507fb7b1f8fe27e2e167953fddbcb3dd5bc78b33ed92b27d34ba51ba33329","observation_id":"0dc22d46-7426-418e-86fd-9bc4f304ab8f","resolution":{"observed_at":"2026-07-15T15:00:25.407602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2604.07650","last_updated":"2026-08-09T07:53:35Z","snapshot_observed_at":"2026-08-15T06:36:15.385593Z","submitted_at":"2026-04-08T23:32:06Z","title":"A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:04.305435Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2604.07650"},"observation_digest":"sha256:a850a0a664116d9f7fb845fcefb85334b830e6cbc408ae314459aad0671687dc","observation_id":"dec08c7f-4854-4589-bb93-55abe983f543","resolution":{"observed_at":"2026-05-11T07:20:58.903293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2605.03179","last_updated":"2026-05-04T21:42:10Z","snapshot_observed_at":"2026-08-15T04:44:41.490284Z","submitted_at":"2026-05-04T21:42:10Z","title":"A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:29.066362Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2605.03179"},"observation_digest":"sha256:604e9537f34fa52ce60964a6f58440ba2d1de08a9a8d18cf897b4c7942b6e220","observation_id":"bc7892d8-4d59-463e-839d-6b0ab5c7be15","resolution":{"observed_at":"2026-05-09T06:45:39.586160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2606.00093","last_updated":"2026-07-31T04:03:56Z","snapshot_observed_at":"2026-08-05T23:10:44.373871Z","submitted_at":"2026-05-25T07:31:44Z","title":"Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-29T21:43:59.462151Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.00093"},"observation_digest":"sha256:2b8ecd51457c8717758da48069f9c558c504d54b712b747b20d7464b1497529a","observation_id":"2539b22b-5c7a-41b0-96bf-fd1cf5f2e7e0","resolution":{"observed_at":"2026-06-29T21:53:58.856496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-03T02:20:18.474864Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00093","last_updated":"2026-07-31T04:03:56Z","snapshot_observed_at":"2026-08-05T23:10:44.373871Z","submitted_at":"2026-05-25T07:31:44Z","title":"Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T02:20:18.474864Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.00093"},"observation_digest":"sha256:66f350385ec60492f6bf7b5d5d5285587542a78fd3b6df2db96246f5e9671a21","observation_id":"e752bfff-e420-4f2a-8fa5-457c6d21100e","resolution":{"observed_at":"2026-08-03T02:20:18.474864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2606.12422","last_updated":"2026-05-08T16:32:43Z","snapshot_observed_at":"2026-08-19T04:19:57.254608Z","submitted_at":"2026-05-08T16:32:43Z","title":"Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-30T22:54:03.054871Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.12422"},"observation_digest":"sha256:d71b4df7e7b24b435f55cf24c20b4c3ede1c7904a312f1624f1eaa907050c5c8","observation_id":"75fcba09-600c-4791-b8ef-e2c79ef17086","resolution":{"observed_at":"2026-06-30T22:55:06.075948Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2606.19714","last_updated":"2026-06-18T02:26:05Z","snapshot_observed_at":"2026-08-14T07:30:55.992162Z","submitted_at":"2026-06-18T02:26:05Z","title":"AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T15:48:26.303462Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.19714"},"observation_digest":"sha256:a50decbe0a2bca4c823aa56d814a266c5e8c8644dc1320a465c754ce3a95c681","observation_id":"b979a458-252f-42df-bff9-3b5337f3b205","resolution":{"observed_at":"2026-07-04T05:39:40.126393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2606.23884","last_updated":"2026-07-01T13:21:01Z","snapshot_observed_at":"2026-08-16T01:20:10.209005Z","submitted_at":"2026-06-22T19:30:14Z","title":"One Year Later...The Harms Persist, But So Do We!","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T06:33:58.246849Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.23884"},"observation_digest":"sha256:c7c17e2ad3c308ef80e292eac8d75f9f9e03a09ebc75e8d3fd2aa49fdfe437f0","observation_id":"5bdb24e0-15b8-4225-be9e-e3e79a9d3821","resolution":{"observed_at":"2026-07-01T06:35:29.507789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2606.23884","last_updated":"2026-07-01T13:21:01Z","snapshot_observed_at":"2026-08-16T01:20:10.209005Z","submitted_at":"2026-06-22T19:30:14Z","title":"One Year Later...The Harms Persist, But So Do We!","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-02T21:38:29.468179Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.23884"},"observation_digest":"sha256:6cf966402d02274839f16369a32c4a2d785c44ad03cccf37f37a4e04ba69c54c","observation_id":"24b91149-6b8b-4aad-9592-02e132d1d712","resolution":{"observed_at":"2026-07-02T21:47:27.609506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2606.30556","last_updated":"2026-06-29T16:51:31Z","snapshot_observed_at":"2026-08-07T13:43:00.994295Z","submitted_at":"2026-06-29T16:51:31Z","title":"Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-30T05:59:58.183264Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2606.30556"},"observation_digest":"sha256:6379699bc0d97ace9101bf9e5c2c69d8767aa5f297dff49c6f8c2cc0fb23b05d","observation_id":"1ed7ab0a-0e09-4f00-a851-e537189ed20d","resolution":{"observed_at":"2026-06-30T06:04:21.528798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":"2306.05087","doi":"10.48550/arxiv.2306.05087","metadata_source":"pith","pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":"cs.CL","work_id":"e19da613-b037-4e35-b0c9-c0024fcb762e","year":2023},"citing_paper":{"arxiv_id":"2607.08535","last_updated":"2026-07-09T14:31:05Z","snapshot_observed_at":"2026-08-18T20:55:46.907256Z","submitted_at":"2026-07-09T14:31:05Z","title":"When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T05:47:32.670216Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2607.08535"},"observation_digest":"sha256:53613e90cba1089e6dc9f3f5a6646453a0365114a25466976666704fe3db6768","observation_id":"76225087-f4e6-4a2b-bef9-4681601d9bef","resolution":{"observed_at":"2026-07-10T05:56:50.505931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.05087/citation-record","integrity":"/paper/2306.05087/integrity","json":"/paper/2306.05087/citation-record.json","paper":"/paper/2306.05087"},"outbound":[],"paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2306.05087."}