{"as_of":"2026-08-09T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a06eff48abc2bdf8c9c1dd2f8268f99a0eed9a85eea891061c1bfa44fdb82876","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:12:29.571807Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16003/citation-record","integrity":"/paper/2505.16003/integrity","json":"/paper/2505.16003/citation-record.json","paper":"/paper/2505.16003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:25.658857Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.658857Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:bb7473b429b8875c52b419b0e8dc63d4eb80b995525d6fddb5cec64969a494bb","observation_id":"2331853a-80d1-42d9-8ad9-41e293a902c0","resolution":{"observed_at":"2026-08-07T15:12:25.658857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:25.739049Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.739049Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:b333946b7b3be9d8f07fcc9b9f86f5022b7e7029e4021fa27cbf09dcb1be737b","observation_id":"2a9960b7-6162-43a6-ac18-07f7b76bddf7","resolution":{"observed_at":"2026-08-07T15:12:25.739049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T15:12:25.831066Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.831066Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:a70b16cfca14a5f11822397db413d794c9f38a67edc33591933a023e1f6dd3fb","observation_id":"52ecad51-fff3-47d0-b2cc-35ca9de06c2a","resolution":{"observed_at":"2026-08-07T15:12:25.831066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:25.937380Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:25.937380Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:2dd8b9a32342a602fd67bc278e82060bd27578824dd868701e110dca988ad478","observation_id":"6993e9f6-276a-409e-a54f-5dabc51d287e","resolution":{"observed_at":"2026-08-07T15:12:25.937380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-07-06T06:30:55.970076Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-07T15:12:26.041434Z","title":"John, Noah Constant, Mario Guajardo-Cespedes, Steve Yuan, Chris Tar, et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.041434Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:f2f4fd8c366cfbc49b247a786b6d3b22140c3fa24f1d2fd4412e54831f970ca3","observation_id":"2f7a7b0f-86d7-45c9-85e4-9e08054b9e05","resolution":{"observed_at":"2026-08-07T15:12:26.041434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:26.152173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.152173Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:a76b30839c90bdc6f7e504bf3b21b1f025a5b1f18b4f3a55848fe309a5ca6316","observation_id":"d44d9ea7-01c1-4868-a17d-2dc018b5bd47","resolution":{"observed_at":"2026-08-07T15:12:26.152173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:26.253084Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.253084Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:27831e4f1c387b824ff19a22e289ddc6935f2bc9b50d5fbcc8ad009d6692993a","observation_id":"2eef658f-6295-46d0-8840-4e0c2b3a82ee","resolution":{"observed_at":"2026-08-07T15:12:26.253084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T15:12:26.305835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.305835Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:0994144bbd4f06f577dc67b09edddfa05860a4462e08dd7e000f3caa9897586a","observation_id":"ef2a6eca-65e3-4fba-a07a-73e4a615faa9","resolution":{"observed_at":"2026-08-07T15:12:26.305835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14483","last_updated":"2025-02-17T16:21:10Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-19T20:16:26Z","title":"Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat","version":2},"cited_work":{"arxiv_id":"2411.14483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14483","snapshot_observed_at":"2026-08-07T15:12:29.896082Z","title":"Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat","venue":"cs.CL","work_id":"48b31600-0582-4031-aeae-3bdec4d0b980","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.391373Z"},"links":{"cited_paper":"/paper/2411.14483","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:77c8c446a3c22a7cda59fb3671ba690806b8bca1d9ad8651c856353d3beaa054","observation_id":"c7de3eed-8795-47f5-ba78-8065e605404f","resolution":{"observed_at":"2026-08-07T15:12:29.990097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T15:12:26.461346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.461346Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:81fda30640f0c73cebd50f21af3696898cb3b667c8f44f3fb379b457282bf1d6","observation_id":"588ea92b-1523-413a-8b23-9d3e7f2139c5","resolution":{"observed_at":"2026-08-07T15:12:26.461346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T15:12:26.533391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.533391Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:c4004c2b5a9d3482d87f006a34f53f2a883db00aefbc926e0b7e364beaa52379","observation_id":"6391e006-8c47-4db5-870d-d993cd5cd9e7","resolution":{"observed_at":"2026-08-07T15:12:26.533391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:26.612947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.612947Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:b992201edcacc9d4fc16bb242869ad51a44840d2dc67b87f202aeb7902d789ac","observation_id":"4a6d97c4-0639-49af-b3dd-fbd0d67e750b","resolution":{"observed_at":"2026-08-07T15:12:26.612947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.753743Z","title":null,"venue":null,"work_id":"af5da921-9cb2-4839-a2aa-b00aa11bd87b","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.683431Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:137994efe51ddf320d0941caeee8af90f9fbfd01e0c20e5fef9ab591cbd36a87","observation_id":"cfb6063c-b19c-45ab-9568-b34878d6a3bf","resolution":{"observed_at":"2026-08-07T15:12:32.813694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.613189Z","title":null,"venue":null,"work_id":"4f1a5d21-4bc1-4aaf-b6c5-e500791b7026","year":1957},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.786899Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:cf722eb54c6af57f6641a0905787f2cfaabd5ab1fba49e4681a1ad503762f49a","observation_id":"743a2d8e-f7b9-452b-9da9-cf64f60f9ac0","resolution":{"observed_at":"2026-08-07T15:12:32.684513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T15:12:26.903646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:26.903646Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:5159166e85722e5ab45bc02891fa620e6fdd62bb0b30c71ab38d56879ac61d21","observation_id":"2de9dde4-b320-4095-864b-2187a14f885d","resolution":{"observed_at":"2026-08-07T15:12:26.903646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:12:27.086999Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.086999Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:37cde44cc5a1d5c72850d6fc5f2a41dfb8d95ce301016ba327988efb2c9b7c5d","observation_id":"adefd4fa-c694-4e8c-a0c3-8e9f8497fb8f","resolution":{"observed_at":"2026-08-07T15:12:27.086999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.456704Z","title":null,"venue":null,"work_id":"e55ef13f-c1cd-42d2-b5fe-bcffa89f066b","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.235305Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:0fe3f045c078c4d2ad69b49e3b546b1c563b2159f09d0e27f978dec95ec897eb","observation_id":"4ba73291-d785-4c5f-94cd-3aaa3bad7a41","resolution":{"observed_at":"2026-08-07T15:12:32.526639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.360715Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.360715Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:f681c1be219c5bd04e60ac70511a0a72c44e91726e08c40c958a5ccb8c51f06a","observation_id":"33cfb1ef-67b4-4bfc-b3a4-b89233fc699f","resolution":{"observed_at":"2026-08-07T15:12:27.360715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.479046Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.479046Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:4754ded4b75d59b4ee7b3cc0b4b21382def8baa86869f8c451a8ec68321946e1","observation_id":"65a77ac2-aa0c-467a-8685-ddde52a27896","resolution":{"observed_at":"2026-08-07T15:12:27.479046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.560332Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.560332Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:c49813f0e05db0c1fb89b17853ee21e8f829281c341439ec2494036c7f467253","observation_id":"e4270a75-42da-4e5c-aff9-c3d529819601","resolution":{"observed_at":"2026-08-07T15:12:27.560332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:27.639556Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.639556Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:cad1c519861529983cdb4d8f015eb40a3dd152dd943dde66a31d8f115c9e8bcd","observation_id":"2ba855eb-b404-47c9-bc1b-ae595c6277a4","resolution":{"observed_at":"2026-08-07T15:12:27.639556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.196963Z","title":null,"venue":null,"work_id":"6c5b0e9c-7ec2-46c9-bba9-b42ac91c3fe8","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.733477Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:f5f340325ee43124699015b84ff8c6876dda1ad40bbc313414e5a1496a664426","observation_id":"8ae85e7e-8cb9-4496-9a67-de0ce603873a","resolution":{"observed_at":"2026-08-07T15:12:32.309222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-08-09T03:30:58.801577Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-07T15:12:27.821363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.821363Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:dd752126988a56a1c429e1a1cc6ee319fe2b6157c04f7af9329cadd3484327e5","observation_id":"981f289b-cdca-4199-b00b-8f5b4671d088","resolution":{"observed_at":"2026-08-07T15:12:27.821363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T15:12:27.917379Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:27.917379Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:9da2ea9c6b871c28969c2de96abff58aa6faaf810dd2b744fb8b2047eb0b0f60","observation_id":"e954545d-c994-4d24-b407-199e4caeab6a","resolution":{"observed_at":"2026-08-07T15:12:27.917379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:32.029463Z","title":null,"venue":null,"work_id":"8ebaf736-a1b2-443a-8699-5b6c9001aa00","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.007655Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:726a21e868cd6d60e821ad4cbd5bd6796c8a6528c2bdc61a41781119857007d6","observation_id":"a0acaae3-8679-4ec0-af48-3dc5a8fd6068","resolution":{"observed_at":"2026-08-07T15:12:32.098337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.093858Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.093858Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:f7eb4b87db0b4adc4319d154c497f1fae86d83da300597c89f4ddc2fabc15282","observation_id":"cb03803f-ca61-4365-a874-d2b479169fc2","resolution":{"observed_at":"2026-08-07T15:12:28.093858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:28.207619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.207619Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:bdd480c620c1128bdc03c5417b14691097b493a2d258bc0d0d745dae11b79030","observation_id":"b4ed41ef-69dd-4d2e-a33c-1fbd04d572f3","resolution":{"observed_at":"2026-08-07T15:12:28.207619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.832362Z","title":null,"venue":null,"work_id":"c870a8e0-7bf0-442a-9aa5-69418d122259","year":2011},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.302685Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:b12460a50a6f320b37a9f84ceb477f1120f5cdbd96c30ddba90b0dc0780cbfae","observation_id":"ffe05389-17d4-42a9-9598-134c942f598d","resolution":{"observed_at":"2026-08-07T15:12:31.912194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T15:12:28.393971Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.393971Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:8f60a321e2826e56bacb46efb9aaee43e065db5b5bd8a17b84b18480121ac91a","observation_id":"00f127c3-6873-4e41-885e-a0eac26076c7","resolution":{"observed_at":"2026-08-07T15:12:28.393971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.581510Z","title":null,"venue":null,"work_id":"61708eb9-c38d-40f7-b560-11a771674884","year":2020},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.577137Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:32c1be3e9d2379c37a4c6c2ba453d3a32695c4863f4cc3f02ce8f93ad5627765","observation_id":"6d5c4745-242c-48aa-a1e5-de35b8af9224","resolution":{"observed_at":"2026-08-07T15:12:31.726627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.347372Z","title":null,"venue":null,"work_id":"6ee80b13-b7ff-42a4-a1a2-1b51ca9836ce","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.676722Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:82c2da79e11632b3361fb5ecdf8aa9a2cb24b6e0bac409812817e0fe9a85c705","observation_id":"3c0e25e3-1218-42c0-9a7d-58c01a506aff","resolution":{"observed_at":"2026-08-07T15:12:31.451979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:31.107375Z","title":null,"venue":null,"work_id":"077e079a-f0a5-4ed3-8f3e-fee12ff6f189","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.773948Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:c7ec5360e5ca8b2d1198911c2df0e96998db6fb95ce96415430c56dcb510edf8","observation_id":"9cb6822f-e160-4545-b196-630e9a87a131","resolution":{"observed_at":"2026-08-07T15:12:31.207916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:12:28.875787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:28.875787Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:0ab7546b48e483c49ea35183fa4dfed213a4f8920729fca56ea7bf3f542e7625","observation_id":"32cc10a8-2041-42e1-9998-9b4e05193277","resolution":{"observed_at":"2026-08-07T15:12:28.875787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-07T15:12:29.013619Z","title":"Rush, and Thomas Wolf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.013619Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:c12332f189977e1c8f05acc86c25199615ad9ad244d4c4405717e0faa6cdf4e7","observation_id":"e448977d-df40-4b70-8f29-ad110807bdec","resolution":{"observed_at":"2026-08-07T15:12:29.013619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.824353Z","title":null,"venue":null,"work_id":"4ba4883c-f4db-41b5-aaf4-26ee609bc833","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.142511Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:efe3f34bf90e6a82561095a2f4a10fc2ddaf96807910eee51308720fe4b0989d","observation_id":"669009f8-f223-4ab5-aa28-d0d10212fcf9","resolution":{"observed_at":"2026-08-07T15:12:30.958495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.580116Z","title":null,"venue":null,"work_id":"d4466f89-dcc9-458a-a358-29974ab7a363","year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.232866Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:3db5dd1de59f2df759d0f5adb19cf5b5952ee5f1fd6d870be419ebf83c7dc949","observation_id":"6fefe809-a7d4-4520-80ee-eba385d346a7","resolution":{"observed_at":"2026-08-07T15:12:30.712074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.390892Z","title":null,"venue":null,"work_id":"0d475841-6547-434d-a996-0828763b4b4b","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.322869Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:488619003e7ec2d132c3165296230b739a1c5849d428a2a144769d6c4f0a678e","observation_id":"233aca80-98c1-4697-a4c2-40f0971fa555","resolution":{"observed_at":"2026-08-07T15:12:30.464148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T15:12:29.411802Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.411802Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:c1a49350378199d0b08deecb20379877b426179590bf83f6e13408be93535dd2","observation_id":"3f8693bb-69cc-43c6-85c4-c5167420173c","resolution":{"observed_at":"2026-08-07T15:12:29.411802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:29.473657Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.473657Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:f1460f12d72f20e58edfd54ca6a368e802ed20d848cc63102ccbca5dbbbcbecb","observation_id":"e6dd55c4-ea95-4649-8580-49d0d90f584c","resolution":{"observed_at":"2026-08-07T15:12:29.473657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:30.156235Z","title":null,"venue":null,"work_id":"259e6005-34cc-4f4b-abed-420a5e7381c4","year":2023},"citing_paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:29.571807Z"},"links":{"citing_paper":"/paper/2505.16003"},"observation_digest":"sha256:0c12deeaa32bdb945d43e86d65ec8c6339305b9263c6a41b9a24a40cd8a6841d","observation_id":"ee1e615a-d8b2-4c2e-919b-42b72b672d4f","resolution":{"observed_at":"2026-08-07T15:12:30.216253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16003","last_updated":"2025-05-21T20:40:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T03:29:52.281787Z","submitted_at":"2025-05-21T20:40:30Z","title":"SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.16003."}