{"as_of":"2026-08-11T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ce41093672a4ea4255214794074accdce339f46514e0b58f5296ff7c8598f2d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:13:22.017520Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T22:40:57.908347Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:47:25.418736Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"cited_work":{"arxiv_id":"2501.15595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15595","snapshot_observed_at":"2026-07-02T22:47:25.418736Z","title":null,"venue":null,"work_id":"9a10b8eb-e76c-40a5-964a-e152a804e2f0","year":2026},"citing_paper":{"arxiv_id":"2606.08625","last_updated":"2026-07-01T14:07:42Z","snapshot_observed_at":"2026-08-08T12:57:42.530698Z","submitted_at":"2026-06-07T13:34:55Z","title":"From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:54:30.970241Z"},"links":{"cited_paper":"/paper/2501.15595","citing_paper":"/paper/2606.08625"},"observation_digest":"sha256:7a25e3e092d3c1fb1c2410ce479f4696fc7f0318eaeda87299d4dcbe6db872ea","observation_id":"730f1a8c-26df-4854-9338-52e80b4c4f53","resolution":{"observed_at":"2026-07-02T22:27:25.939000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"cited_work":{"arxiv_id":"2501.15595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15595","snapshot_observed_at":"2026-07-02T22:47:25.418736Z","title":null,"venue":null,"work_id":"9a10b8eb-e76c-40a5-964a-e152a804e2f0","year":2026},"citing_paper":{"arxiv_id":"2606.08625","last_updated":"2026-07-01T14:07:42Z","snapshot_observed_at":"2026-08-08T12:57:42.530698Z","submitted_at":"2026-06-07T13:34:55Z","title":"From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T22:40:57.908347Z"},"links":{"cited_paper":"/paper/2501.15595","citing_paper":"/paper/2606.08625"},"observation_digest":"sha256:6fa65f195a2b60152ef8510bfec104c8dd45864e45a3769a850748bae9231ea3","observation_id":"39177722-d2c1-4721-839c-43a2c8b17ccb","resolution":{"observed_at":"2026-07-02T22:47:25.420086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15595/citation-record","integrity":"/paper/2501.15595/integrity","json":"/paper/2501.15595/citation-record.json","paper":"/paper/2501.15595"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.770257Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.770257Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:c142355985307937f4d880dfae7c6c6349a1c09dc734bc70249555667b0845ea","observation_id":"afacc28a-b5ad-479f-888b-b869ca940816","resolution":{"observed_at":"2026-08-10T14:13:21.770257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.776366Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.776366Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:1589705dd2a14dcfed2bf7baad72a612ac3128350f711f5df5db6372cb5df208","observation_id":"0be2adbb-d7fe-413e-b04c-44e007e419dd","resolution":{"observed_at":"2026-08-10T14:13:21.776366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.782510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.782510Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:55aefd82d0c90423df201fab17f7685d2614e5c6942d149726d711583ab07230","observation_id":"d2183808-ddcf-44cf-a0fc-aed773d18927","resolution":{"observed_at":"2026-08-10T14:13:21.782510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T14:13:21.788524Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.788524Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:3f5818de4a1b777589009b40231bde2821c5dd83495b87e6839ae11f28e7acd2","observation_id":"21330030-275b-4061-8563-a0ecf2d42942","resolution":{"observed_at":"2026-08-10T14:13:21.788524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-10T14:13:21.794354Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.794354Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:e210ac6680615214f33294678d0c25a190feb6a307571f4c4da16374ab651129","observation_id":"15844e17-d0fb-4b6b-a82a-46ca5ebf2d15","resolution":{"observed_at":"2026-08-10T14:13:21.794354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.799924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.799924Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:2268f5471001aafc921415a2efb766bf26df90a482959cbceef35be65b614fb1","observation_id":"b36ea18e-7d22-4abc-94ec-7fe1e28565a1","resolution":{"observed_at":"2026-08-10T14:13:21.799924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T14:13:21.805266Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.805266Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:28f14552d302dc4c8c57390e832045c3d4811dd1896c99ac2fa0e636f4181fa1","observation_id":"1dc2d5ae-cc34-429b-a023-758493073443","resolution":{"observed_at":"2026-08-10T14:13:21.805266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.817209Z","title":null,"venue":null,"work_id":"9a89aa9d-7755-462d-9378-54261aa949a3","year":2021},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.810761Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:d3eefb98f9237902eebf13eb44b52dd974ab54b3e59d5c0e548f59e49b12bc96","observation_id":"f9fdd0ba-b398-47a2-937c-e6965792c14c","resolution":{"observed_at":"2026-08-10T14:13:22.822626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.816627Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.816627Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:14113aef6eff524761266e23199f70621be4fec62f9e90919b17768ea0ad82a0","observation_id":"8a9e6d06-1c5d-4b09-9542-eb6cf5d4d1bc","resolution":{"observed_at":"2026-08-10T14:13:21.816627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T14:13:21.821755Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.821755Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:1689a20bed849bd920d507e448a7741a9f0ec349ce8786e0f434e4cb3264e29a","observation_id":"c6ddccf0-affc-43a9-8e71-b141380a2a31","resolution":{"observed_at":"2026-08-10T14:13:21.821755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.827306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.827306Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:56892d0be363227e1654bb4c0803bea3ed710cd2ca30f1c5798c87f925d84d60","observation_id":"0506ffbb-76e7-4577-968c-763e8d59b122","resolution":{"observed_at":"2026-08-10T14:13:21.827306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08491","last_updated":"2024-03-09T10:44:58Z","snapshot_observed_at":"2026-07-06T16:32:00.957275Z","submitted_at":"2023-10-12T16:50:08Z","title":"Prometheus: Inducing Fine-grained Evaluation Capability in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08491","snapshot_observed_at":"2026-08-10T14:13:21.832007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.832007Z"},"links":{"cited_paper":"/paper/2310.08491","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:b7a704793c68f733d3d15f1e7c692e46a8fb0fc151517e7293cc6678b38ea87a","observation_id":"5ef75484-31b6-41c9-8b23-b1141bc4eb13","resolution":{"observed_at":"2026-08-10T14:13:21.832007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-06T22:44:08.607902Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-10T14:13:21.837440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.837440Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:35b8d65dd3a27224d5bb440fe859a7da14c49e61053ee8b56fe540f6598d91a1","observation_id":"dc6fb207-9096-4997-a5f1-528bfcb8ecfc","resolution":{"observed_at":"2026-08-10T14:13:21.837440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10821","last_updated":"2021-09-13T23:31:16Z","snapshot_observed_at":"2026-08-09T15:10:54.107126Z","submitted_at":"2021-07-22T17:22:22Z","title":"To Ship or Not to Ship: An Extensive Evaluation of Automatic Metrics for Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10821","snapshot_observed_at":"2026-08-10T14:13:21.842619Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.842619Z"},"links":{"cited_paper":"/paper/2107.10821","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:3f4b03ce9e35e7a5062401f7a92c57fa78babc94574e995d4945c745fd150c8c","observation_id":"d110443c-3249-484f-914d-3430276b69e2","resolution":{"observed_at":"2026-08-10T14:13:21.842619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06332","last_updated":"2021-05-19T12:01:54Z","snapshot_observed_at":"2026-08-05T15:17:45.510828Z","submitted_at":"2021-03-10T20:32:30Z","title":"Hurdles to Progress in Long-form Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06332","snapshot_observed_at":"2026-08-10T14:13:21.847773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.847773Z"},"links":{"cited_paper":"/paper/2103.06332","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:1ac6a8b07517ab4980fd7707f8ed93e3c72eb05d86bf55d093a3d38825403bc9","observation_id":"20097df1-f407-460b-9b57-54aedf407901","resolution":{"observed_at":"2026-08-10T14:13:21.847773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-06T02:25:36.517255Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-10T14:13:21.853247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.853247Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:d3dc822ad3c662688f8ca54a3aa231d5d32d39bab93b043b7a85d8e20d7a3144","observation_id":"ab29fc4b-b4cd-4107-bd80-5174d73e0d14","resolution":{"observed_at":"2026-08-10T14:13:21.853247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1623","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.106011Z","title":null,"venue":null,"work_id":"08c2170a-d839-4cb2-918b-27b812fe8ad7","year":2019},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.858961Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:5183cce91e1e1695fffce119683a3db330e94f6471988698fcccb4b68d90828a","observation_id":"9edd6644-54cc-4305-b6bb-1c0edf15904f","resolution":{"observed_at":"2026-08-10T14:13:22.111833Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.864027Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.864027Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:8cf0e0363273f6560d0060f07ad72574ffb3ffd22948a573829501b3b2dee1f6","observation_id":"4e6bbf66-8e4e-400a-bab1-de64c53ce0f6","resolution":{"observed_at":"2026-08-10T14:13:21.864027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.869578Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.869578Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:71b0c0ad2b8233fccb325ac7aa4919e34447a4869d29d1c565660e6f7c0f7aa0","observation_id":"b149cb7b-5fe7-4f7c-8f0c-0d9c36a6e0d7","resolution":{"observed_at":"2026-08-10T14:13:21.869578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-10T14:13:21.874624Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.874624Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:e12b17d5a6024ef39649229f563b151ab58771cb3b86d39ee3a06c759e6fb83c","observation_id":"caada853-b696-40cf-8891-8ca26600b5bc","resolution":{"observed_at":"2026-08-10T14:13:21.874624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.879936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.879936Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:0f1c155320f35c8094837eab1fe092a1405105d88578ff795cc15c5b8a6f2a4d","observation_id":"ec07fe9e-b3ad-4558-92f6-0412a8666a4d","resolution":{"observed_at":"2026-08-10T14:13:21.879936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.885097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.885097Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:304272c9c23bf5308179f7ce46d4d079f29ce3ee3277aee670821afc162d376f","observation_id":"0555734d-5b41-49ac-98e6-2f4c4c6260f3","resolution":{"observed_at":"2026-08-10T14:13:21.885097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03971","last_updated":"2019-05-20T21:14:54Z","snapshot_observed_at":"2026-07-06T07:44:38.449115Z","submitted_at":"2019-04-08T11:44:41Z","title":"Jointly Measuring Diversity and Quality in Text Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03971","snapshot_observed_at":"2026-08-10T14:13:21.890184Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.890184Z"},"links":{"cited_paper":"/paper/1904.03971","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:9eca979b0d421554661fc22890ff486cfab77ea91a28f5198f5eff4dc4dc1ea6","observation_id":"3eb7ea0c-d841-40e9-bdf6-21452aa0302b","resolution":{"observed_at":"2026-08-10T14:13:21.890184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T14:13:21.895039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.895039Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:ef17b5f3f535716fa70ebffcc0915ca35f3db151e6a4fc0e851ce2b64112e3b2","observation_id":"1e713b82-7510-478c-b2c5-f11e011aa874","resolution":{"observed_at":"2026-08-10T14:13:21.895039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.900281Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.900281Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:606d0d006dccd1390ed76036eec8c38573e27fd80ecb0bd3ae9ef59b164b87d9","observation_id":"2597b9e1-2752-4656-b6ed-42128c90bb78","resolution":{"observed_at":"2026-08-10T14:13:21.900281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-10T14:13:21.905347Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.905347Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:1e607d076e6cb28aaa8548a680abf5090a8e795d27af7dc7249dcefda648b009","observation_id":"a9fe2212-3cf2-4cd3-a828-02ddc9eb5e87","resolution":{"observed_at":"2026-08-10T14:13:21.905347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.910721Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.910721Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:38450f40bd3e16bad411419f06ddd1dbb28281b4d016f6c89e84c5008b60969e","observation_id":"0083f9ba-b59e-4cd8-87ea-443ae994392e","resolution":{"observed_at":"2026-08-10T14:13:21.910721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.915799Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.915799Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:bce331b72c39c00f2178ffd9481b0066def13d8042481fb5f9493e3cf454ddbb","observation_id":"d62d85ed-850e-4959-9650-24464ccdd08a","resolution":{"observed_at":"2026-08-10T14:13:21.915799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.mrqa-1.15","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.052519Z","title":null,"venue":null,"work_id":"b0e163de-3715-4469-962f-a9e848393a80","year":2021},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.921031Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:2a66219ab3e2b53469d4ae7452e6bf54fa821b3034e7d1791e7e7894f0ed7ed7","observation_id":"61c691ac-3f8d-4677-bafe-3107bd59c2a6","resolution":{"observed_at":"2026-08-10T14:13:22.059851Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.757575Z","title":null,"venue":null,"work_id":"4e0fa0ab-41fb-42b8-b39c-cbc9d10e23bc","year":2017},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.926591Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:fac1dede7e6a6864032c9a05a8d507a8d99db437f64b3c733ba69117366e4b0e","observation_id":"9b3d69d7-076b-4668-9be5-ae4d369b8ef0","resolution":{"observed_at":"2026-08-10T14:13:22.762732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.741389Z","title":null,"venue":null,"work_id":"bcc04467-bc0f-44a7-a91a-d5765d6e762b","year":2017},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.931499Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:63caaab844f1d4dbc9cfde6d2f03b394768fb2dd3d8875749577114806310120","observation_id":"8c73b962-8878-457d-a139-1d8c3e93c7d0","resolution":{"observed_at":"2026-08-10T14:13:22.746485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T14:13:21.936511Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.936511Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:670a69d56aebe30fc1f7e694bd231558dfb1cc691d66a8eae32c8cb1e2ff1dbb","observation_id":"41d5405a-e4c3-40c4-af34-c80bde0d1198","resolution":{"observed_at":"2026-08-10T14:13:21.936511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:21.942192Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.942192Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:6b3fbf05e7642bd52c735ada9c02db533eadadc774a645a4127168c05e5a5b40","observation_id":"2b2633e7-f30a-4b16-929b-9fd1dff4b44a","resolution":{"observed_at":"2026-08-10T14:13:21.942192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-10T14:13:21.947802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.947802Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:1bc03de8e883265083ae4ba9d4f95f89a17ee4cdcf470421fd14f09d21f99cab","observation_id":"ae11bcc1-d549-4849-b8b8-9977439b5004","resolution":{"observed_at":"2026-08-10T14:13:21.947802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.712876Z","title":null,"venue":null,"work_id":"e67fd598-4d9c-4a9a-9b54-388dffe33940","year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.954187Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:8ebc922eb502bc42127bba97f07e65299fa43f77ce6a9a4a462cbecb13c2dfbe","observation_id":"bcec49dc-f423-497b-b297-6a16880bf4c2","resolution":{"observed_at":"2026-08-10T14:13:22.718344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T14:13:21.959034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.959034Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:99f0dd46ae46c46b8aaf1526c881f7be59029df413ba5efec8595db7403e9e54","observation_id":"46964b07-857c-4b76-a9cd-77160b7ab21f","resolution":{"observed_at":"2026-08-10T14:13:21.959034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T14:13:21.964177Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.964177Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:f31cf1922a9d688a029e44e12242dfbd739be662ce6b936ff80bb6b6a65c5768","observation_id":"9742c1b6-7a03-4915-aae1-11c20db53c59","resolution":{"observed_at":"2026-08-10T14:13:21.964177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-07T12:09:31.277517Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-10T14:13:21.969582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.969582Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:ad9d175b6b6cf814ed6313d7b97595f2f3ad4034589dec1f1e593d6eb31a3e6f","observation_id":"4774d543-5df4-4e24-886f-d26bcb351cba","resolution":{"observed_at":"2026-08-10T14:13:21.969582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10928","last_updated":"2024-04-14T04:29:51Z","snapshot_observed_at":"2026-08-02T02:46:23.506253Z","submitted_at":"2023-07-20T14:56:35Z","title":"FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10928","snapshot_observed_at":"2026-08-10T14:13:21.975242Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.975242Z"},"links":{"cited_paper":"/paper/2307.10928","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:b0d050cdef969f412823459fbb96eca3454660c0b495acf51939aa5c682f83dd","observation_id":"c26c8cb1-9deb-44ad-aa7a-70f4d0e034b4","resolution":{"observed_at":"2026-08-10T14:13:21.975242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-10T14:13:21.981049Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.981049Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:b0a3d812233f7bd67ca5b5ce1b9744690af90f699fbb8ba4e79d41c047ee9c4c","observation_id":"a197efe6-5edc-43da-a24f-1a4356ac5eb7","resolution":{"observed_at":"2026-08-10T14:13:21.981049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-10T14:13:21.987198Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.987198Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:77348d2ef914845ee68a384ec0c9c42e1ef698b7118ab38c196f7771a09a9cdb","observation_id":"1d8fc984-641e-40de-966f-0d5f0b33c132","resolution":{"observed_at":"2026-08-10T14:13:21.987198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.640297Z","title":null,"venue":null,"work_id":"564190bd-de92-40a8-8bee-6bd2d96ed806","year":2004},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:21.993292Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:af60873b53b4ffc86fcac87a022c7838f7ad2e02d7e11ed77ff110263b17c710","observation_id":"958b4490-cddb-4dc2-a802-66fe1bcae7a5","resolution":{"observed_at":"2026-08-10T14:13:22.674409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:13:22.000656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:22.000656Z"},"links":{"citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:13718d183814b657e7a1a76ef8942296a414b6ad74ed0de3e48be7f66550e344","observation_id":"9a19d39d-aaeb-4962-9585-617053fe9728","resolution":{"observed_at":"2026-08-10T14:13:22.000656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-10T14:13:22.007889Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:22.007889Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:669d6a37abb47b896c06f81db1147e1169a84fc7dd90b486aa1e27eada8b2dc7","observation_id":"6033d781-4e14-45f8-a673-6ad63a147e42","resolution":{"observed_at":"2026-08-10T14:13:22.007889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-10T14:13:22.012661Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:22.012661Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:08ef81557af32563ec167bfa6263c7146fd08122c2d2cfbf4e49dde9b295e0b6","observation_id":"5f9bd9c4-c29c-48c5-8b43-79ba6ed27c83","resolution":{"observed_at":"2026-08-10T14:13:22.012661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-06T12:42:08.815092Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-10T14:13:22.017520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T14:13:22.017520Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2501.15595"},"observation_digest":"sha256:8770da6755bd8c8fdbd36ef77d08dde27911d025b938931a438afacc42caba0d","observation_id":"3355d1db-e358-4897-b05c-d2c1d42b7d02","resolution":{"observed_at":"2026-08-10T14:13:22.017520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15595","last_updated":"2025-01-26T16:45:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:14:23.945196Z","submitted_at":"2025-01-26T16:45:09Z","title":"SedarEval: Automated Evaluation using Self-Adaptive Rubrics"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2501.15595."}