{"as_of":"2026-08-08T13:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:608bc53db661b3c67f9f099a6d14db91ad04f696a3cb506d99ada66138676b3d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:28:10.894434Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:49:20.019956Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15240","snapshot_observed_at":"2026-08-03T06:49:20.019956Z","title":"and Gales, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21817","last_updated":"2026-06-10T10:26:33Z","snapshot_observed_at":"2026-08-07T08:23:55.838105Z","submitted_at":"2026-01-29T15:01:28Z","title":"A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T06:49:20.019956Z"},"links":{"cited_paper":"/paper/2505.15240","citing_paper":"/paper/2601.21817"},"observation_digest":"sha256:6490f8b8299685d12b095721a39116ffb4724c41a44aca522d38024e24b60ebb","observation_id":"27443c4a-b1ef-430f-89dd-8f762f430d72","resolution":{"observed_at":"2026-08-03T06:49:20.019956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15240/citation-record","integrity":"/paper/2505.15240/integrity","json":"/paper/2505.15240/citation-record.json","paper":"/paper/2505.15240"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:28:07.772078Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.772078Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:29585054c9d83b01ed51366a807d9ec294aad95ff13bddf80b1a704a05a3a8b1","observation_id":"eadde58f-0925-492b-a928-73b06b038893","resolution":{"observed_at":"2026-08-07T15:28:07.772078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.891715Z","title":"Categorical data analysis","venue":null,"work_id":"28611cd3-1283-4305-b249-db042e06fdbf","year":1990},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.872856Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:2be631a64d3b4c738fc68bdbf457edea7886a910adb2bae2fd02477335cfab14","observation_id":"467dbc23-a0d5-4c5f-9049-756a0e40b7c0","resolution":{"observed_at":"2026-08-07T15:28:14.953900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.813231Z","title":"A computationally intensive ranking system for paired comparison data","venue":null,"work_id":"5eaa109d-ce9e-4dc4-831e-a6dcfa5535e4","year":2018},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.925438Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:4a410147a5b0a7db9509e026c85ab6d58f63db0771dfae057a87d4ab9eb47626","observation_id":"db7db87a-aea4-42ba-bf0e-65311de07201","resolution":{"observed_at":"2026-08-07T15:28:14.838672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.965543Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:07.965543Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:4572c2b3a8d74edad97b7b5450df82d4e3aee1f99cbcbc9356521acdcb2cf1c4","observation_id":"96127373-87f6-45f5-a8eb-cbeca7724a9f","resolution":{"observed_at":"2026-08-07T15:28:07.965543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.029766Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.029766Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:fed69cb6545e98469b80e77aa603a136ec120011eac82899ad4e4b93486cb0fa","observation_id":"35d1a2ed-7104-4683-83e3-433242852d34","resolution":{"observed_at":"2026-08-07T15:28:08.029766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T15:28:08.130142Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.130142Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:03eb14940cd7872ab62adaf220268748153e537d5d481761f0fc68e6ed5a48f5","observation_id":"e5936fee-505a-43d0-9255-cb5dda048f1c","resolution":{"observed_at":"2026-08-07T15:28:08.130142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.179818Z","title":"Learning to rank: from pairwise approach to listwise approach","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.179818Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:4f8146e098e65b4175c0fb003a32bf150f2975a54f27bfe1973a8f656e8e7b8e","observation_id":"5d8571d4-de8d-4bcf-a2d5-ef4679f4ee63","resolution":{"observed_at":"2026-08-07T15:28:08.179818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.252459Z","title":"Efficient bayesian inference for generalized bradley--terry models","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.252459Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:4c30567b164b0639941746fda05ea88fe01d190c058153f02a240ee6d922b584","observation_id":"356dde46-a9d5-46f6-888c-3f5bdc7e283d","resolution":{"observed_at":"2026-08-07T15:28:08.252459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.635842Z","title":"Models for paired comparison data: A review with emphasis on dependent data","venue":null,"work_id":"ae4b0c4c-e176-45fe-bcad-1ec484822f36","year":2012},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.346278Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:5978779e4737f57f046511db6b37bd5c02e6c6b1c3831547a74794abbfedcae1","observation_id":"45c945fa-246a-4147-8f9f-64fecc9a50e3","resolution":{"observed_at":"2026-08-07T15:28:14.688879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.538691Z","title":"Humans or llms as the judge? a study on judgement biases, 2024 a","venue":null,"work_id":"46d97008-7a22-4527-a2eb-c1ab28f18bff","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.409355Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:98defe9b986859002e9213f77d986c6eeebbd55da648c263cad53c3f87a49322","observation_id":"1e7ab943-58d5-4e45-8989-d6ed586af534","resolution":{"observed_at":"2026-08-07T15:28:14.587348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08939","last_updated":"2024-05-28T04:32:09Z","snapshot_observed_at":"2026-08-06T03:42:39.770101Z","submitted_at":"2024-02-14T04:50:18Z","title":"Premise Order Matters in Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08939","snapshot_observed_at":"2026-08-07T15:28:08.450887Z","title":"Chi, Xuezhi Wang, and Denny Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.450887Z"},"links":{"cited_paper":"/paper/2402.08939","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:323c38e7d42e3e2dcbc5041985278ba495f1e8e0af3932121ec4c6b9b288c095","observation_id":"0d7ef445-02df-496d-bb81-bf337597a535","resolution":{"observed_at":"2026-08-07T15:28:08.450887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.444597Z","title":"Of human criteria and automatic metrics: A benchmark of the evaluation of story generation","venue":null,"work_id":"fb5abe7f-f8cc-4d44-aecc-29c7ff9f1949","year":2022},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.502773Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:b47982a12e7f067c64852acb953decf301613aaa5e7c8bd435ff9b4386c54597","observation_id":"d0015be6-7a2c-4c43-a796-579b9d683950","resolution":{"observed_at":"2026-08-07T15:28:14.488265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-02T17:07:32.299595Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T15:28:08.594167Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.594167Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:2ba527727e2712a37c54970720b39549ff574cd5bbab17e60c3a9762cfff9665","observation_id":"f9799cb4-970b-4e35-ba8e-c3918c478614","resolution":{"observed_at":"2026-08-07T15:28:08.594167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.365369Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":"6cca5bd7-f677-4fc6-8aa4-0bb3b0a1fdaa","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.640171Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:ebd4ec887f34e8bb5f4ca5eee91bf81a0e7442f78adbce335bd1295dc17bd3e8","observation_id":"2d6691a0-6d51-4edd-9f5e-8926df2563c6","resolution":{"observed_at":"2026-08-07T15:28:14.397921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.270642Z","title":"Ranking by pairwise comparisons for swiss-system tournaments","venue":null,"work_id":"42e6a311-b607-49f5-87ab-c73a0e21c9ab","year":2013},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.679816Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:7531be1dc34199796318c1173bdeb9444612b0b6ef392b973d83fa243e71f7f4","observation_id":"1a6aa0b7-0ce2-484c-9fec-a6d176015723","resolution":{"observed_at":"2026-08-07T15:28:14.315039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.182058Z","title":"The method of paired comparisons, volume 12","venue":null,"work_id":"af874b0e-a729-4e0d-aad2-29bc49fed1cb","year":1963},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.741755Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:b739dc77a21cee9a61f1d665356d505154002ccb38e5749efa78bb9f7840db7c","observation_id":"6069fd9a-d81c-47ed-9d81-93c7aaf9f6cc","resolution":{"observed_at":"2026-08-07T15:28:14.212792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:28:08.826293Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.826293Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:94b06aa875112ccf6248bbd746bd3495e9655c0669ccdb69ceb0c016beafbbe7","observation_id":"446665cf-8dd5-4de3-8efc-e0ff5235425c","resolution":{"observed_at":"2026-08-07T15:28:08.826293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:14.030163Z","title":"Rank aggregation methods for the web","venue":null,"work_id":"7ac82a0e-844e-4827-8ef0-a4542ac45c5c","year":2001},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.860405Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:f91c667c82b44852d89d28152547545f0a79631e4d056b5d25ddf3e81d34cf4d","observation_id":"f2db2e4d-2a6d-443b-90f4-870843a00bba","resolution":{"observed_at":"2026-08-07T15:28:14.106964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.906818Z","title":"Summeval: Re-evaluating summarization evaluation","venue":null,"work_id":"34a1552e-5586-4168-b54f-fa4e9aa882a6","year":2021},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:08.964922Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:c199322e8872fe4e75674cfed4196f1a59bd1e2176985b2d69ac786470562e21","observation_id":"da8ea7c2-855e-4f5a-bf8a-017ff2f09038","resolution":{"observed_at":"2026-08-07T15:28:13.961343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T15:28:09.027206Z","title":"Gptscore: Evaluate as you desire","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.027206Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6bde7cb54dd318e5d35313fd2a9600b4006ed4130a99518f00cde27f1d7599d6","observation_id":"8042578b-947a-4264-b9c7-a3660f7d2c4f","resolution":{"observed_at":"2026-08-07T15:28:09.027206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.782955Z","title":"Trueskill™: a bayesian skill rating system","venue":null,"work_id":"d2b66c72-ed61-4da9-b2e6-d462e3614d78","year":2006},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.064810Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:a7baed52ee9d92a2ca2bce70baa0512edfb88f5de1d31bb80aa32e01a49ac4b1","observation_id":"8b01b668-9df0-496a-961b-60ca7706f7f0","resolution":{"observed_at":"2026-08-07T15:28:13.835903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.664605Z","title":null,"venue":null,"work_id":"83b19b5c-42e4-449e-919c-c7ecb39086cb","year":1999},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.174549Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d74a4559e0ee7680178ac8e8aa18f207ce22a192afcfb7c2274fc1a920f053e0","observation_id":"b56986d4-cd59-4ed1-8c13-8dfcba911fe0","resolution":{"observed_at":"2026-08-07T15:28:13.709267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14520","last_updated":"2023-05-31T19:51:51Z","snapshot_observed_at":"2026-08-07T18:30:08.543417Z","submitted_at":"2023-02-28T12:23:48Z","title":"Large Language Models Are State-of-the-Art Evaluators of Translation Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14520","snapshot_observed_at":"2026-08-07T15:28:09.226377Z","title":"Large language models are state-of-the-art evaluators of translation quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.226377Z"},"links":{"cited_paper":"/paper/2302.14520","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:560bdcf4f81673936e59d784f87fedd1b72e47edc53aa7dfa31eef5b35f99584","observation_id":"e6ff5acb-ce24-4ec7-8b84-622957033dce","resolution":{"observed_at":"2026-08-07T15:28:09.226377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.268446Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.268446Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:106275aaea5f0d56136f42fb7b2a386e68d7c8b8e2f96a65f35fb2f7ea0da42b","observation_id":"339a8c9d-66c9-4d53-acbf-8cf41c0a0d9b","resolution":{"observed_at":"2026-08-07T15:28:09.268446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.310157Z","title":"Learning to rank for information retrieval","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.310157Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:68ecca85d9fd29846ff880b01c598051e88029ba684b29ecccbc89134b0d456a","observation_id":"73b61eed-2a0f-4020-a8a6-cbf2e2bca907","resolution":{"observed_at":"2026-08-07T15:28:09.310157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.389780Z","title":"G -eval: NLG evaluation using gpt-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.389780Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:50fc04f92ffb99e4973064ad37d70dcf937db00f385e04c5a6184ddeb01871a0","observation_id":"fffee44e-23f9-4fd5-a59a-e7f9814163e9","resolution":{"observed_at":"2026-08-07T15:28:09.389780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.397044Z","title":"Aligning with human judgement: The role of pairwise preference in large language model evaluators, 2024 b","venue":null,"work_id":"3f5ad0f0-53d9-42ea-8872-56c40abf20e7","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.452271Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:38b491c4ae735d535b81cd0f9238536e106e4438b6e068e26dfea7402aab8c8a","observation_id":"6340000d-5367-4002-8518-90d0d56a1d97","resolution":{"observed_at":"2026-08-07T15:28:13.546621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13590","last_updated":"2024-03-20T13:38:07Z","snapshot_observed_at":"2026-08-03T15:46:42.996627Z","submitted_at":"2024-03-20T13:38:07Z","title":"Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.13590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13590","snapshot_observed_at":"2026-08-07T15:28:11.760816Z","title":"Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models","venue":"cs.CL","work_id":"dec1581e-1737-46a0-9a70-49065d4c8319","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.490840Z"},"links":{"cited_paper":"/paper/2403.13590","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:d521667fd4ca989cfbd4e9dfa92ae09a48bd2a5d7e7baefeb8cc2a4975e76caa","observation_id":"15275cc5-d69f-428f-9750-5ce9be79c1f0","resolution":{"observed_at":"2026-08-07T15:28:11.788655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:13.136149Z","title":"LLM comparative assessment: Zero-shot NLG evaluation through pairwise comparisons using large language models","venue":null,"work_id":"a05d05cb-e9e9-46f2-9731-232333b874ff","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.555067Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:2311b939d72e8ca06ba33f4975045c4981ce94bb70347cd3e737b98844018f7b","observation_id":"4dc69aba-b45f-4250-bafe-7e67660805b5","resolution":{"observed_at":"2026-08-07T15:28:13.241221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05894","last_updated":"2024-11-12T14:06:49Z","snapshot_observed_at":"2026-07-06T18:12:09.623654Z","submitted_at":"2024-05-09T16:45:27Z","title":"Efficient LLM Comparative Assessment: a Product of Experts Framework for Pairwise Comparisons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05894","snapshot_observed_at":"2026-08-07T15:28:09.676956Z","title":"Efficient llm comparative assessment: a product of experts framework for pairwise comparisons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.676956Z"},"links":{"cited_paper":"/paper/2405.05894","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:8f017e9a8979e34aab629ea96a59357556807689ea613e2309fe645cb654dcd0","observation_id":"2da9566a-ddd2-4c3b-b617-7e6400494f5a","resolution":{"observed_at":"2026-08-07T15:28:09.676956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.955675Z","title":"Stated choice methods: analysis and applications","venue":null,"work_id":"a91e10a7-4cee-4c1e-beb8-3173d73d5940","year":2000},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.717192Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:42d4ba349b228974feb4b77ed430addbdf37dc4a08f50b216bc42b29bf0452a2","observation_id":"8d705c09-3f70-4972-8cf6-05be56ecf021","resolution":{"observed_at":"2026-08-07T15:28:12.992603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.863973Z","title":"The structure of random utility models","venue":null,"work_id":"ed9384ac-1586-4edf-b8b7-8ed7d3802cd9","year":1977},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.761167Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:62a102ea52641e131909cdb5c076af4b3bf8101c052702181b85bc9d65a32fcb","observation_id":"604b0b71-aa6f-440e-9a13-713aa2d9803b","resolution":{"observed_at":"2026-08-07T15:28:12.905404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.755331Z","title":"Trueskill 2: An improved bayesian skill rating system","venue":null,"work_id":"50f88996-3709-4da7-96be-c5deb1b3aa29","year":2018},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.855334Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:b17222ce88a1ddad503b15e379ad0ddb96a9dceaa84022480ebbcde51f406817","observation_id":"e5bcca16-bf0f-4c06-8e03-87463ceed9af","resolution":{"observed_at":"2026-08-07T15:28:12.795135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.636055Z","title":"Efficient computation of rankings from pairwise comparisons","venue":null,"work_id":"df484157-b39f-446e-8905-5f0d21af974f","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.912909Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:a1772932a0f89e3d7fe859e76a95145d6c31cef4678a9bb8019428c6263684ad","observation_id":"1ed99d0f-dab3-457f-8066-f050f4cb1d0b","resolution":{"observed_at":"2026-08-07T15:28:12.683651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:09.957908Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:09.957908Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:eb4c6b355d76bd5392cc55145989282fb22b3dc1de299113c7a76d06ebaabf05","observation_id":"f3c346b9-2726-4ab0-a5ca-f87e319bb147","resolution":{"observed_at":"2026-08-07T15:28:09.957908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01015","last_updated":"2024-07-18T02:00:41Z","snapshot_observed_at":"2026-07-31T02:23:58.710857Z","submitted_at":"2024-04-01T09:35:06Z","title":"PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison","version":2},"cited_work":{"arxiv_id":"2404.01015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01015","snapshot_observed_at":"2026-08-07T15:28:11.540931Z","title":"PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison","venue":"cs.CL","work_id":"898602b8-a074-44b9-9be0-2e9dab03d23d","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.001331Z"},"links":{"cited_paper":"/paper/2404.01015","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:a748adf552aa080f7625996ff0b3951a06ab7ab58ce71183c941458ddcbb1953","observation_id":"a898b7d7-b1e6-4c88-990c-ea67df9c3fb8","resolution":{"observed_at":"2026-08-07T15:28:11.613917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17563","last_updated":"2024-03-28T13:59:09Z","snapshot_observed_at":"2026-07-06T15:48:44.267376Z","submitted_at":"2023-06-30T11:32:25Z","title":"Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17563","snapshot_observed_at":"2026-08-07T15:28:10.098915Z","title":"Large language models are effective text rankers with pairwise ranking prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.098915Z"},"links":{"cited_paper":"/paper/2306.17563","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:3243d621d017a283cac4237c6c2dbc601cd3a3fec4a17bf16e73bac2df2a0af7","observation_id":"e1e43ffc-2cc6-4775-9367-77bafad316bf","resolution":{"observed_at":"2026-08-07T15:28:10.098915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:10.160968Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.160968Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:671b16f5db44a4542afc9f6f4976fa06c9cc5d657d28e390aa4a3f65034cb8a3","observation_id":"a45b21d5-04e9-4df4-9199-7dcac28bfe06","resolution":{"observed_at":"2026-08-07T15:28:10.160968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15979","last_updated":"2024-09-24T11:21:43Z","snapshot_observed_at":"2026-08-06T10:06:23.217027Z","submitted_at":"2024-09-24T11:21:43Z","title":"Finetuning LLMs for Comparative Assessment Tasks","version":1},"cited_work":{"arxiv_id":"2409.15979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15979","snapshot_observed_at":"2026-08-07T15:28:11.347314Z","title":"Finetuning LLMs for Comparative Assessment Tasks","venue":"cs.CL","work_id":"3158de9d-91b4-49a4-a976-772f11d7677f","year":2024},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.202374Z"},"links":{"cited_paper":"/paper/2409.15979","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:2e38e95f1ec77645b24e87b1b27ef3b044997a9f76f3dc6bd7329581b8d8e10c","observation_id":"f1abfbcf-c988-4af7-b6c5-960383d42a60","resolution":{"observed_at":"2026-08-07T15:28:11.376856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:10.260157Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.260157Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:5615bbedd9bab6a5efd327d04563cc5b4c30fffd9214da598aca7b395a0740b6","observation_id":"1b2d98d3-156a-4685-a01b-f136671e54a9","resolution":{"observed_at":"2026-08-07T15:28:10.260157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-07-06T14:59:50.271022Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-07T15:28:10.352664Z","title":"Is chatgpt a good nlg evaluator? a preliminary study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.352664Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:1a1748874cdbb8109db601f1093f9a8215a0413ef330d86add7fb3092685b522","observation_id":"9ef6c73d-62fc-4021-b73b-af03aada0b01","resolution":{"observed_at":"2026-08-07T15:28:10.352664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.464357Z","title":"Large language models are not fair evaluators, 2023 b","venue":null,"work_id":"fe6a49bf-1099-4ec2-b319-2c7a1f209c1d","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.387688Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:7b973bb9eb979d2a68402739d0048b680aeb5441adaaff99e4ccdad53d9f7608","observation_id":"e62c44d6-1bf2-4314-b9dd-834bdb2ca0b6","resolution":{"observed_at":"2026-08-07T15:28:12.506759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:10.453435Z","title":"Primacy effect of C hat GPT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.453435Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:dc44dcdb9e28a9d5498224e2a3e95fe33cbe66b0d70cfcf02c08e7a464656476","observation_id":"d010cadd-bc90-4b67-98f0-71747f35ac9e","resolution":{"observed_at":"2026-08-07T15:28:10.453435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-07T15:28:10.548443Z","title":"Self-instruct: Aligning language models with self-generated instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.548443Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:9ae826d37e1efa0db54beff70e3e54dbdfec996e6a6bbd6750bd8886167a0c99","observation_id":"ab765c02-662e-40be-9d11-00c87efb2024","resolution":{"observed_at":"2026-08-07T15:28:10.548443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4249/scholarpedia.3879","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:11.022352Z","title":null,"venue":null,"work_id":"a9742c3b-9933-4e86-ae40-3c5083253186","year":2007},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.610236Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:c402e10743f742f3b9891f240869a89722d2620142b37c9b4def1a67cbbfe226","observation_id":"e96b7956-0621-4486-b72c-160692212958","resolution":{"observed_at":"2026-08-07T15:28:11.117158Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.335993Z","title":"Die berechnung der turnier-ergebnisse als ein maximumproblem der wahrscheinlichkeitsrechnung","venue":null,"work_id":"345670ce-fa87-4591-8cce-17420f285ac1","year":1929},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.723001Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:693af3967546f94fa68bb4428d87ccfef695079f6ac51812c18e5b6e440c312b","observation_id":"240c239b-42aa-4f59-a97f-d2e88c222feb","resolution":{"observed_at":"2026-08-07T15:28:12.399371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T15:28:10.779957Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.779957Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:fa2a9c0aff071f8aac76a9693ad2b0d9d2c0a2182c90f09fc24b6565882c0db1","observation_id":"af9ba3e4-36ba-4be3-85fa-bb043de809d4","resolution":{"observed_at":"2026-08-07T15:28:10.779957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.215866Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"ddec0245-f963-4e18-bb30-082b713a4c6d","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.828110Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:6016fc89886761d8141a8f1bfe8488cbe16913d68998f841861897bed0936073","observation_id":"3954a661-deb0-4836-96b3-456b129590b5","resolution":{"observed_at":"2026-08-07T15:28:12.275766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:12.075786Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":"e18b5496-bc99-4a09-b130-e79760ab0303","year":2023},"citing_paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:28:10.894434Z"},"links":{"citing_paper":"/paper/2505.15240"},"observation_digest":"sha256:e2b1c88f2adfe437ab5a97cc6f6691ceec44d0048353cd117c5f3df99b3ddc28","observation_id":"9b426243-0836-4127-a569-ebc5eb8d8e14","resolution":{"observed_at":"2026-08-07T15:28:12.145963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15240","last_updated":"2025-05-21T08:16:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T18:30:35.667211Z","submitted_at":"2025-05-21T08:16:18Z","title":"Generalised Probabilistic Modelling and Improved Uncertainty Estimation in Comparative LLM-as-a-judge"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":21},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2505.15240."}