Pith. sign in

Paper Citation Record · LEDGER

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

As of 12 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2605.21748.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.21748 v1

Coverage vector

measured 68 of 68 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-22T08:50:44.523468Z

measured 68 of 68 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

68 of 68 outbound references displayed

  • verified exact12
  • verified fuzzy51
  • unresolved3
  • parse uncertain1
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c397a752-f00f-463b-81e8-9c74ad5378f6 · outbound

This paper cites Judg- ing LLM-as-a-Judge with MT-Bench and Chatbot Arena.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Judg- ing LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.865131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:c923c5f524339b843b87d9db34803643f1461398e9f860d149a5b5b47478303d

Observation 4b8b526f-84d0-44ef-904d-c9566cb7bf0c · outbound

This paper cites Gonzalez, and Ion Stoica.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Gonzalez, and Ion Stoica

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.805126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:14916d8bf0e8183860d4ab15173cec1161f67b3ea0db2bccb051d78ed1f906a3

Observation 2dbe8f62-9060-477b-a248-2d40c0304930 · outbound

This paper cites Gonzalez, and Ion Stoica.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Gonzalez, and Ion Stoica

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.808289Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:500df37fadd3705d596ec203ef9889aefe53815d0d6aa1d6c444b3b31dc1f60a

Observation bbb4ce5c-909c-4a56-b2c6-0e15503beb4b · outbound

This paper cites LLMs Get Lost In Multi-Turn Conversation.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator LLMs Get Lost In Multi-Turn Conversation

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:51:18.080704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:9118bafad9473743cd5f64cfd7c595bf6e153e40a6ca582725e2def0dc79e8cc

Observation 19550c42-0882-4a97-a7e3-2aa784fb7ec7 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Measuring Massive Multitask Language Understanding

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.854276Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:48651c57e111be7794d3a6b11d12333d36cf599b6ddd4b79bfdce08f2b873363

Observation 77a09f96-5efa-42dc-a74e-bf6429047934 · outbound

This paper cites Pervasive label errors in test sets destabilize machine learning benchmarks.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Pervasive label errors in test sets destabilize machine learning benchmarks

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.857850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:10a42bbba6cdd9d45386519be5a8909f45fd55db0cf5e779c0477ddb87b17cfe

Observation dc71affc-4384-4226-9cc2-6a61c34c550b · outbound

This paper cites an unresolved cited work.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-05-22T08:51:18.846535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:2d3c504806bbf2c345def958c0b28266aa59886524bfcdd7c1ce82493723c067

Observation 4797f7bc-e324-429a-a53d-548359216bb5 · outbound

This paper cites EIP: Weighted ranking of LLMs by quantifying question difficulty.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator EIP: Weighted ranking of LLMs by quantifying question difficulty

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.836457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:33d67e422f3f2bba5a73fb49808772e5ddeafe6458c2fa8833bafb74bc150276

Observation 8388305f-03e0-4594-86aa-69862c853af4 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Training Verifiers to Solve Math Word Problems

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:51:18.100961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:75fa49a94d56d692ef69b9f11d1aa6fcddb60e94dfa1a8af1281cfebb745ab32

Observation 41850b87-4dfb-4506-86ee-82b20beb4ebc · outbound

This paper cites MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.896127Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:61ac8c42d0344bf7d0bbc1310ef9dd17d893b3a2ba35dc33e0cbe4a93bc1b012

Observation 0d643d0f-9c26-4fd2-a221-3ca604943af9 · outbound

This paper cites Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier LLMs.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier LLMs

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.888856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d7a2df70013eba059fb5f5fa42abc29c947b5af5c28518ae530a61ebab3cff22

Observation 5c6d17e7-c342-42a6-8b72-14dcfcec858c · outbound

This paper cites MT-Eval: A multi-turn capabilities evaluation benchmark for large language models.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MT-Eval: A multi-turn capabilities evaluation benchmark for large language models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.892628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:ed1403101c89b53bb10b2d5408f18a66ed4363b74f8e2c05ab96bdec103aa66f

Observation feaf168f-dd20-4bc9-bfc6-145b91e19e42 · outbound

This paper cites Hal- luHard: A Hard Multi-Turn Hallucination Benchmark.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Hal- luHard: A Hard Multi-Turn Hallucination Benchmark

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-22T08:51:18.136649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d267819c242f8d4065abca27f4a2f592ba6d92b712c9f5290c133d64257375fd

Observation 4d9eb932-1397-4d66-96b2-5bd407f1352a · outbound

This paper cites MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-08-12T01:20:07.167103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d73043de739a8cf5774858f67bafb075662ea12fd87af8b244b5af865d134177

Observation 6fec7f69-89a1-40dd-9c9d-864d82518f8e · outbound

This paper cites Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:51:18.155417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:c0fe63365b962f070695947ae3eda634ee08040a695a6761433219eb86a9e4a9

Observation 1e1e2d7f-8f8c-47be-abde-f937c9b5a805 · outbound

This paper cites Training language models to follow instructions with human feedback.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Training language models to follow instructions with human feedback

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.941074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:373d4857ebec189d1958ad32f3981d13d763676212cf3b05e969f072505fff9c

Observation cf3b7733-0e33-46d6-aedd-4d2fefc8b75d · outbound

This paper cites Deep reinforcement learning from human preferences.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Deep reinforcement learning from human preferences

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.916981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:c70fffe40003657ed4b4f87fea25378866375e864d0b9c694421f62cc9c96bc5

Observation 3c2d4c3a-4079-4c54-87cb-98deaa7e474e · outbound

This paper cites Learning to summarize with human feedback.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Learning to summarize with human feedback

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.772034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:5b2ff0a306d0d845628934cb84425f91505b957af1747ba08ec7ccb7903ff82e

Observation 4b05c606-d779-4baf-9e46-a6356531a9e8 · outbound

This paper cites Ask a Strong LLM Judge when Your Reward Model is Uncertain.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Ask a Strong LLM Judge when Your Reward Model is Uncertain

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.794782Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:e4672ae571a908efb1bbb52456d30678f0e42d27326081cd5af2020d65c8ecb1

Observation f41e1909-b7c1-4630-8ac6-fd8c9a964595 · outbound

This paper cites Is ChatGPT a Good NLG Evaluator? A Preliminary Study.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Is ChatGPT a Good NLG Evaluator? A Preliminary Study

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.811898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:f4ee11a7879b9f0a5237c836abce46f7e3a20a8e763245e1cbbf0b66ed1e9f4b

Observation a6bcf78d-c174-4a8c-bf50-a055da0767f5 · outbound

This paper cites G- Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator G- Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.906332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:275f37a6d1f376c72993d784a5ed5e27cd721cc525de4672a492fbf6cb1d1c6a

Observation 4443390c-581f-44a1-b74b-4d1c0b3c8ab9 · outbound

This paper cites RLAIF vs.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator RLAIF vs

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.839589Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:daffce4d7b0157ff47d5b783147de908e823b88b57d6d4fa2a6b4e3b187d67a8

Observation 0a06a47f-9ec7-488a-a628-7c8396bfe37b · outbound

This paper cites Prometheus: Inducing fine-grained evaluation capability in language models.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Prometheus: Inducing fine-grained evaluation capability in language models

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.791104Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d02c8e938e55f62fee63304144a840377fbc94e9390994bc299464eb882b14c3

Observation 8dc8fe2b-9429-45fa-9399-44eed1ffe47f · outbound

This paper cites Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.798428Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:b70e2733bf4e229b97f5a92d01d4b2ba6229c767ade9602b0208e915fa5663b3

Observation b386ce00-2394-4ca6-a25b-82d851a64f3c · outbound

This paper cites WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.952962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:c00e856ef86bc3dac5e5a86a7b365c33d70ffbda2f82c13a23302123d148c1b3

Observation 6e5767bd-8062-46ec-a391-e05dca7cdd8c · outbound

This paper cites MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.832720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d7bcf2e46a3671df9f222fdd5eb4aef5bd12a630e92060bced0b2e0cfde3d099

Observation c554d2b5-d24d-4f14-b2cf-97bc3b522b19 · outbound

This paper cites MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-28T02:04:07.990420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:39b8ab3e26503155d0f9ad423e3ab27d9efb424885820f35231283ab2c2bf524

Observation 8b0cf3f7-beb6-41af-8351-99b6a3089e43 · outbound

This paper cites J1: Incentivizing thinking in LLM-as-a-judge via reinforcement learning.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator J1: Incentivizing thinking in LLM-as-a-judge via reinforcement learning

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.781530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:215d69560fe362309e6b6784c3a47b56629471c305446083270218b28299765e

Observation 0f11318c-4357-42f5-9019-f685a6176449 · outbound

This paper cites RM-R1: Reward Modeling as Reasoning.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator RM-R1: Reward Modeling as Reasoning

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.761305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:2d4df7cd3fe5342caa0dec03fc17dd4159c35a21f7f905a5a0981903e5343a6d

Observation 5090c3c7-0887-4b8b-9010-ec258418ef6e · outbound

This paper cites Evaluat- ing large language models at evaluating instruction following.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Evaluat- ing large language models at evaluating instruction following

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.819066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:f409b214d8d2d3f6e33968a5411e859b9e6d9d60fb0cd9461063a5cce3033a16

Observation dd157f75-b655-4451-b48a-a27f23f7eeec · outbound

This paper cites JudgeBench: A Benchmark for Evaluating LLM- Based Judges.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator JudgeBench: A Benchmark for Evaluating LLM- Based Judges

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.944842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:2a2cb7d05723c419a8d8cd26fb1b2c8d9994f0964172029a62b6c5774a133068

Observation 5ef7233e-79cf-4dcd-a599-be05daa0628f · outbound

This paper cites Does context matter? ContextualJudgeBench for evaluating LLM-based judges in contextual settings.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Does context matter? ContextualJudgeBench for evaluating LLM-based judges in contextual settings

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.948784Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:ba7dcc85d66ce97450f9ac6f04063dcae2672d2715380f77f243872f94b95702

Observation 6be2ca06-9dfa-41cd-a413-b8ce2d723752 · outbound

This paper cites DHP benchmark: Are LLMs good NLG evaluators? InFindings of the Association for Computational Linguistics: NAACL 2025.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator DHP benchmark: Are LLMs good NLG evaluators? InFindings of the Association for Computational Linguistics: NAACL 2025

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.875097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:bc397f51ef0e74b6ca164b13166ae363fbbe86331bd2a5070d1dc8de8b35a714

Observation 930b188d-1083-4cfb-94d0-b740ef599e7c · outbound

This paper cites ReIFE: Re-evaluating instruction-following evaluation.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator ReIFE: Re-evaluating instruction-following evaluation

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.932601Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d1ac9f59336f4a7fdcadef1a0eec283782737fa23b8e61c78afe02478d96303f

Observation b945eefa-c929-4d80-a575-679be178343f · outbound

This paper cites JuStRank: Benchmarking LLM judges for system ranking.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator JuStRank: Benchmarking LLM judges for system ranking

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.758596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:0c5e0303e51172e0b73f2dfb2bf49593ecd4618fa9b5ccf557c04a9d34476249

Observation fec24612-ca4b-49ed-8c28-522874057890 · outbound

This paper cites Judge Arena: Benchmarking LLMs as Evaluators.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Judge Arena: Benchmarking LLMs as Evaluators

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.825816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:942e2a2f444dbd1be984e5a57c93ed1709c68d5b10fc3ea462d8b3f50127396f

Observation 41eab83e-6521-4db8-a67a-75b282aea111 · outbound

This paper cites MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.843456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:8c28c698fa25112dca74aef1b12748f193e724dfe8331a7431964e1a68742230

Observation ba92f790-1a9c-4d40-8b39-598a5081d137 · outbound

This paper cites MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.927169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:ac615ce8da39680469ab97655316f2e723cf900c606ee8287b6eafacf31d5b93

Observation 61ff39ff-1311-4d2c-ab9b-a12dae368ce2 · outbound

This paper cites AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-22T08:51:18.143727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:cd26880dd2ff2a49bca864a3d2d827946779dbd1012ad60b1191402359df5362

Observation cd2a0700-e44f-4903-9643-9dede2d6fcab · outbound

This paper cites LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-08-07T01:35:49.493310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:91cfcae4b479f0b62afbaa59fabccc2b0c4f64ba5f804bf07da65cdeda194a6e

Observation be4c97ff-f6fe-4a64-9e0a-f2ae63ab1b14 · outbound

This paper cites Judging the judges: A systematic study of position bias in LLM-as-a-judge.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Judging the judges: A systematic study of position bias in LLM-as-a-judge

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.850788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:b2866b5ad0c48e9f8dce3800b7b623962c2d77f54225ddaa26a24c1a70311fc1

Observation 4d88b8b3-83c2-4d2a-a323-e729364e90a7 · outbound

This paper cites Wider and Deeper LLM Networks are Fairer LLM Evaluators.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Wider and Deeper LLM Networks are Fairer LLM Evaluators

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-22T08:51:18.089396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:33c7009a4cc7880ba75e0e30e761b5454ae23f8cd2811a552047bc712f5cbf77

Observation 172b778a-1a33-40fa-b5ae-2f65f75578ae · outbound

This paper cites Reasoning Gets Harder for LLMs Inside A Dialogue.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Reasoning Gets Harder for LLMs Inside A Dialogue

Reference 43

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:51:18.072705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:26b58e6cd2c30fe36044c8d69997e2328a143a6941d019df92b25e125aab6719

Observation 683b3e46-d2b5-4043-aa98-94d0428e0b27 · outbound

This paper cites Gemini 3.1 pro.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Gemini 3.1 pro

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.829329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:7a30dfa69746251e515be7fb644d865d96678421cb6b1a897823fe2318f56959

Observation ccc7a5d7-1e24-412e-8693-b9fa25f3ff09 · outbound

This paper cites Cresswell.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Cresswell

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.900114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:07b08cda07613c9610ae098337c3c87ac2757cf8984fb2eb8428784587fec97c

Observation 6de7d784-c2fc-4677-8d3b-4db9d9541aba · outbound

This paper cites HaluEval: A Large- Scale Hallucination Evaluation Benchmark for Large Language Models.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator HaluEval: A Large- Scale Hallucination Evaluation Benchmark for Large Language Models

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.822472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:cedf4a091f8a507f0699fb9f165fbfcefbe0f43c1ed46ba451a73c3ea3c17ee8

Observation ca6b4567-6dfe-46b2-9661-1e97a9db6637 · outbound

This paper cites Aegis: Automated error generation and attribution for multi-agent systems.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Aegis: Automated error generation and attribution for multi-agent systems

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.957412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:8d28c77c208df8b066c1bfed518da5d7507e933954799cc3d6d6aa70f48cb82d

Observation ed875923-2118-4878-8ba8-135a5e9cebf5 · outbound

This paper cites Self-critiquing models for assisting human evaluators.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Self-critiquing models for assisting human evaluators

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:51:18.130045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:8e34d0d6f1ef6e820639e2109cfff74bfa2164f1eff34f85ea4a747c57f962d3

Observation 6cb3bf21-fac4-44e9-9d8d-92424ee6e417 · outbound

This paper cites Let’s Verify Step by Step.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Let’s Verify Step by Step

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.774986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:33876438b47ee93f5fa2c9934bfc16c6fd585672ba04b5845a5d3f1f9bcfb247

Observation 579a2790-fb87-46d6-89b6-1909f593d008 · outbound

This paper cites Variable Selection using MM Algorithms.Annals of Statistics, 33(4):1617.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Variable Selection using MM Algorithms.Annals of Statistics, 33(4):1617

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.785272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:0786547b795d30ae922671eb4a2f0c7432281db377ea0f3025a57c83c53c0ad1

Observation 6a450c63-f270-44cb-895e-2869749cfd77 · outbound

This paper cites Qwen3.5: Accelerating productivity with native multimodal agents, February 2026.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Qwen3.5: Accelerating productivity with native multimodal agents, February 2026

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.765052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:22d975a5704026486110b0cd35e9920dab7c5f7836a259a5ce1d758e180d6739

Observation 420aa937-2190-4f6a-8bd9-1c546bed339c · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator LoRA: Low-Rank Adaptation of Large Language Models

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.881884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:5a3fe262a52a32ff2f6f4386530bc96bc2b18d6a8caab77908a032a994d4dce0

Observation a80995b6-849b-4966-ab97-4c25de1c87d7 · outbound

This paper cites RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:51:18.149296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:5003e97aa63697b5e04ebba2f404f1bed6480d1a6349772c9849c985a9d827f4

Observation 71b6ff74-255d-47af-b9a5-d1a5af028ee6 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.885143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:4e378823162ccd4dca3b70a5417010460d482cad1193eae36a706362f0227160

Observation fe92fe42-b33e-4bf5-b91f-f4a716ce4311 · outbound

This paper cites SP500-EDGAR-10K.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator SP500-EDGAR-10K

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.751903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:0b608f6600b3382067fc0f2d91135f5140707cf40080f7f1ac4d464894bd27fb

Observation b70199df-1dba-4c23-ac8d-45b9595ab487 · outbound

This paper cites OpenRouter.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator OpenRouter

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.778427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:a8b6fa2ac5f301d57ee3384fe4ba266be5c16b7207d1d9413a74d370c734b97f

Observation 2fb722dc-c9ec-4b27-9f66-a60cb9d2502b · outbound

This paper cites Think-J: Learning to Think for Generative LLM-as-a-Judge.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Think-J: Learning to Think for Generative LLM-as-a-Judge

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.815627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:f40dfb26caf36afcac05e1401c9c726d96f22c92160dd6cbcb1e84077849d865

Observation d2c64139-9ed3-4a90-81bd-fc1b503b645d · outbound

This paper cites Claude Opus 4.7 System Card.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Claude Opus 4.7 System Card

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.768378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:83d548b6eeb184732b18962723c45b2db854f3621ee8c63c8db189a18c7d68d2

Observation 2abb1c9f-cbf9-4aee-83e3-94a9ed4362f2 · outbound

This paper cites an unresolved cited work.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Unresolved cited work

Reference 59

Resolution
parse uncertain
raw_fallback, observed 2026-05-22T08:51:18.861286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:a0d71f6049e9d5ae3173abf7720cfbfecfa7dfa90efb60295389b09691b942c3

Observation 71cfcdf7-1810-4818-84f1-0eacfc9b5dc3 · outbound

This paper cites Language models with conformal factuality guarantees.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Language models with conformal factuality guarantees

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.801961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:54202a0efd4952d975e6ec6a33d837bc959acd8f1ddc4220b5441ba8657d9022

Observation 4c325267-5ef6-4c53-b287-7aff4030d433 · outbound

This paper cites Cresswell.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Cresswell

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.878289Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:d08ce9357e7391211023eb0890d1bcbca8429ef4ef35147977701a38d763f087

Observation 0bead259-eb68-4fbb-90c0-0be214c92082 · outbound

This paper cites Cresswell.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Cresswell

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.871938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:7fa00c31e22a00fb3243e0337f1bfea23c8b00673b36b65e20396d0eaa54fd80

Observation a4557e47-a7b4-4e1a-9a67-f7edcf2c5ce1 · outbound

This paper cites Round 2 is mostly clear and foregrounds the main correction, so it does not actually exhibit the required disorganized flaw.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Round 2 is mostly clear and foregrounds the main correction, so it does not actually exhibit the required disorganized flaw

Reference 63

Resolution
malformed identifier
raw_fallback, observed 2026-05-22T08:51:18.868771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:5a7327b22879f066c7f52524daa3b5c8bfa6c3d361bc356dcaa553a40618b438

Observation bf41c687-2e54-4d73-b386-18108eaf8236 · outbound

This paper cites an unresolved cited work.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-05-22T08:51:18.903260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:8d4a788c2128d83d4e83edb94e874bbf8eef1795f15053f13195b586ce95da93

Observation 668fe133-2b7c-4869-b66c-8a697b3f768e · outbound

This paper cites The plan is a single narrative paragraph rather than a turn-by-turn script, but it must be specific enough to determine which turn realises the flaw.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator The plan is a single narrative paragraph rather than a turn-by-turn script, but it must be specific enough to determine which turn realises the flaw

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.755299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:ea32149503de096395290b117e54ac7f1eca3dfab316d41b0ac5bce13145ae9e

Observation fa53d657-1330-411f-a386-383bd90f5f44 · outbound

This paper cites If convo_b exhibits a different assistant_behavior_type than the one declared, or if no turn realises the planned flaw, labelnoise.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator If convo_b exhibits a different assistant_behavior_type than the one declared, or if no turn realises the planned flaw, labelnoise

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.937149Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:4b3f3146bcc1e38387e5df3c528fb210737d3e947f8a69bfd99c19d364b1d96b

Observation 7dd63a76-9ca5-484e-a893-3fad2ae72ad8 · outbound

This paper cites an unresolved cited work.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-05-22T08:51:18.909601Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:9c6750fec7c74cffe2b1a7a9add6d63f70c4aea1e9000791e713a39696db7946

Observation 547edbe0-0634-40b1-a7a3-cbcd019d2d44 · outbound

This paper cites those little indicator things.

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator those little indicator things

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T08:51:18.912874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T08:50:44.523468Z digest=sha256:932d647184493bc1e9d2f728f6ba768b5e6b29ebbfd146ec12eca34d16f5c88b

Pith citing papers

No inbound Pith citation observations are available.