{"as_of":"2026-08-12T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5eaa6a62b8cb536fb83269747aac6bc448f837d9d182d2ba97f63b4504b497a3","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T08:50:44.523468Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21748/citation-record","integrity":"/paper/2605.21748/integrity","json":"/paper/2605.21748/citation-record.json","paper":"/paper/2605.21748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judg- ing LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":null,"work_id":"f8cbe8bc-7a47-4694-9929-f0ae64cb653c","year":2023},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:c923c5f524339b843b87d9db34803643f1461398e9f860d149a5b5b47478303d","observation_id":"c397a752-f00f-463b-81e8-9c74ad5378f6","resolution":{"observed_at":"2026-05-22T08:51:18.865131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"ce58395b-80e2-47dd-9df8-7a7c9ce3f343","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:14916d8bf0e8183860d4ab15173cec1161f67b3ea0db2bccb051d78ed1f906a3","observation_id":"4b8b526f-84d0-44ef-904d-c9566cb7bf0c","resolution":{"observed_at":"2026-05-22T08:51:18.805126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"f4dc2eea-6058-4540-85a3-b65d979f29d7","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:500df37fadd3705d596ec203ef9889aefe53815d0d6aa1d6c444b3b31dc1f60a","observation_id":"2dbe8f62-9060-477b-a248-2d40c0304930","resolution":{"observed_at":"2026-05-22T08:51:18.808289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06120","last_updated":"2025-05-09T15:21:44Z","snapshot_observed_at":"2026-08-08T19:35:51.229758Z","submitted_at":"2025-05-09T15:21:44Z","title":"LLMs Get Lost In Multi-Turn Conversation","version":1},"cited_work":{"arxiv_id":"2505.06120","doi":"10.18653/v1/2024.acl-short.54","metadata_source":"pith","pith_arxiv_id":"2505.06120","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLMs Get Lost In Multi-Turn Conversation","venue":"cs.CL","work_id":"01fa2ab4-4b40-4e8a-9487-2de7db19cfe2","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2505.06120","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:9118bafad9473743cd5f64cfd7c595bf6e153e40a6ca582725e2def0dc79e8cc","observation_id":"bbb4ce5c-909c-4a56-b2c6-0e15503beb4b","resolution":{"observed_at":"2026-05-22T08:51:18.080704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":"c9adb848-863f-40a7-911a-e6986e67093b","year":2021},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:48651c57e111be7794d3a6b11d12333d36cf599b6ddd4b79bfdce08f2b873363","observation_id":"19550c42-0882-4a97-a7e3-2aa784fb7ec7","resolution":{"observed_at":"2026-05-22T08:51:18.854276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pervasive label errors in test sets destabilize machine learning benchmarks","venue":null,"work_id":"a09c74b0-adf1-495d-a3b4-68be7391f825","year":2021},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:10a42bbba6cdd9d45386519be5a8909f45fd55db0cf5e779c0477ddb87b17cfe","observation_id":"77a09f96-5efa-42dc-a74e-bf6429047934","resolution":{"observed_at":"2026-05-22T08:51:18.857850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"42ff462a-b342-4d2a-93d1-9c16de516a22","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:2d3c504806bbf2c345def958c0b28266aa59886524bfcdd7c1ce82493723c067","observation_id":"dc71affc-4384-4226-9cc2-6a61c34c550b","resolution":{"observed_at":"2026-05-22T08:51:18.846535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EIP: Weighted ranking of LLMs by quantifying question difficulty","venue":null,"work_id":"baaf348e-5f64-4249-b938-cb6ca9e8c00a","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:33d67e422f3f2bba5a73fb49808772e5ddeafe6458c2fa8833bafb74bc150276","observation_id":"4797f7bc-e324-429a-a53d-548359216bb5","resolution":{"observed_at":"2026-05-22T08:51:18.836457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:75fa49a94d56d692ef69b9f11d1aa6fcddb60e94dfa1a8af1281cfebb745ab32","observation_id":"8388305f-03e0-4594-86aa-69862c853af4","resolution":{"observed_at":"2026-05-22T08:51:18.100961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback","venue":null,"work_id":"cdd5ed70-a227-49fe-8b30-ac730f94c2b9","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:61ac8c42d0344bf7d0bbc1310ef9dd17d893b3a2ba35dc33e0cbe4a93bc1b012","observation_id":"41850b87-4dfb-4506-86ee-82b20beb4ebc","resolution":{"observed_at":"2026-05-22T08:51:18.896127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier LLMs","venue":null,"work_id":"b403c14f-c072-45ce-a3a6-b1e9454996ab","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:d7a2df70013eba059fb5f5fa42abc29c947b5af5c28518ae530a61ebab3cff22","observation_id":"0d643d0f-9c26-4fd2-a221-3ca604943af9","resolution":{"observed_at":"2026-05-22T08:51:18.888856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MT-Eval: A multi-turn capabilities evaluation benchmark for large language models","venue":null,"work_id":"183989f0-02d1-4153-849b-4f81fc8b81e7","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:ed1403101c89b53bb10b2d5408f18a66ed4363b74f8e2c05ab96bdec103aa66f","observation_id":"5c6d17e7-c342-42a6-8b72-14dcfcec858c","resolution":{"observed_at":"2026-05-22T08:51:18.892628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.918208Z","title":"Hal- luHard: A Hard Multi-Turn Hallucination Benchmark","venue":null,"work_id":"0d02fae5-c7b1-4f3a-8d8f-a011016e168a","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:d267819c242f8d4065abca27f4a2f592ba6d92b712c9f5290c133d64257375fd","observation_id":"feaf168f-dd20-4bc9-bfc6-145b91e19e42","resolution":{"observed_at":"2026-05-22T08:51:18.136649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.24188","last_updated":"2026-08-10T20:51:49Z","snapshot_observed_at":"2026-08-12T06:19:06.930018Z","submitted_at":"2026-02-27T17:13:20Z","title":"MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games","version":2},"cited_work":{"arxiv_id":"2602.24188","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.24188","snapshot_observed_at":"2026-08-12T01:20:07.167103Z","title":"MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games","venue":null,"work_id":"6dba0189-6ac7-44c9-94b2-533e4f370d80","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2602.24188","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:54eae5bd9ff763acffbda7055e888f230df4362b068f23ca0a07efa12e50e215","observation_id":"4d9eb932-1397-4d66-96b2-5bd407f1352a","resolution":{"observed_at":"2026-08-12T01:20:07.167103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04717","last_updated":"2026-04-20T02:55:07Z","snapshot_observed_at":"2026-07-06T21:05:11.303685Z","submitted_at":"2025-04-07T04:00:08Z","title":"Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models","version":6},"cited_work":{"arxiv_id":"2504.04717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.04717","snapshot_observed_at":"2026-07-04T01:19:21.999006Z","title":"Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models","venue":"cs.CL","work_id":"9b4fa784-bc79-4e0d-bf71-1b63249eb302","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2504.04717","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:c0fe63365b962f070695947ae3eda634ee08040a695a6761433219eb86a9e4a9","observation_id":"6fec7f69-89a1-40dd-9c9d-864d82518f8e","resolution":{"observed_at":"2026-05-22T08:51:18.155417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"06878d83-0f86-4d4a-b27b-5137b16e4aea","year":2022},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:373d4857ebec189d1958ad32f3981d13d763676212cf3b05e969f072505fff9c","observation_id":"1e1e2d7f-8f8c-47be-abde-f937c9b5a805","resolution":{"observed_at":"2026-05-22T08:51:18.941074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"473002d9-461f-4e53-9bf5-c016b547743d","year":2017},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:c70fffe40003657ed4b4f87fea25378866375e864d0b9c694421f62cc9c96bc5","observation_id":"cf3b7733-0e33-46d6-aedd-4d2fefc8b75d","resolution":{"observed_at":"2026-05-22T08:51:18.916981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"66591ac1-06ad-446c-b1f6-0793727cc1c5","year":2020},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:5b2ff0a306d0d845628934cb84425f91505b957af1747ba08ec7ccb7903ff82e","observation_id":"3c2d4c3a-4079-4c54-87cb-98deaa7e474e","resolution":{"observed_at":"2026-05-22T08:51:18.772034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ask a Strong LLM Judge when Your Reward Model is Uncertain","venue":null,"work_id":"adc26202-53d7-4059-9a0f-e536e4b95185","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:e4672ae571a908efb1bbb52456d30678f0e42d27326081cd5af2020d65c8ecb1","observation_id":"4b05c606-d779-4baf-9e46-a6356531a9e8","resolution":{"observed_at":"2026-05-22T08:51:18.794782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","venue":null,"work_id":"06cc7523-7ef6-4c59-98ce-542a0561e149","year":2023},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:f4ee11a7879b9f0a5237c836abce46f7e3a20a8e763245e1cbbf0b66ed1e9f4b","observation_id":"f41e1909-b7c1-4630-8ac6-fd8c9a964595","resolution":{"observed_at":"2026-05-22T08:51:18.811898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G- Eval: NLG Evaluation using GPT-4 with Better Human Alignment","venue":null,"work_id":"543d6301-97e3-40df-aead-c52abcecb2ef","year":2023},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:275f37a6d1f376c72993d784a5ed5e27cd721cc525de4672a492fbf6cb1d1c6a","observation_id":"a6bcf78d-c174-4a8c-bf50-a055da0767f5","resolution":{"observed_at":"2026-05-22T08:51:18.906332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLAIF vs","venue":null,"work_id":"860d619d-5e9e-47a8-9163-70eb378fe37e","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:daffce4d7b0157ff47d5b783147de908e823b88b57d6d4fa2a6b4e3b187d67a8","observation_id":"4443390c-581f-44a1-b74b-4d1c0b3c8ab9","resolution":{"observed_at":"2026-05-22T08:51:18.839589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models","venue":null,"work_id":"074d80f6-9342-4acc-a680-92e6d7945aa3","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:d02c8e938e55f62fee63304144a840377fbc94e9390994bc299464eb882b14c3","observation_id":"0a06a47f-9ec7-488a-a628-7c8396bfe37b","resolution":{"observed_at":"2026-05-22T08:51:18.791104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge","venue":null,"work_id":"268f6373-c634-4002-8b0d-a3825373132d","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:b70e2733bf4e229b97f5a92d01d4b2ba6229c767ade9602b0208e915fa5663b3","observation_id":"8dc8fe2b-9429-45fa-9399-44eed1ffe47f","resolution":{"observed_at":"2026-05-22T08:51:18.798428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","venue":null,"work_id":"54c8aee3-e8f2-4f15-8dee-80d12af1827d","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:c00e856ef86bc3dac5e5a86a7b365c33d70ffbda2f82c13a23302123d148c1b3","observation_id":"b386ce00-2394-4ca6-a25b-82d851a64f3c","resolution":{"observed_at":"2026-05-22T08:51:18.952962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark","venue":null,"work_id":"5e5b5788-d3c8-4e47-b2f8-444873e5cb04","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:d7bcf2e46a3671df9f222fdd5eb4aef5bd12a630e92060bced0b2e0cfde3d099","observation_id":"6e5767bd-8062-46ec-a391-e05dca7cdd8c","resolution":{"observed_at":"2026-05-22T08:51:18.832720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12468","last_updated":"2026-05-27T05:13:38Z","snapshot_observed_at":"2026-08-07T18:10:26.767471Z","submitted_at":"2025-02-18T02:55:48Z","title":"MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation","version":2},"cited_work":{"arxiv_id":"2502.12468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.12468","snapshot_observed_at":"2026-07-04T15:39:56.704272Z","title":"MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation","venue":"cs.LG","work_id":"a12bd5c4-1c60-4ab6-a6c8-bfa04954400c","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2502.12468","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:39b8ab3e26503155d0f9ad423e3ab27d9efb424885820f35231283ab2c2bf524","observation_id":"c554d2b5-d24d-4f14-b2cf-97bc3b522b19","resolution":{"observed_at":"2026-05-28T02:04:07.990420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J1: Incentivizing thinking in LLM-as-a-judge via reinforcement learning","venue":null,"work_id":"24a1b7a1-6775-4e58-b892-6fa03def7018","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:215d69560fe362309e6b6784c3a47b56629471c305446083270218b28299765e","observation_id":"8b0cf3f7-beb6-41af-8351-99b6a3089e43","resolution":{"observed_at":"2026-05-22T08:51:18.781530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RM-R1: Reward Modeling as Reasoning","venue":null,"work_id":"4aa6201f-7c0f-485f-93c1-e7945ae08018","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:2d4df7cd3fe5342caa0dec03fc17dd4159c35a21f7f905a5a0981903e5343a6d","observation_id":"0f11318c-4357-42f5-9019-f685a6176449","resolution":{"observed_at":"2026-05-22T08:51:18.761305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluat- ing large language models at evaluating instruction following","venue":null,"work_id":"3e899178-273e-4cf3-ab2b-5fbd1fc9a5a5","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:f409b214d8d2d3f6e33968a5411e859b9e6d9d60fb0cd9461063a5cce3033a16","observation_id":"5090c3c7-0887-4b8b-9010-ec258418ef6e","resolution":{"observed_at":"2026-05-22T08:51:18.819066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JudgeBench: A Benchmark for Evaluating LLM- Based Judges","venue":null,"work_id":"656ed0f8-3626-4e96-8ce1-d3c9cd0f44e9","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:2a2cb7d05723c419a8d8cd26fb1b2c8d9994f0964172029a62b6c5774a133068","observation_id":"dd157f75-b655-4451-b48a-a27f23f7eeec","resolution":{"observed_at":"2026-05-22T08:51:18.944842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does context matter? ContextualJudgeBench for evaluating LLM-based judges in contextual settings","venue":null,"work_id":"7d7a30cc-4c37-4d31-880f-64ce7aaf7ad9","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:ba7dcc85d66ce97450f9ac6f04063dcae2672d2715380f77f243872f94b95702","observation_id":"5ef7233e-79cf-4dcd-a599-be05daa0628f","resolution":{"observed_at":"2026-05-22T08:51:18.948784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DHP benchmark: Are LLMs good NLG evaluators? InFindings of the Association for Computational Linguistics: NAACL 2025","venue":null,"work_id":"433199b3-0f94-42dc-96a8-ec1f4c7bf162","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:bc397f51ef0e74b6ca164b13166ae363fbbe86331bd2a5070d1dc8de8b35a714","observation_id":"6be2ca06-9dfa-41cd-a413-b8ce2d723752","resolution":{"observed_at":"2026-05-22T08:51:18.875097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ReIFE: Re-evaluating instruction-following evaluation","venue":null,"work_id":"ad20cbc9-d815-4ba4-84ad-9bea7be1c42a","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:d1ac9f59336f4a7fdcadef1a0eec283782737fa23b8e61c78afe02478d96303f","observation_id":"930b188d-1083-4cfb-94d0-b740ef599e7c","resolution":{"observed_at":"2026-05-22T08:51:18.932601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JuStRank: Benchmarking LLM judges for system ranking","venue":null,"work_id":"1a3a045c-fd00-4959-8f63-f368af528064","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:0c5e0303e51172e0b73f2dfb2bf49593ecd4618fa9b5ccf557c04a9d34476249","observation_id":"b945eefa-c929-4d80-a575-679be178343f","resolution":{"observed_at":"2026-05-22T08:51:18.758596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judge Arena: Benchmarking LLMs as Evaluators","venue":null,"work_id":"560d2de6-c1dc-43c1-86f4-18d2b9b5fd19","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:942e2a2f444dbd1be984e5a57c93ed1709c68d5b10fc3ea462d8b3f50127396f","observation_id":"fec24612-ca4b-49ed-8c28-522874057890","resolution":{"observed_at":"2026-05-22T08:51:18.825816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators","venue":null,"work_id":"6e4faf6c-3124-4566-86db-d060023db692","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:8c28c698fa25112dca74aef1b12748f193e724dfe8331a7431964e1a68742230","observation_id":"41eab83e-6521-4db8-a67a-75b282aea111","resolution":{"observed_at":"2026-05-22T08:51:18.843456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","venue":null,"work_id":"1e00d4a9-c0e4-4b02-a2de-d828d10b2623","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:ac615ce8da39680469ab97655316f2e723cf900c606ee8287b6eafacf31d5b93","observation_id":"ba92f790-1a9c-4d40-8b39-598a5081d137","resolution":{"observed_at":"2026-05-22T08:51:18.927169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration","venue":null,"work_id":"a18c0bae-d2bf-4c5d-bfbf-0ad22df8c3a0","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:cd26880dd2ff2a49bca864a3d2d827946779dbd1012ad60b1191402359df5362","observation_id":"61ff39ff-1311-4d2c-ab9b-a12dae368ce2","resolution":{"observed_at":"2026-05-22T08:51:18.143727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09443","last_updated":"2026-08-06T10:50:16Z","snapshot_observed_at":"2026-08-11T20:45:32.561312Z","submitted_at":"2025-06-11T06:48:57Z","title":"LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge","version":3},"cited_work":{"arxiv_id":"2506.09443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09443","snapshot_observed_at":"2026-08-07T01:35:49.493310Z","title":"LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge","venue":null,"work_id":"bd49bdd6-b2b5-4c7e-ad0d-cc07261f2b50","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2506.09443","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:91cfcae4b479f0b62afbaa59fabccc2b0c4f64ba5f804bf07da65cdeda194a6e","observation_id":"cd2a0700-e44f-4903-9643-9dede2d6fcab","resolution":{"observed_at":"2026-08-07T01:35:49.493310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging the judges: A systematic study of position bias in LLM-as-a-judge","venue":null,"work_id":"c4dc9c00-c655-4738-bab4-8a757bcc8e48","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:b2866b5ad0c48e9f8dce3800b7b623962c2d77f54225ddaa26a24c1a70311fc1","observation_id":"be4c97ff-f6fe-4a64-9e0a-f2ae63ab1b14","resolution":{"observed_at":"2026-05-22T08:51:18.850788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01862","last_updated":"2023-08-03T16:38:34Z","snapshot_observed_at":"2026-08-07T15:42:39.404449Z","submitted_at":"2023-08-03T16:38:34Z","title":"Wider and Deeper LLM Networks are Fairer LLM Evaluators","version":1},"cited_work":{"arxiv_id":"2308.01862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wider and Deeper LLM Networks are Fairer LLM Evaluators","venue":null,"work_id":"38af86ef-f4d7-4b30-a63d-da9bc5ca5cab","year":2023},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2308.01862","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:33c7009a4cc7880ba75e0e30e761b5454ae23f8cd2811a552047bc712f5cbf77","observation_id":"4d88b8b3-83c2-4d2a-a323-e729364e90a7","resolution":{"observed_at":"2026-05-22T08:51:18.089396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20133","last_updated":"2026-04-29T15:16:10Z","snapshot_observed_at":"2026-08-11T08:37:15.609096Z","submitted_at":"2026-03-20T17:01:09Z","title":"Reasoning Gets Harder for LLMs Inside A Dialogue","version":2},"cited_work":{"arxiv_id":"2603.20133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.20133","snapshot_observed_at":"2026-07-03T21:18:58.251503Z","title":"Reasoning Gets Harder for LLMs Inside A Dialogue","venue":"cs.CL","work_id":"524d8f35-e6bc-4d22-9b8b-8e2280a0e737","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2603.20133","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:26b58e6cd2c30fe36044c8d69997e2328a143a6941d019df92b25e125aab6719","observation_id":"172b778a-1a33-40fa-b5ae-2f65f75578ae","resolution":{"observed_at":"2026-05-22T08:51:18.072705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3.1 pro","venue":null,"work_id":"9b0f139d-d725-4d51-b43d-4ff20616c917","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:7a30dfa69746251e515be7fb644d865d96678421cb6b1a897823fe2318f56959","observation_id":"683b3e46-d2b5-4043-aa98-94d0428e0b27","resolution":{"observed_at":"2026-05-22T08:51:18.829329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cresswell","venue":null,"work_id":"9fd56027-36d4-4864-a2c2-6297ac4d79f9","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:07b08cda07613c9610ae098337c3c87ac2757cf8984fb2eb8428784587fec97c","observation_id":"ccc7a5d7-1e24-412e-8693-b9fa25f3ff09","resolution":{"observed_at":"2026-05-22T08:51:18.900114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HaluEval: A Large- Scale Hallucination Evaluation Benchmark for Large Language Models","venue":null,"work_id":"e3110bcc-8ee9-471f-ba12-2e81fc16ccf3","year":2023},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:cedf4a091f8a507f0699fb9f165fbfcefbe0f43c1ed46ba451a73c3ea3c17ee8","observation_id":"6de7d784-c2fc-4677-8d3b-4db9d9541aba","resolution":{"observed_at":"2026-05-22T08:51:18.822472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aegis: Automated error generation and attribution for multi-agent systems","venue":null,"work_id":"d3cc643c-aec1-4a5e-b6bb-c0db7d2adeec","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:8d28c77c208df8b066c1bfed518da5d7507e933954799cc3d6d6aa70f48cb82d","observation_id":"ca6b4567-6dfe-46b2-9661-1e97a9db6637","resolution":{"observed_at":"2026-05-22T08:51:18.957412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:8e34d0d6f1ef6e820639e2109cfff74bfa2164f1eff34f85ea4a747c57f962d3","observation_id":"ed875923-2118-4878-8ba8-135a5e9cebf5","resolution":{"observed_at":"2026-05-22T08:51:18.130045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s Verify Step by Step","venue":null,"work_id":"384d9ab6-a8d1-4318-aeb6-fe5e97c35c68","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:33876438b47ee93f5fa2c9934bfc16c6fd585672ba04b5845a5d3f1f9bcfb247","observation_id":"6cb3bf21-fac4-44e9-9d8d-92424ee6e417","resolution":{"observed_at":"2026-05-22T08:51:18.774986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variable Selection using MM Algorithms.Annals of Statistics, 33(4):1617","venue":null,"work_id":"3285265f-5a65-489f-9f6a-414ae88f51d0","year":2005},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:0786547b795d30ae922671eb4a2f0c7432281db377ea0f3025a57c83c53c0ad1","observation_id":"579a2790-fb87-46d6-89b6-1909f593d008","resolution":{"observed_at":"2026-05-22T08:51:18.785272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:37:51.331647Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":"4f614eb5-49d5-415f-b8b9-070dc8b927a1","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:22d975a5704026486110b0cd35e9920dab7c5f7836a259a5ce1d758e180d6739","observation_id":"6a450c63-f270-44cb-895e-2869749cfd77","resolution":{"observed_at":"2026-05-22T08:51:18.765052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"d55eccd1-33fe-4171-92c6-17dde1136b5c","year":2022},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:5a3fe262a52a32ff2f6f4386530bc96bc2b18d6a8caab77908a032a994d4dce0","observation_id":"420aa937-2190-4f6a-8bd9-1c546bed339c","resolution":{"observed_at":"2026-05-22T08:51:18.881884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14289","last_updated":"2026-04-30T10:11:57Z","snapshot_observed_at":"2026-08-01T04:07:45.415579Z","submitted_at":"2026-01-14T11:37:00Z","title":"RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension","version":2},"cited_work":{"arxiv_id":"2601.14289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension","venue":"cs.CL","work_id":"0cc618fa-7e6c-4e6f-83c9-59d8fd309008","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"cited_paper":"/paper/2601.14289","citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:5003e97aa63697b5e04ebba2f404f1bed6480d1a6349772c9849c985a9d827f4","observation_id":"a80995b6-849b-4966-ab97-4c25de1c87d7","resolution":{"observed_at":"2026-05-22T08:51:18.149296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","venue":null,"work_id":"4d10b178-beb4-4217-9ead-98eb3b3554e7","year":2019},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:4e378823162ccd4dca3b70a5417010460d482cad1193eae36a706362f0227160","observation_id":"71b6ff74-255d-47af-b9a5-d1a5af028ee6","resolution":{"observed_at":"2026-05-22T08:51:18.885143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SP500-EDGAR-10K","venue":null,"work_id":"5c6d3d09-7a5d-4c89-b31c-7c2314230095","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:0b608f6600b3382067fc0f2d91135f5140707cf40080f7f1ac4d464894bd27fb","observation_id":"fe92fe42-b33e-4bf5-b91f-f4a716ce4311","resolution":{"observed_at":"2026-05-22T08:51:18.751903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenRouter","venue":null,"work_id":"bd5f2fe4-12ff-4b7e-83b4-2b0c58e5b0a8","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:a8b6fa2ac5f301d57ee3384fe4ba266be5c16b7207d1d9413a74d370c734b97f","observation_id":"b70199df-1dba-4c23-ac8d-45b9595ab487","resolution":{"observed_at":"2026-05-22T08:51:18.778427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think-J: Learning to Think for Generative LLM-as-a-Judge","venue":null,"work_id":"e19263a1-168a-4f25-a151-5b865b963b08","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:f40dfb26caf36afcac05e1401c9c726d96f22c92160dd6cbcb1e84077849d865","observation_id":"2fb722dc-c9ec-4b27-9f66-a60cb9d2502b","resolution":{"observed_at":"2026-05-22T08:51:18.815627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude Opus 4.7 System Card","venue":null,"work_id":"a06cc52a-00af-4f7d-8ccd-581a590fadbc","year":null},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:83d548b6eeb184732b18962723c45b2db854f3621ee8c63c8db189a18c7d68d2","observation_id":"d2c64139-9ed3-4a90-81bd-fc1b503b645d","resolution":{"observed_at":"2026-05-22T08:51:18.768378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T05:23:21.528605Z","title":null,"venue":null,"work_id":"d6cd0d9d-111e-4d8e-a74f-f09c1d1b128a","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:a0d71f6049e9d5ae3173abf7720cfbfecfa7dfa90efb60295389b09691b942c3","observation_id":"2abb1c9f-cbf9-4aee-83e3-94a9ed4362f2","resolution":{"observed_at":"2026-05-22T08:51:18.861286Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models with conformal factuality guarantees","venue":null,"work_id":"50605e52-7d5c-4ff2-9c9c-fc3edaabadf3","year":2024},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:54202a0efd4952d975e6ec6a33d837bc959acd8f1ddc4220b5441ba8657d9022","observation_id":"71cfcdf7-1810-4818-84f1-0eacfc9b5dc3","resolution":{"observed_at":"2026-05-22T08:51:18.801961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cresswell","venue":null,"work_id":"e4e3809b-b1f1-43e9-a7eb-75ef21c3f1a9","year":2025},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:d08ce9357e7391211023eb0890d1bcbca8429ef4ef35147977701a38d763f087","observation_id":"4c325267-5ef6-4c53-b287-7aff4030d433","resolution":{"observed_at":"2026-05-22T08:51:18.878289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cresswell","venue":null,"work_id":"d84eede6-77d5-41c4-ba66-894e26d8951d","year":2026},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:7fa00c31e22a00fb3243e0337f1bfea23c8b00673b36b65e20396d0eaa54fd80","observation_id":"0bead259-eb68-4fbb-90c0-0be214c92082","resolution":{"observed_at":"2026-05-22T08:51:18.871938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Round 2 is mostly clear and foregrounds the main correction, so it does not actually exhibit the required disorganized flaw","venue":null,"work_id":"6460f5d0-a576-422d-a249-f3fb8cfba4bc","year":2000},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:5a7327b22879f066c7f52524daa3b5c8bfa6c3d361bc356dcaa553a40618b438","observation_id":"a4557e47-a7b4-4e1a-9a67-f7edcf2c5ce1","resolution":{"observed_at":"2026-05-22T08:51:18.868771Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a4dc6e73-ad13-46a4-a534-6b559d30851d","year":null},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:8d4a788c2128d83d4e83edb94e874bbf8eef1795f15053f13195b586ce95da93","observation_id":"bf41c687-2e54-4d73-b386-18108eaf8236","resolution":{"observed_at":"2026-05-22T08:51:18.903260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The plan is a single narrative paragraph rather than a turn-by-turn script, but it must be specific enough to determine which turn realises the flaw","venue":null,"work_id":"8b8a82de-75f5-4889-b3a2-4830e4c890fa","year":null},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:ea32149503de096395290b117e54ac7f1eca3dfab316d41b0ac5bce13145ae9e","observation_id":"668fe133-2b7c-4869-b66c-8a697b3f768e","resolution":{"observed_at":"2026-05-22T08:51:18.755299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If convo_b exhibits a different assistant_behavior_type than the one declared, or if no turn realises the planned flaw, labelnoise","venue":null,"work_id":"ec1b322d-9bb9-4a77-af40-fae6d81bc753","year":null},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:4b3f3146bcc1e38387e5df3c528fb210737d3e947f8a69bfd99c19d364b1d96b","observation_id":"fa53d657-1330-411f-a386-383bd90f5f44","resolution":{"observed_at":"2026-05-22T08:51:18.937149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4de834af-2d8a-4f94-852f-028c6fd470bb","year":null},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:9c6750fec7c74cffe2b1a7a9add6d63f70c4aea1e9000791e713a39696db7946","observation_id":"7dd63a76-9ca5-484e-a893-3fad2ae72ad8","resolution":{"observed_at":"2026-05-22T08:51:18.909601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"those little indicator things","venue":null,"work_id":"e3f2b76f-a375-4f8a-a7d4-6d04317a40f2","year":2022},"citing_paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-22T08:50:44.523468Z"},"links":{"citing_paper":"/paper/2605.21748"},"observation_digest":"sha256:932d647184493bc1e9d2f728f6ba768b5e6b29ebbfd146ec12eca34d16f5c88b","observation_id":"547edbe0-0634-40b1-a7a3-cbcd019d2d44","resolution":{"observed_at":"2026-05-22T08:51:18.912874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21748","last_updated":"2026-05-20T21:20:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T21:20:01Z","title":"RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":3,"verified_exact":12,"verified_fuzzy":51},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2605.21748."}