{"as_of":"2026-08-06T04:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11e1ea49049b20584ac58c92c5fe5b5237a728bf70d548891d59ed45deca7313","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T19:57:03.999154Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T00:05:31.780655Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T00:12:50.170528Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"cited_work":{"arxiv_id":"2512.23213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23213","snapshot_observed_at":"2026-06-29T00:12:50.170528Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","venue":"cs.CL","work_id":"c08d4a3f-a027-4330-84d4-47f95a22ee73","year":2025},"citing_paper":{"arxiv_id":"2604.00860","last_updated":"2026-07-07T13:24:35Z","snapshot_observed_at":"2026-08-04T03:47:42.752894Z","submitted_at":"2026-04-01T13:10:20Z","title":"Policy Improvement Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T22:47:05.132020Z"},"links":{"cited_paper":"/paper/2512.23213","citing_paper":"/paper/2604.00860"},"observation_digest":"sha256:d4e4af993bbb08f73a989f7968e0726132c0960f5197fadf870750881ce91289","observation_id":"209c492a-0f9e-475c-958b-93dd37620545","resolution":{"observed_at":"2026-05-13T22:48:22.803116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"cited_work":{"arxiv_id":"2512.23213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23213","snapshot_observed_at":"2026-06-29T00:12:50.170528Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","venue":"cs.CL","work_id":"c08d4a3f-a027-4330-84d4-47f95a22ee73","year":2025},"citing_paper":{"arxiv_id":"2605.29790","last_updated":"2026-05-28T11:40:16Z","snapshot_observed_at":"2026-07-06T23:39:10.583797Z","submitted_at":"2026-05-28T11:40:16Z","title":"Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T00:05:31.780655Z"},"links":{"cited_paper":"/paper/2512.23213","citing_paper":"/paper/2605.29790"},"observation_digest":"sha256:15b7c7d34adb0a8c001d6f4f22b703804d574b94f4a6e0d52bc50a0af8da22a9","observation_id":"c0395aa3-96be-483e-8353-ae36d6fd7d10","resolution":{"observed_at":"2026-06-29T00:12:50.171775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.23213/citation-record","integrity":"/paper/2512.23213/integrity","json":"/paper/2512.23213/citation-record.json","paper":"/paper/2512.23213"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:36:07.226215Z","title":"write newline","venue":null,"work_id":"8481976a-f196-4822-833d-e487ae5a1e81","year":null},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:fc3e453bcc21322adc9bfd761abd6abf591ee6340299b12576efb08502a014c0","observation_id":"55f87f30-114e-44fc-9a70-f0693f5dde68","resolution":{"observed_at":"2026-05-16T20:01:14.542219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:71035ed596f03b215b9a29abc90b90043289e929c6a4aa76010a6a5ece11464a","observation_id":"1ba0712f-48ed-4533-b3de-3890f8afb36d","resolution":{"observed_at":"2026-05-16T19:58:22.793264Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce161718-19d0-4a1b-9073-66c6ca1f040a","year":2006},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:5632e4ed9d8ecafe732099b9830a4184abe4ef7aa17e009b97cb0240736b60d8","observation_id":"e679e594-83fb-45be-bcd5-3f36a2caafd3","resolution":{"observed_at":"2026-05-16T20:01:14.539114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11689","last_updated":"2023-11-11T19:29:42Z","snapshot_observed_at":"2026-07-06T16:34:46.644492Z","submitted_at":"2023-10-18T03:34:59Z","title":"Adaptation with Self-Evaluation to Improve Selective Prediction in LLMs","version":2},"cited_work":{"arxiv_id":"2310.11689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11689","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2310.11689 , year=","venue":null,"work_id":"8d184d59-c75b-4199-ad03-68ee634fa369","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2310.11689","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:bd52d0a4e5660cda3e9fbf9cd6da1036e2a10d5b6f2773393cf673806961c5b1","observation_id":"f312f3fe-0aca-4a9a-86ab-9b0882f57ccf","resolution":{"observed_at":"2026-05-16T19:58:22.790072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.12265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An automatic and cost-efficient peer-review framework for language generation evaluation","venue":null,"work_id":"b00fbab7-103c-456c-b3ad-317a4e12ea51","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4152dce91e268ac55bfa4abffb3679645bdf6965dd63f262c379ac2c88189014","observation_id":"4e51aa58-0d1f-4845-a47a-8b37440cca4c","resolution":{"observed_at":"2026-05-16T19:58:22.783975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:69d89d79b209460a08fc56142eb72af8a9244b0a19e4ab71b3da95268cf248e3","observation_id":"2e17bd6c-4686-4883-acb4-4a0cc4e71911","resolution":{"observed_at":"2026-05-16T19:58:22.670667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial learning from crowds","venue":null,"work_id":"8f0872e6-e06c-4b19-a362-f59f236bb52d","year":2022},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:0aa3760b29ec25d954bea59fea71590bffbf992cc714f1ec42f6675d6568fa4d","observation_id":"cf20bed3-26db-467b-bd96-f3c06a0a6de4","resolution":{"observed_at":"2026-05-16T20:01:14.503775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structured probabilistic end-to-end learning from crowds","venue":null,"work_id":"a2288044-e50a-4873-b412-6235cbe02b3a","year":2021},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:f2077b68967034839af9fd8dcc610d0143d93f12df038d68e60246c0c6be3395","observation_id":"7be0574a-f48d-448b-befd-80dfcf698294","resolution":{"observed_at":"2026-05-16T20:03:23.623798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural-hidden-crf: A robust weakly-supervised sequence labeler","venue":null,"work_id":"bb2924df-e203-4a7a-90f9-f1cd67ff7444","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:df2cbb6aa8eb084761d4af200509894d84363cfe59038048389bb24a035d1ffc","observation_id":"fe00d935-a89a-4111-8545-e782cfdeecf4","resolution":{"observed_at":"2026-05-16T20:01:14.511592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18036","last_updated":"2026-04-22T02:19:48Z","snapshot_observed_at":"2026-08-02T22:41:05.099083Z","submitted_at":"2025-02-25T09:48:53Z","title":"Harnessing Multiple Large Language Models: A Survey on LLM Ensemble","version":6},"cited_work":{"arxiv_id":"2502.18036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18036","snapshot_observed_at":"2026-07-04T04:19:33.751647Z","title":"Harnessing Multiple Large Language Models: A Survey on LLM Ensemble","venue":"cs.CL","work_id":"a8860c36-0ae0-420b-982f-ccce86e39ae7","year":2025},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2502.18036","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:1f3aff1a3b4eadebfad34a56e40d0afd99061e21449f14a349f11beb3cd8af7f","observation_id":"6026d2f4-0d2b-44b7-877c-2be0cc6bab06","resolution":{"observed_at":"2026-05-16T19:58:22.764827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E., et al","venue":null,"work_id":"b6f1b578-e235-4789-a500-457a59de9d18","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4f95efd05f7a395c0b5525f94ae74983a034c5073ad3805ce942770961a8a47b","observation_id":"7285815a-7cfc-49d1-8dba-63238100db8b","resolution":{"observed_at":"2026-05-16T20:01:14.506272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15641","last_updated":"2024-06-03T11:11:13Z","snapshot_observed_at":"2026-07-06T17:21:26.047673Z","submitted_at":"2024-01-28T12:33:14Z","title":"PRE: A Peer Review Based Large Language Model Evaluator","version":2},"cited_work":{"arxiv_id":"2401.15641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.15641","snapshot_observed_at":"2026-06-30T06:04:21.529906Z","title":"Pre: A peer review based large language model evaluator","venue":null,"work_id":"d41c31fc-b4bf-429c-bcd0-b2410c8722cd","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2401.15641","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:fb47dc84fa69481b984f3e6a0ac8f9e7e4b73d7456c41e6afd8f7c7aff05a7d6","observation_id":"fcaf17fc-5d76-4cff-9683-91ae2556ed16","resolution":{"observed_at":"2026-05-16T19:58:22.774949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., Hou, L., Longpre, S., Zoph, B., Tay, Y., Fedus, W., Li, Y., Wang, X., Dehghani, M., Brahma, S., et al","venue":null,"work_id":"20dfca7f-7e44-4a5b-8942-cc438d8bef6e","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:b8e788daedc00486b98a14724b84ab7d71b58dcb79b8b5cd178f46381b6549cf","observation_id":"83c10816-cc1f-40f9-b4ef-337d5c9f9655","resolution":{"observed_at":"2026-05-17T01:41:26.155989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7590b96f-2d44-454f-bd35-f3e55133433a","year":1979},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:76cf7d3317f93a0708233faef170ae831d1a4db9d26ba46a05c8633e94fe1877","observation_id":"548d295f-3c3d-4a82-8639-c6da529a96d1","resolution":{"observed_at":"2026-05-16T20:01:14.508791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12847","last_updated":"2024-07-05T09:26:40Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-05T09:26:40Z","title":"Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments","version":1},"cited_work":{"arxiv_id":"2407.12847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12847","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Mars, J","venue":null,"work_id":"c9f46ee6-1711-486e-b9d6-6365c0b55605","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2407.12847","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:88829df03df20e34e4b820f5b6a3ae70c77e76b775a05451a90b42e1be172914","observation_id":"287c74e5-7450-4305-bced-e362b1dcc415","resolution":{"observed_at":"2026-05-16T19:58:22.778007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximum likelihood from incomplete data via the em algorithm","venue":null,"work_id":"78dc8a02-3ab0-4cc0-9188-1a037371f7cf","year":1977},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:e64e31617901c23e5e45c5d67580172b75d9dcb2b8a8635de4c2ee16883ca9e4","observation_id":"4c3853e6-de2c-4daa-9e8f-bef746d4fe2c","resolution":{"observed_at":"2026-05-16T20:03:23.621156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on ensemble learning","venue":null,"work_id":"b56c8bff-1e47-44ed-bae7-6a68c09bc608","year":2020},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:a20ee54d98cdfb666652958d59155cf2a98b4d706665a921029bcf85d0606865","observation_id":"67c704b9-ccaf-4ab2-9730-69ec09908fc0","resolution":{"observed_at":"2026-05-16T20:01:14.518249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X., Taori, R., Zhang, T., Gulrajani, I., Ba, J., Guestrin, C., Liang, P","venue":null,"work_id":"2a20763a-8500-4876-855f-4805e555fec0","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:6b5bdd9db84542ef3bd234c69a3567391fe83dccb0e9c526e2b98e11f65e2a5f","observation_id":"c1ef1cf4-96be-47de-ad2a-bba50997bb9a","resolution":{"observed_at":"2026-05-16T20:01:14.515068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An introduction to latent variable models","venue":null,"work_id":"2022dcc5-f8e8-44c5-a419-18bf986c9a03","year":2013},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4a7a8135bf3f0fc73dbe4c0a29d506fbe72dbbe38e5e1bc5aae8b7f581cab542","observation_id":"606e6660-3212-4f75-bc41-99a7f4d12071","resolution":{"observed_at":"2026-05-17T01:41:26.153022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":"2302.04166","doi":"10.48550/arxiv.2302.04166","metadata_source":"pith","pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTScore: Evaluate as You Desire","venue":"cs.CL","work_id":"13d9a137-d114-4c30-aa62-3b8d25d9eb7c","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:56fd0842410b9d05740e472bd31141d9e6fbb8ff9b57f1a1bfa81c1b6a428213","observation_id":"9d2598b1-2d0c-4087-80b3-eb351084f506","resolution":{"observed_at":"2026-05-17T17:11:54.379140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning","venue":null,"work_id":"54b5326f-8075-4610-a083-cebd52b05817","year":2016},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:8a467bbb2111acc47ae32731f918ad91e89c7d6b5b1545eb5fa7db64548073bb","observation_id":"3a89d433-5782-4ac5-acb7-3618d5d720bb","resolution":{"observed_at":"2026-05-16T20:03:23.619107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:ef0852dd79e3ba59dd31f49d05352ded3d35b491fb8e1871690550178e5deda5","observation_id":"b5ea98ae-841e-408c-9fc0-da4585180075","resolution":{"observed_at":"2026-05-16T19:58:22.771860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smoothie: Label free language model routing","venue":null,"work_id":"dc32e331-6dcd-450b-9356-77a27999939f","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:46f06ca82a6c24d385dc0acf3387b7f587644cdef8b0694423bdb51dc7df624e","observation_id":"59898454-34ea-4df1-ac40-9183f50218a3","resolution":{"observed_at":"2026-05-16T20:01:14.561310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:9f3ac8a28a119a34a9444018aa77ccc6e1ef592314c33a24467f0d7e5f80fe90","observation_id":"459e3f86-be96-4fdf-a295-e402dad61d8c","resolution":{"observed_at":"2026-05-16T19:58:22.691508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.12869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language model preference evaluation with multiple weak evaluators","venue":null,"work_id":"faffb412-6f97-42ac-8a36-43d22f49ffaa","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:8f256c633f708d09fd5afa3bdfc7edde21154c2a81028788d61e8def72f0f631","observation_id":"54063440-a498-4b80-a97a-4c1d3acd80ca","resolution":{"observed_at":"2026-05-16T19:58:22.780983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ensemble learning for heterogeneous large language models with deep parallel collaboration","venue":null,"work_id":"6d6b217a-9422-418c-87f9-496289adf4c2","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4144d6fe1d183cb0e2d949016f3919cddafd8e4b281201faf7648f7e275e907a","observation_id":"7e0b36de-b544-4ed8-9f4d-a51681672a1b","resolution":{"observed_at":"2026-05-16T20:01:14.558397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-05T15:27:19.717152Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":"2306.02561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-07-04T19:50:11.019242Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":"1accd5f4-8546-41b7-a132-6f6dde8df864","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:286e6f35ed41587f038259b41421cc41f2b6402f08c6d2bb6ee01774384bc901","observation_id":"5529df80-0829-4460-bc9d-24cbda953884","resolution":{"observed_at":"2026-05-16T19:58:22.743646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:5002c91b26954abd9687e52008fdce576468bbdbf83c0cb55fc2e9dbcda19d16","observation_id":"7b22e705-3058-4af8-9e7b-38f53e63a992","resolution":{"observed_at":"2026-05-16T19:58:22.751121Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:2153ac156be504645d21ceecc8ba750bcd1f8bab0472f3145d6dcb58a679acc1","observation_id":"d43b8ff0-58d4-4439-988b-4f5774d5b637","resolution":{"observed_at":"2026-05-16T19:58:22.721897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00686","last_updated":"2023-11-01T17:44:35Z","snapshot_observed_at":"2026-08-05T21:06:46.184139Z","submitted_at":"2023-11-01T17:44:35Z","title":"Little Giants: Exploring the Potential of Small LLMs as Evaluation Metrics in Summarization in the Eval4NLP 2023 Shared Task","version":1},"cited_work":{"arxiv_id":"2311.00686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00686","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Little giants: Exploring the potential of small llms as evaluation metrics in summarization in the eval4nlp 2023 shared task","venue":null,"work_id":"92986ecb-1ccd-4401-92f5-f5bb9e03caf3","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2311.00686","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:c5bb4ba1d087954b1583286484e8bd0c569fe0b5083a8f66f33c304c5344fff7","observation_id":"85b71a9c-0c22-455b-b72e-5f1f10478d90","resolution":{"observed_at":"2026-05-16T19:58:22.726394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.16594","doi":"10.48550/arxiv.2411.16594","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge","venue":"arXiv (Cornell University)","work_id":"6654304a-22e0-4b16-93cf-36e7fc38ae5a","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:5b5efc02843bb893c245e8dff02d6ca6a4827b38f95628aa2f3e780028337ef5","observation_id":"604caec7-42f9-47fa-9e96-8e1266405966","resolution":{"observed_at":"2026-05-16T19:58:22.667123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:26.997979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:26.997979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":"2412.05579","doi":"10.48550/arxiv.2412.05579","metadata_source":"pith","pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","venue":"cs.CL","work_id":"377b190f-39ed-4db3-9747-433802e5303c","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:3a601fca6f17b5d7073b6da2f49c9d4a79a4d29f4e00385ca55d39344519a44d","observation_id":"d17ddcf3-9d6f-4481-b86a-9b1e06925d67","resolution":{"observed_at":"2026-05-16T19:58:22.675035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T15:08:45.340409+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T15:08:45.340409+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05120","last_updated":"2024-10-11T09:38:40Z","snapshot_observed_at":"2026-07-06T17:27:03.686119Z","submitted_at":"2024-02-03T05:55:24Z","title":"More Agents Is All You Need","version":2},"cited_work":{"arxiv_id":"2402.05120","doi":"10.48550/arxiv.2402.05120","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05120","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"More agents is all you need","venue":"arXiv (Cornell University)","work_id":"3bf5aa60-0441-4df2-96b0-850dc92214bd","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2402.05120","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:a3809977614b1c18756415fb64715a56e3aec997828e6fa81fc9d7c9454dbe01","observation_id":"f6d20cde-7c1f-4e28-90a7-f03fc4a9e0e8","resolution":{"observed_at":"2026-05-16T19:58:22.704184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:1af45206591d69cae31c8c022cea4ddf1f13cd011f4a69d21edb460a0f57e45a","observation_id":"168e4c3c-b897-400c-bf24-c3ca69b788c9","resolution":{"observed_at":"2026-05-16T19:58:22.663206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19807","last_updated":"2025-06-09T09:19:19Z","snapshot_observed_at":"2026-07-06T18:53:13.875335Z","submitted_at":"2024-07-29T09:02:19Z","title":"Cool-Fusion: Fuse Large Language Models without Training","version":2},"cited_work":{"arxiv_id":"2407.19807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.19807","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cool-fusion: Fuse large language models without training.arXiv preprint arXiv:2407.19807","venue":null,"work_id":"757a8e49-de44-44bd-b5c5-4f9937bf2019","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2407.19807","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:6ec9e522caaedc4cbc2e554d0812b68d6721e8e7be24327a0431e825806cc370","observation_id":"0e89f12e-e1da-4938-995a-5c759c8e5f21","resolution":{"observed_at":"2026-05-16T19:58:22.678914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02994","last_updated":"2024-01-23T04:43:56Z","snapshot_observed_at":"2026-08-04T14:20:52.474748Z","submitted_at":"2024-01-04T07:45:49Z","title":"Blending Is All You Need: Cheaper, Better Alternative to Trillion-Parameters LLM","version":3},"cited_work":{"arxiv_id":"2401.02994","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02994","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blending is all you need: Cheaper, better alterna- tive to trillion-parameters llm.arXiv preprint arXiv:2401.02994","venue":null,"work_id":"46a0bbf2-7578-483e-a44e-11dde2e0f666","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2401.02994","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:eeed2bcaab47cb6d3c70123a6d185d7fe1319595662124014a5ac0d79de12515","observation_id":"45645ed7-e53e-4f05-a461-cdc540d49cdc","resolution":{"observed_at":"2026-05-16T19:58:22.699710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urg: A unified ranking and generation method for ensembling language models","venue":null,"work_id":"f9f154db-0669-41f4-bd0a-a574f6fd0d6a","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:5b1645776b156ab35e06546dc314604ec9260c48eaf6aa14fca66f2a38ee6f45","observation_id":"09e1e27d-d6b9-46a9-94e4-d2d1b5705446","resolution":{"observed_at":"2026-05-16T20:01:14.554892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":"2406.18665","doi":"10.48550/arxiv.2406.18665","metadata_source":"pith","pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","venue":"cs.LG","work_id":"f6b91d8a-ce78-4b5e-9dae-6dd8a22cc087","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:c50b57c9a7ae44bbc4029168d94d639908a1ee8c8a3b65ff7a9ac58cfdd73ddc","observation_id":"2772a185-390b-4434-ba2c-9db63c96ba37","resolution":{"observed_at":"2026-05-16T19:58:22.682905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.122549+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.122549+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13884","last_updated":"2024-09-20T20:24:50Z","snapshot_observed_at":"2026-07-06T19:19:02.260202Z","submitted_at":"2024-09-20T20:24:50Z","title":"A Multi-LLM Debiasing Framework","version":1},"cited_work":{"arxiv_id":"2409.13884","doi":"10.48550/arxiv.2409.13884","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.13884","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2409.13884 (2024)","venue":"arXiv (Cornell University)","work_id":"aeccf302-3ed1-45ae-b215-9f3d8a798734","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2409.13884","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:d0ff008c8b81d9645787f728e630732ec4c671d69c5b0abea137b41472fdc43a","observation_id":"c0b38780-71d8-4aab-958d-29599baf0023","resolution":{"observed_at":"2026-05-16T19:58:22.708723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15797","last_updated":"2024-12-20T11:14:29Z","snapshot_observed_at":"2026-07-06T20:10:51.514813Z","submitted_at":"2024-12-20T11:14:29Z","title":"Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning","version":1},"cited_work":{"arxiv_id":"2412.15797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15797","snapshot_observed_at":"2026-07-03T05:57:41.442502Z","title":"Ensembling large language models with process reward-guided tree search for better complex reasoning.arXiv preprint arXiv:2412.15797","venue":null,"work_id":"e0606a29-b382-4332-ad13-4c791221a0dd","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2412.15797","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:60a77615cc181540379f12c953f53a119dbee25b267424f0236b29017ff1a55f","observation_id":"a30c07b4-60c7-4ddf-bf77-59ca8f5e8d95","resolution":{"observed_at":"2026-05-16T19:58:22.734835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15789","last_updated":"2023-09-27T17:08:40Z","snapshot_observed_at":"2026-07-06T16:24:30.545494Z","submitted_at":"2023-09-27T17:08:40Z","title":"Large Language Model Routing with Benchmark Datasets","version":1},"cited_work":{"arxiv_id":"2309.15789","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15789","snapshot_observed_at":"2026-07-11T02:27:47.646520Z","title":"Large language model routing with benchmark datasets","venue":"cs.CL","work_id":"56d9bd9c-33d3-4d15-80bf-a522f51610b7","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2309.15789","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:37daec3d5644f160f3779507cc38f88888150b6205b91a9c03e4e37d64d93951","observation_id":"b1ac5cf7-af69-42a9-9bc6-3c9c1e730a8f","resolution":{"observed_at":"2026-05-16T19:58:22.758141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Getting more out of mixture of language model reasoning experts","venue":null,"work_id":"81f0200d-b55d-4a90-b5df-1a96302feb09","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:25d8c76ccb09fbcd07eb12e46f09fd763025d50a5ef1da650bcf2d0c76f4505f","observation_id":"7cf5c060-c938-4dc1-a8aa-4cf6d7c7d82c","resolution":{"observed_at":"2026-05-16T20:01:14.552140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00467","last_updated":"2024-05-01T12:04:28Z","snapshot_observed_at":"2026-08-03T15:18:25.179746Z","submitted_at":"2024-05-01T12:04:28Z","title":"Harnessing the Power of Multiple Minds: Lessons Learned from LLM Routing","version":1},"cited_work":{"arxiv_id":"2405.00467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00467","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harnessing the power of multiple minds: Lessons learned from llm routing.arXiv preprint arXiv:2405.00467","venue":null,"work_id":"f308a823-ebb1-49ad-9366-9235628e7f8c","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2405.00467","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:cb34882d65678d5ee2e0bc7b4c53189f1d7a73a3354018c195818a50af6c1015","observation_id":"5c201e8c-667c-4e71-bc76-ef31ad20ad3e","resolution":{"observed_at":"2026-05-16T19:58:22.654514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:243b43e8b40c44a6ac6c0221309e23a432009e59d831f29d4a1ca46b4713f18c","observation_id":"81d3f557-0f66-4553-a33a-5c199cf3726e","resolution":{"observed_at":"2026-05-16T19:58:22.717647Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-topla: Efficient llm ensemble by maximising diversity","venue":null,"work_id":"6934a3d7-df05-43c7-ba52-5989a0d852d6","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4e97d35fcf2ccba65b07ebc1022ea78a20fdd7704b5a48933da51c28e1fa1bc7","observation_id":"d7272572-8b78-4577-b097-f6d69785a3cf","resolution":{"observed_at":"2026-05-16T20:01:14.548975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:5c0c6aa6c66144c03150167789bdc92a7fb59606cb43be15052a3a7dac0d808a","observation_id":"c942e07e-75bd-4c01-9bf3-d4bc21431884","resolution":{"observed_at":"2026-05-16T19:58:22.739122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":"2404.18796","doi":"10.48550/arxiv.2404.18796","metadata_source":"pith","pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","venue":"cs.CL","work_id":"2f7cdc2e-873a-4be6-a515-05396d0341b6","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:9b7f6f6c0eae14fca8dfe2952cb84e54eac2ec08b0dfb10ae98cd15a4ec3f68d","observation_id":"20fe7a45-b6c6-4b2f-92e9-a1c674980534","resolution":{"observed_at":"2026-05-16T19:58:22.747282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14770","last_updated":"2023-03-26T16:29:18Z","snapshot_observed_at":"2026-08-05T16:27:06.305873Z","submitted_at":"2023-03-26T16:29:18Z","title":"Koala: An Index for Quantifying Overlaps with Pre-training Corpora","version":1},"cited_work":{"arxiv_id":"2303.14770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.14770","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Koala: An index for quantifying overlaps with pre-training corpora","venue":null,"work_id":"2e7ea3c0-51c9-4552-9da4-c33fc11e7501","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2303.14770","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:3ef7d6b3d02a44cd8983aa12d3b872107a4772d9db56030dca2aff56522b1963","observation_id":"5755aa23-64ce-41c9-bd4a-74d829f25bf9","resolution":{"observed_at":"2026-05-16T19:58:22.761678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-03T19:35:11.838629Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":"2305.17926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-07-11T02:27:48.661096Z","title":"Large Language Models are not Fair Evaluators","venue":"cs.CL","work_id":"d04a3326-b025-498f-a8f0-3d2df254a77f","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:0f4e3be04b92b017a28446d7b45627464cd5ec2c8806c386737d45f410103437","observation_id":"b6881a9e-d489-486b-a526-a7ddfbc891ec","resolution":{"observed_at":"2026-05-17T12:10:42.624770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.03064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J., and Choi, E","venue":null,"work_id":"eecfc291-05e4-4b6f-89e2-455559e51ca9","year":2025},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:54408046adfa1cdec7f3cc675a43f7c6c2133c27e273220a42c434008dc376ce","observation_id":"62dcc8aa-f649-4537-ba7d-a582191aa3e6","resolution":{"observed_at":"2026-05-16T19:58:22.695340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4410a842462c280f0f2e0b1f7dc04ae4a3aa25df46234cc58bdd8b4559e3042d","observation_id":"18214f72-66ed-49b4-8c62-da18d9e622bd","resolution":{"observed_at":"2026-05-16T19:58:22.754673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-07-06T18:53:00.965448Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":"2407.19594","doi":"10.48550/arxiv.2407.19594","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR , volume =","venue":"arXiv (Cornell University)","work_id":"39d1c338-cf2d-4782-ac04-5fa28470bef1","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:bdc95f3d94aaeade35157cba54cf930e4bb6c8c795056d6ca842b105a3165694","observation_id":"388d9b6e-b63c-45f9-90f4-387e4da831d4","resolution":{"observed_at":"2026-05-16T19:58:22.687864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging the gap between different vocabularies for llm ensemble","venue":null,"work_id":"2bb132a5-48a2-40eb-88d2-e452c5541312","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:1f5ffcd59f50b9801ccdb69dabfcc0582d8f78e247bcfca5a78c6dc8ea02fa87","observation_id":"14fa69d5-1c59-4bde-965b-0ff64564be3d","resolution":{"observed_at":"2026-05-16T20:01:14.545851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hit the sweet spot! span-level ensemble for large language models","venue":null,"work_id":"a29ea872-4929-4410-8938-fc786036aca8","year":2025},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:19a764c3ac877f9348ab9be80f01e6189da106f82cb2e7662af7813c9e65ec75","observation_id":"21509a30-18a5-4b4e-b38e-c577ca7d6648","resolution":{"observed_at":"2026-05-16T20:03:23.617144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12585","last_updated":"2024-09-29T11:18:58Z","snapshot_observed_at":"2026-07-06T18:32:57.295918Z","submitted_at":"2024-06-18T13:17:26Z","title":"Breaking the Ceiling of the LLM Community by Treating Token Generation as a Classification for Ensembling","version":2},"cited_work":{"arxiv_id":"2406.12585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12585","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking the ceiling of the llm community by treating token generation as a classification for en- sembling.arXiv preprint arXiv:2406.12585","venue":null,"work_id":"34d9cdc2-d8a0-4073-84c1-06723b36f902","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2406.12585","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:05ae84037a9825b7de51a957d8348b0c23b81272898637a2f1e3aeb829842f46","observation_id":"ed024f32-12ae-4d87-aa21-0cf0c8fbd8ba","resolution":{"observed_at":"2026-05-16T19:58:22.713390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11377","last_updated":"2021-10-11T11:39:34Z","snapshot_observed_at":"2026-07-06T11:50:40.639504Z","submitted_at":"2021-09-23T13:47:16Z","title":"WRENCH: A Comprehensive Benchmark for Weak Supervision","version":2},"cited_work":{"arxiv_id":"2109.11377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.11377","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wrench: A comprehensive benchmark for weak supervision.arXiv preprint arXiv:2109.11377","venue":null,"work_id":"764bce6c-4ab1-474d-893a-714d4b09180c","year":2021},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2109.11377","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:4e3df559396f6b0b9690a4b5e50e395c3c0dfaffb43579f23fae473e711b8492","observation_id":"f9e5e6b7-5abd-48cc-b993-8c43459aa85a","resolution":{"observed_at":"2026-05-16T19:58:22.786991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01862","last_updated":"2023-08-03T16:38:34Z","snapshot_observed_at":"2026-07-06T16:02:10.990236Z","submitted_at":"2023-08-03T16:38:34Z","title":"Wider and Deeper LLM Networks are Fairer LLM Evaluators","version":1},"cited_work":{"arxiv_id":"2308.01862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wider and Deeper LLM Networks are Fairer LLM Evaluators","venue":null,"work_id":"38af86ef-f4d7-4b30-a63d-da9bc5ca5cab","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2308.01862","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:32c8da40b5fe5985ebb3fa3a26e00e78e1bcfe3eadc62ed0406372c8cfe886fc","observation_id":"229c22b3-5779-47c8-ae9c-cc972a5893cf","resolution":{"observed_at":"2026-05-16T19:58:22.730880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"303b802f-df94-4dfe-b8e4-e7aa3af8da98","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:85a8fcd757d94f7ddf8899a0904ee5d73f40ae0a53a2c9a2508342d17b5f5d65","observation_id":"61c09b83-5ba2-4c72-9f50-17fe12a14d2d","resolution":{"observed_at":"2026-05-16T20:03:23.614587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truth inference in crowdsourcing: Is the problem solved? Proceedings of the VLDB Endowment, 10 0 (5): 0 541--552","venue":null,"work_id":"5156c83a-7a3a-4785-9232-9a755f75ae43","year":2017},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:bffeb42a449e69a7c6817a0686a711aa29a44eaed736ebd73d6b188d5a0a60e2","observation_id":"77b3aeec-5c9b-4203-83b3-d751d4d064dd","resolution":{"observed_at":"2026-05-16T20:01:14.524467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"ce8abd81-50fb-4ac3-bb22-f29088d33707","year":2023},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:581246822d86c7bd6dfa0bac4fe680de8718bc4627778ebf3a0d468eeb33e6e5","observation_id":"73b9649b-b3ae-464b-969b-ffdc0a8a2834","resolution":{"observed_at":"2026-05-16T20:01:14.521685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":2,"verified_exact":31,"verified_fuzzy":21},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2512.23213."}