{"as_of":"2026-08-06T05:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc0bac415be668c2f8cd8c4db5058a507ae1d60f56605dddcc3135ce408c7d37","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:34:14.479640Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T00:47:43.114558Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:1c3f654622b056d7270503c60de324cf891970b00ee5f596e405d35c26e18cbc","observation_id":"590c7677-cd90-4db9-bdf5-23bcfbdf10ff","resolution":{"observed_at":"2026-05-11T23:08:36.997032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:56.678339Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2507.17746"},"observation_digest":"sha256:b45a18c96fa476a3712ea1f9e02ac2fb45de3861b29d9b5cc77f63db1a6cb773","observation_id":"fdcb2bc2-df0e-490e-af8c-b4179bcfc620","resolution":{"observed_at":"2026-05-13T06:07:56.779378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-05T22:34:14.479640Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06888","last_updated":"2025-08-09T08:35:40Z","snapshot_observed_at":"2026-08-05T22:34:11.905865Z","submitted_at":"2025-08-09T08:35:40Z","title":"Multi-Modal Requirements Data-based Acceptance Criteria Generation using LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:14.479640Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2508.06888"},"observation_digest":"sha256:96d0465ec6700cae56e90e8aaf81489609d964d40c050addd2de8745f1ffa0f8","observation_id":"36a0b4e8-50ac-4506-929d-f69b460d6c98","resolution":{"observed_at":"2026-08-05T22:34:14.479640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-04T21:52:09.143146Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07706","last_updated":"2026-02-26T07:39:32Z","snapshot_observed_at":"2026-08-04T21:52:06.852792Z","submitted_at":"2025-09-09T13:10:49Z","title":"FHIR-RAG-MEDS: Integrating HL7 FHIR with Retrieval-Augmented Large Language Models for Enhanced Medical Decision Support","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T21:52:09.143146Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2509.07706"},"observation_digest":"sha256:3bfc7b950356e872d6623c6a51b1c208d127fe1da5e1cdf65a301ad76cf44128","observation_id":"53653002-d5c0-4ce3-8d90-b996e49ae7ba","resolution":{"observed_at":"2026-08-04T21:52:09.143146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2509.21319","last_updated":"2026-05-17T00:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-25T16:19:06Z","title":"RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T22:09:47.649346Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2509.21319"},"observation_digest":"sha256:90d366174f1156f9fe0e9f9f9df351f8b690df9730a209248caf270dcdf5718c","observation_id":"d647bb2f-22f3-4969-abb0-3bb9932d4832","resolution":{"observed_at":"2026-05-21T22:10:42.067732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2509.23542","last_updated":"2026-04-19T04:59:30Z","snapshot_observed_at":"2026-08-03T18:10:00.237919Z","submitted_at":"2025-09-28T00:43:52Z","title":"On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T12:53:45.767341Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2509.23542"},"observation_digest":"sha256:a3591a35bb9cf97ebafbd9e3718adccc3af73ecf0ad04ccefae2f9c9d137ecd0","observation_id":"5b2270f2-4b7d-494f-997f-0e7fed373c85","resolution":{"observed_at":"2026-05-18T12:56:24.515871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2512.23213","last_updated":"2026-04-25T15:41:44Z","snapshot_observed_at":"2026-08-02T22:41:07.172721Z","submitted_at":"2025-12-29T05:25:49Z","title":"Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T19:57:03.999154Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2512.23213"},"observation_digest":"sha256:2153ac156be504645d21ceecc8ba750bcd1f8bab0472f3145d6dcb58a679acc1","observation_id":"d43b8ff0-58d4-4439-988b-4f5774d5b637","resolution":{"observed_at":"2026-05-16T19:58:22.721897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2604.14585","last_updated":"2026-05-27T06:20:29Z","snapshot_observed_at":"2026-07-12T20:11:17.665257Z","submitted_at":"2026-04-16T03:23:46Z","title":"Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T11:18:09.127345Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2604.14585"},"observation_digest":"sha256:7acaee442bf51597baff6cc3a5db8292e654787fe4b57be513237a0177240230","observation_id":"a2bd1b92-28a1-409f-8155-49f11e65098e","resolution":{"observed_at":"2026-05-10T11:20:10.362429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2604.16335","last_updated":"2026-03-13T02:23:49Z","snapshot_observed_at":"2026-08-04T04:51:19.798134Z","submitted_at":"2026-03-13T02:23:49Z","title":"Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T12:22:13.551709Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2604.16335"},"observation_digest":"sha256:643dbbae07989529af4d37ac4c28f19cedb6c3840413f5e1214f57d6ec9260e7","observation_id":"5d883154-baf0-4768-a1f5-d9bc29f1ce91","resolution":{"observed_at":"2026-05-15T12:25:35.707687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2604.19820","last_updated":"2026-04-19T07:09:42Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-19T07:09:42Z","title":"KnowPilot: Your Knowledge-Driven Copilot for Domain Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T06:15:44.360621Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2604.19820"},"observation_digest":"sha256:39a01680f271d6820daa83e4ece0fd0ddcd2b7f0ea9e23dfcde4c266c373b9df","observation_id":"c7ba134f-680e-41bc-9b2f-bf76c8548b26","resolution":{"observed_at":"2026-05-10T06:16:20.733143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2604.23178","last_updated":"2026-06-24T13:27:28Z","snapshot_observed_at":"2026-08-05T10:28:56.284877Z","submitted_at":"2026-04-25T07:18:30Z","title":"Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T08:14:18.535385Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2604.23178"},"observation_digest":"sha256:f6490cebd320b43cb5e88806cb4df34860cf2923cfe001638d85717ce55797f6","observation_id":"e028541d-1397-4718-bef4-e099a2e7c074","resolution":{"observed_at":"2026-05-11T20:41:14.183428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2605.02443","last_updated":"2026-05-22T15:24:30Z","snapshot_observed_at":"2026-08-02T13:58:05.076867Z","submitted_at":"2026-05-04T10:43:27Z","title":"HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T06:49:16.755597Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2605.02443"},"observation_digest":"sha256:7c554d0452cc341c85678071b165fdb26d87ae726775b6b9bb312537be27bf99","observation_id":"796152a9-b5b4-44b6-9ca0-b548b920c51e","resolution":{"observed_at":"2026-05-25T06:50:27.967610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2605.04785","last_updated":"2026-05-06T11:38:16Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T11:38:16Z","title":"AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:34:11.020584Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2605.04785"},"observation_digest":"sha256:68d09234cc93955ee2e319fd8be4573583103f44c2f2eed81008c55e5ad37049","observation_id":"4762d278-be0f-4bdf-9748-d04d9f55649b","resolution":{"observed_at":"2026-05-11T17:26:06.983575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2605.08061","last_updated":"2026-05-08T17:48:58Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:48:58Z","title":"Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:33.057569Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2605.08061"},"observation_digest":"sha256:70cf9e3867d2efbf4aa7759a866d8b1aced34e2c5b65da4093c350a81ded9db4","observation_id":"7c31b613-fbc1-462f-8110-d7ce0056ad2e","resolution":{"observed_at":"2026-05-11T03:45:58.155751Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2605.25038","last_updated":"2026-05-24T12:27:32Z","snapshot_observed_at":"2026-07-06T23:35:01.860096Z","submitted_at":"2026-05-24T12:27:32Z","title":"TRACE: A taxonomy-grounded synthetic dataset for teaching-program generation and session interpretation in Applied Behavior Analysis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T12:00:02.323398Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2605.25038"},"observation_digest":"sha256:ae25373ac867091ffe6456226bd3b952dd1415132f387b88af6228ac853b94dc","observation_id":"f47f4383-3c86-4a3a-b47e-78f3f7bcb3cd","resolution":{"observed_at":"2026-06-30T12:04:38.868040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2605.29522","last_updated":"2026-05-28T07:40:10Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:40:10Z","title":"DeepSurvey: Enhancing Analytical Depth and Citation Reliability in Automated Survey Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T07:12:13.559728Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2605.29522"},"observation_digest":"sha256:ee98e4fa5923a0cf63da1cd461d8b6b4e609adee63cdfba5cc7e741827a5cb9c","observation_id":"14bebf32-d519-45d4-b38e-77762109313d","resolution":{"observed_at":"2026-06-29T07:13:16.182183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-03T23:04:18.231389Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:aeda81bc1d7c7a5f1f17faf9a180080e431e2268fc2c95e2a992edc7e07d5eab","observation_id":"0c724aff-f1b6-4fe7-b24e-7e310d35c157","resolution":{"observed_at":"2026-07-02T02:36:27.430493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.04306","last_updated":"2026-06-03T00:25:56Z","snapshot_observed_at":"2026-08-05T10:27:41.050145Z","submitted_at":"2026-06-03T00:25:56Z","title":"Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T04:17:18.483765Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.04306"},"observation_digest":"sha256:e0f55ef13ec2a795c65b95f01a97f53ba984603bc2b7c1113537f37684ed027b","observation_id":"0f471fc0-fa12-414d-96d3-8c79df5dad8f","resolution":{"observed_at":"2026-07-02T11:16:53.801408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.07040","last_updated":"2026-06-05T08:34:06Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T08:34:06Z","title":"Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T22:14:11.926333Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.07040"},"observation_digest":"sha256:813f68809efd0fa9b169eec073dd20827a997239b2cbf437dc9b0ea34dee4cdc","observation_id":"611005d7-db0d-4c40-8716-3a1256b735de","resolution":{"observed_at":"2026-07-02T17:07:12.476685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.11196","last_updated":"2026-04-20T02:29:52Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-04-20T02:29:52Z","title":"PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-05T16:23:12.903749Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.11196"},"observation_digest":"sha256:a45c6a16e252144496aa7e735b679c84244b10442c4f65b0d581fcebcd9a76fe","observation_id":"223b9bde-65a6-47db-a9bc-fc0ff814a6b7","resolution":{"observed_at":"2026-07-05T16:31:16.126945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.19057","last_updated":"2026-06-17T13:26:04Z","snapshot_observed_at":"2026-08-02T01:16:24.731597Z","submitted_at":"2026-06-17T13:26:04Z","title":"Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T19:04:45.062426Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.19057"},"observation_digest":"sha256:951d123c7f1a5d8936e0241815ac5e97ad527d6bdfcca56db7bc589f3321a320","observation_id":"9fe2139e-23b4-4d39-86c4-6d1aa8555d4b","resolution":{"observed_at":"2026-07-04T02:49:24.811672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.20608","last_updated":"2026-05-22T02:02:38Z","snapshot_observed_at":"2026-08-03T03:53:21.901116Z","submitted_at":"2026-05-22T02:02:38Z","title":"CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T15:19:30.276155Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.20608"},"observation_digest":"sha256:faa3676d036b2ea52cff5d3bde6fb97965ef9798225bc1d1a67cb65a7f21eb38","observation_id":"00cfc5bf-e014-4d94-bb5c-8fabface31f9","resolution":{"observed_at":"2026-06-30T15:24:50.063709Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.23583","last_updated":"2026-06-22T16:48:43Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:48:43Z","title":"Evaluation Awareness Is Not One Capability: Evidence from Open Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T08:23:20.122338Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.23583"},"observation_digest":"sha256:3b4ef275cb2b6084e5da628494621ba146176c08908ce0e7208fa75251957ef1","observation_id":"b5da3bcb-dd04-41a4-94ed-70f9892a995f","resolution":{"observed_at":"2026-07-04T10:49:46.884857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.30116","last_updated":"2026-06-29T10:47:28Z","snapshot_observed_at":"2026-07-07T00:04:00.652252Z","submitted_at":"2026-06-29T10:47:28Z","title":"Open Problems in Constitutional Preference Reconstruction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T06:49:24.255622Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.30116"},"observation_digest":"sha256:809ec5a93d65c41ca1b81e84044bfe34f1aa69919e55cd64c34a1cadb7d6d932","observation_id":"3d8ef08f-a664-4ec4-9cfc-1e7fa7f9c790","resolution":{"observed_at":"2026-06-30T06:54:20.507786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2606.30931","last_updated":"2026-06-29T21:34:27Z","snapshot_observed_at":"2026-08-02T13:38:37.622654Z","submitted_at":"2026-06-29T21:34:27Z","title":"RoPoLL: Robust Panel of LLM Judges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T01:34:31.158023Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2606.30931"},"observation_digest":"sha256:84e1632d0e6dd7882e1cb129e2e1cc2cf504186b62a952af21e67851b61a64db","observation_id":"f7fdd0ba-10c1-494e-b0cf-9c03b7fb6d45","resolution":{"observed_at":"2026-07-01T12:55:44.495867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2607.06641","last_updated":"2026-07-07T14:47:42Z","snapshot_observed_at":"2026-08-05T13:22:48.194193Z","submitted_at":"2026-07-07T14:47:42Z","title":"Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T00:44:36.322629Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.06641"},"observation_digest":"sha256:a53fbb096cd2bd9781e5e4588a0cdca1ea4960a4b65a2d47b75d01eba5e3d29d","observation_id":"bac534d8-fbc6-46c3-8931-61fe4213d9de","resolution":{"observed_at":"2026-07-11T00:47:43.136596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":"2405.01535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-11T00:47:43.114558Z","title":"arXiv preprint arXiv:2405.01535 (2024)","venue":"cs.CL","work_id":"12a4a5af-38e5-44ce-a1c2-d2ceea6a1e40","year":2024},"citing_paper":{"arxiv_id":"2607.08535","last_updated":"2026-07-09T14:31:05Z","snapshot_observed_at":"2026-08-03T11:44:06.153926Z","submitted_at":"2026-07-09T14:31:05Z","title":"When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T05:47:32.670216Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.08535"},"observation_digest":"sha256:b8deba975e951e53f8f6168d08e3557206f20ce90446c92019aaaae8c78abba0","observation_id":"b8e4f9ee-1810-4140-8569-9b7ccc42b505","resolution":{"observed_at":"2026-07-10T05:56:50.556375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-02T01:34:19.642469Z","title":"arXiv preprint arXiv:2405.01535 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14645","last_updated":"2026-07-20T15:29:48Z","snapshot_observed_at":"2026-08-04T05:02:52.554273Z","submitted_at":"2026-07-16T07:13:54Z","title":"Autoregressive Modeling of Film with Applications in Video Montage","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T01:34:19.642469Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.14645"},"observation_digest":"sha256:e5b773998c19ec6dd7761a2b8487bca95d5247280ab78a316f8e4bbc7245600d","observation_id":"b90ccc66-222a-4d14-ade8-1e5bd0942a48","resolution":{"observed_at":"2026-08-02T01:34:19.642469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-02T10:02:37.926198Z","title":"Prometheus 2:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-06T05:06:49.667332Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.926198Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:d553590937feec858b95de86efdd4162147592146f12ec652c84190f0ab19f27","observation_id":"4b2a61fe-472f-44f8-84cd-293b4924161f","resolution":{"observed_at":"2026-08-02T10:02:37.926198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-02T10:02:41.214150Z","title":"arXiv preprint arXiv:2405.01535 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-06T05:06:49.667332Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.214150Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:299423996ca4da0d668e3d0272492aa63962ea2bbdadb6d816230cb23fff8aa4","observation_id":"da6dcea5-c533-4d7a-bd14-53e25c6e8103","resolution":{"observed_at":"2026-08-02T10:02:41.214150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-01T14:37:34.810212Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-01T17:31:58.319070Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.810212Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:6c725a871af7956f1b8913174d7b86fd0fcf70f7af2c68274ab9f19731d3d57c","observation_id":"21b9f970-9a5d-43b6-932e-bd504a854b9a","resolution":{"observed_at":"2026-08-01T14:37:34.810212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-07-30T18:33:28.502791Z","title":"Y.; Shin, J.; Welleck, S.; Neubig, G.; Lee, M.; Lee, K.; and Seo, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-05T23:14:46.499586Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.502791Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:845bdc6914599ef20f6cc9945d7206f995a7db4e569f8fdbae69c564506a1dc3","observation_id":"db556d63-3042-4177-93f2-9f33928644b8","resolution":{"observed_at":"2026-07-30T18:33:28.502791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-03T01:47:19.245261Z","title":"Y.; Shin, J.; Welleck, S.; Neubig, G.; Lee, M.; Lee, K.; and Seo, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-05T23:14:46.499586Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T01:47:19.245261Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:62eb4b8b042e4b884fabe7cf1d0deedcb3a34ad457eb61882344fcd6d5aab6e1","observation_id":"a06887da-3a93-419c-980d-a3cfc432c04b","resolution":{"observed_at":"2026-08-03T01:47:19.245261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.01535/citation-record","integrity":"/paper/2405.01535/integrity","json":"/paper/2405.01535/citation-record.json","paper":"/paper/2405.01535"},"outbound":[],"paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2405.01535."}