{"as_of":"2026-08-08T00:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c1c6720536038ec74471cf4ce60f0bd581f5f0ecd4432090b7d895eaab8c7c9","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:12:27.792351Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:38:37.969788Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:46:46.529546Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2507.09104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09104","snapshot_observed_at":"2026-07-02T07:46:46.529546Z","title":"Compassjudger-2: Towards generalist judge model via verifiable rewards","venue":null,"work_id":"95afac3e-83f3-405f-851d-7df4b02d4436","year":2025},"citing_paper":{"arxiv_id":"2605.07461","last_updated":"2026-05-08T09:08:07Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:08:07Z","title":"Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:50:50.037018Z"},"links":{"cited_paper":"/paper/2507.09104","citing_paper":"/paper/2605.07461"},"observation_digest":"sha256:934c7141e9b8fbf81b279cca749dfb9212fe7b36ff60796c217e73baccb0cc79","observation_id":"09e18a57-e8f8-4d76-8cb1-f03086c96058","resolution":{"observed_at":"2026-05-11T04:20:56.220230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2507.09104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09104","snapshot_observed_at":"2026-07-02T07:46:46.529546Z","title":"Compassjudger-2: Towards generalist judge model via verifiable rewards","venue":null,"work_id":"95afac3e-83f3-405f-851d-7df4b02d4436","year":2025},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2507.09104","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:1e6eed7d1bb5769e367c7a66bedfd9f5f21718634718e5000c52998111100425","observation_id":"1a759a44-cc4c-4f97-bd61-83c79b70ff22","resolution":{"observed_at":"2026-05-13T04:57:17.294644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"cited_work":{"arxiv_id":"2507.09104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09104","snapshot_observed_at":"2026-07-02T07:46:46.529546Z","title":"Compassjudger-2: Towards generalist judge model via verifiable rewards","venue":null,"work_id":"95afac3e-83f3-405f-851d-7df4b02d4436","year":2025},"citing_paper":{"arxiv_id":"2606.04579","last_updated":"2026-06-22T14:19:37Z","snapshot_observed_at":"2026-08-01T01:43:17.187090Z","submitted_at":"2026-06-03T08:13:27Z","title":"SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T06:38:37.969788Z"},"links":{"cited_paper":"/paper/2507.09104","citing_paper":"/paper/2606.04579"},"observation_digest":"sha256:b8f562dc0ff8b77a9becce76cf5502545cb674d1a8a3d40e52c2a671255af9c7","observation_id":"ce92f95c-8114-4434-93a2-f09526416a7c","resolution":{"observed_at":"2026-07-02T07:46:46.530940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09104/citation-record","integrity":"/paper/2507.09104/integrity","json":"/paper/2507.09104/citation-record.json","paper":"/paper/2507.09104"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-06T18:12:25.776024Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.776024Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:3a1c9772c1b460b067be4f408b934c63efe1429c1a5a18c00be99fa6f7eb401a","observation_id":"27e4bece-34d3-4655-b59c-ecbd55ba1e41","resolution":{"observed_at":"2026-08-06T18:12:25.776024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.807108Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":"8117dbf0-50bc-43d5-b32d-9c5ba6d1f546","year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.812538Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:17fd9b53f56c89d6b34f086a16dcd00c154e69248676ee1bf6a50af933a06b5e","observation_id":"a8229587-89f9-4973-8272-a18480bbe021","resolution":{"observed_at":"2026-08-06T18:12:29.814458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-08-06T18:12:25.845529Z","title":"Compassjudger-1: All-in-one judge model helps model evaluation and evolution.arXiv preprint arXiv:2410.16256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.845529Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:4a46c40a1089032ae2825b254f47ebc51282c7fe49c35768cdd3e47774837a71","observation_id":"fd88d8ab-459a-4851-a8ea-a196281f8614","resolution":{"observed_at":"2026-08-06T18:12:25.845529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:25.879190Z","title":"xverify: Efficient answer verifier for reasoning model evaluations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.879190Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:57519e3fd18b9e88c84de8895f8068c82d12a99696c2f0e322d22ae53379ccee","observation_id":"5a244f4a-55b8-4433-9bca-bcbeb8a535f6","resolution":{"observed_at":"2026-08-06T18:12:25.879190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:25.913376Z","title":"Rm-r1: Reward modeling as reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.913376Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:527a1cccfd3bf50f8bdb208a3a05519a2cbb387c3739dff4d677f10568e6986e","observation_id":"5eb6f3f5-f2ea-40a4-83e4-8bca12bbe728","resolution":{"observed_at":"2026-08-06T18:12:25.913376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T18:12:25.951994Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.951994Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d5150c538ba8426689a10bf01159377a6661495525e95a1e5e0819c17d75685f","observation_id":"48c74d69-9918-4ca3-b307-9e401294ac89","resolution":{"observed_at":"2026-08-06T18:12:25.951994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T18:12:25.991199Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.991199Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:7a81622d87ca1a96c67c4460df68de1cb0365da20e374c4626a73a50ff4754ad","observation_id":"7930b945-138f-406a-a80f-7e223673d29a","resolution":{"observed_at":"2026-08-06T18:12:25.991199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.020066Z","title":"Opencompass: A universal evaluation platform for foundation models.https://github.com/open-compass/opencompass, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.020066Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:afe4d9f6a2fd7c8a34bd0694f75d76d0f77e8b33889c44f8c0a80c22b7ede9a3","observation_id":"dc3bf25f-644f-44e9-b4d7-b2e32884a422","resolution":{"observed_at":"2026-08-06T18:12:26.020066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-06T18:12:26.036730Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.036730Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d79b934ccc073f4b396cd60c4bbca40eeb8e8f0b74c1661b5f065ec296bad279","observation_id":"d7109e07-544e-4427-875a-300a852d6170","resolution":{"observed_at":"2026-08-06T18:12:26.036730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.755342Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs,","venue":null,"work_id":"297f9b3f-488e-444f-95e2-8ed72e042b4c","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.074429Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:e6724cd86c1ca24f244d900d72561ed62f8d9d90fc0d233319a49fe2e825242c","observation_id":"91a8f682-4fdc-4488-aa2b-87c2bdbc8ea5","resolution":{"observed_at":"2026-08-06T18:12:29.769707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-06T18:12:26.136339Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.136339Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:3876ea461083273e2b6746be5a78d8b63d3363baaa8fe349b9b847fd4b287ae6","observation_id":"5f67fc17-b412-4718-9e5d-bdf7b4b5a5a1","resolution":{"observed_at":"2026-08-06T18:12:26.136339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:12:26.161345Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.161345Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:818cadc0b7cb7d75fac8518068dde6859a9ae877941ea3cd6922bea4c18d8539","observation_id":"e6d3a2aa-d945-423f-b32c-cef8de7c4e35","resolution":{"observed_at":"2026-08-06T18:12:26.161345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:12:26.192280Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.192280Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:74551d3e547fbbb3984addd44f49df98a701d35511eb1ea221226fbb1f97eb8c","observation_id":"9134ff68-0f5c-428b-a629-e43243b37694","resolution":{"observed_at":"2026-08-06T18:12:26.192280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:12:26.225242Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.225242Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:527b35160d67eca5553ff89d5104f93ba39f7bb2bfeab68e1f2ca6f14a4d8d87","observation_id":"89da10b7-2134-4928-8d0a-08808659ec0e","resolution":{"observed_at":"2026-08-06T18:12:26.225242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T18:12:26.258243Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.258243Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:261c439255a52ca586d2256e87ed11f7e08711503571790c2f3d6fc5f73dbc72","observation_id":"5545b802-e87f-4476-8211-b6640beb4990","resolution":{"observed_at":"2026-08-06T18:12:26.258243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T18:12:26.293859Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.293859Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:76ff01cd5c5b1e1a4850c7d9b6939faf3c7f9de25224f10373f48c8ae40dac1a","observation_id":"bf909548-303c-4f02-b969-475d1922f1e8","resolution":{"observed_at":"2026-08-06T18:12:26.293859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T18:12:26.322948Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.322948Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:6b2ee8ed1ac73cd5b5f88707fb79b99d7de981f56dbeb4abd1e04b8de3d8b4d4","observation_id":"45344ba6-acfd-4334-9793-2a18459719d4","resolution":{"observed_at":"2026-08-06T18:12:26.322948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-06T02:25:36.517255Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-06T18:12:26.348410Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.348410Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:eb98a8bd63c1287c271318441228d486103457281f8b035b360c95317870872e","observation_id":"d00481c9-9872-4460-ba2a-3481dbf6bb5f","resolution":{"observed_at":"2026-08-06T18:12:26.348410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-06T18:12:26.373443Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.373443Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:0e55c848084d27d731e11aa81caad2226dccb66b7d08cddaccdf4e27db57177d","observation_id":"d6c40686-fd6e-4553-ba9a-5cb72a9223e6","resolution":{"observed_at":"2026-08-06T18:12:26.373443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-06T14:20:21.460707Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-06T18:12:26.407047Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.407047Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:af6edcc282739f753ec2d90c3fe240d3fa37e1a5588f3a22ce61cfe1bab78cda","observation_id":"f42bd137-6ecf-49af-9c2d-538a32a95b5d","resolution":{"observed_at":"2026-08-06T18:12:26.407047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:12:26.432070Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.432070Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:019222497f65e837bd803dec1831e7de9fb6c52ed62e0f618405bade65da79a1","observation_id":"a5a72ff1-95cc-4ccc-b44a-811e87db24a3","resolution":{"observed_at":"2026-08-06T18:12:26.432070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18743","last_updated":"2024-08-25T09:58:57Z","snapshot_observed_at":"2026-08-06T10:19:25.039692Z","submitted_at":"2023-11-30T17:41:30Z","title":"AlignBench: Benchmarking Chinese Alignment of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18743","snapshot_observed_at":"2026-08-06T18:12:26.444272Z","title":"Alignbench: Benchmarking chinese alignment of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.444272Z"},"links":{"cited_paper":"/paper/2311.18743","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:ddd01b2102eb0ebc38e5f8d352ba956cdb5c81c5e7ebf98ad9be523cfa0be93e","observation_id":"2285295d-a65f-46bd-b053-39e90300167b","resolution":{"observed_at":"2026-08-06T18:12:26.444272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.459035Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.459035Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:eceadd7b67f74f91e61d52f37568c01efc91470be23985fd6af9203fd5412e10","observation_id":"37b0be6b-e5c5-4f9f-b230-041943804558","resolution":{"observed_at":"2026-08-06T18:12:26.459035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.466847Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.466847Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:ba621b1692d24d3b9304a286b0bfe7c624453c25dee46b2961e59f29fe20098d","observation_id":"ff6b0cc0-9d3a-4009-94ad-90d0bacab3d3","resolution":{"observed_at":"2026-08-06T18:12:26.466847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.714315Z","title":"Skywork critic model se- ries","venue":null,"work_id":"b55308ec-264d-465d-b743-359a15578d29","year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.498372Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:fa1f838c42738b8eed22852e912df63a5700e1be616f87a741886b756af2fbb4","observation_id":"b0341f35-be9f-494e-9a5d-7d227634c76f","resolution":{"observed_at":"2026-08-06T18:12:29.725029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-06T18:12:26.531419Z","title":"Judgebench: A benchmark for evaluating llm-based judges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.531419Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:99cb3714445abf863af6b5a3a58b2356f1ad3084c53b29ddd66728855402d56e","observation_id":"68938448-2a4b-4ea9-98d3-3cad8e1b3909","resolution":{"observed_at":"2026-08-06T18:12:26.531419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.679128Z","title":"Qwen3: Think deeper, act faster","venue":null,"work_id":"5f8070be-86cd-4818-902c-389ec979577c","year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.554703Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:dbd8ebaff627f4b1359a01c7e6ad38b1b254eceb4be998ba18af9b099b20824d","observation_id":"d5e015e9-c44e-49ef-a69e-1cb7dff45951","resolution":{"observed_at":"2026-08-06T18:12:29.690604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:26.567396Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.567396Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:11dd6e036fc37e94b743a1b99d8c7b665c408f7280b4399c12f7be4325ad1022","observation_id":"795da8ab-7e65-43f8-a394-5160207ec1b2","resolution":{"observed_at":"2026-08-06T18:12:26.567396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T18:12:26.579312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.579312Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:c0766542400a06e7109c64b85e51a022eb6ec0217a8cf4a12678fec897368133","observation_id":"d56107c2-04cf-435c-b5e0-09f1b4efae95","resolution":{"observed_at":"2026-08-06T18:12:26.579312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03742","last_updated":"2024-10-13T10:21:29Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-01T07:38:58Z","title":"Beyond Scalar Reward Model: Learning Generative Judge from Preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03742","snapshot_observed_at":"2026-08-06T18:12:26.607519Z","title":"Beyond scalar reward model: Learning generative judge from preference data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.607519Z"},"links":{"cited_paper":"/paper/2410.03742","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:32293608c41c4e56dc1936e158fa3b5d5a8d6e54f4d65bc74b02ada35815bdbf","observation_id":"18917754-a9e0-4cd7-9bb8-634b69e74c0a","resolution":{"observed_at":"2026-08-06T18:12:26.607519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.631982Z","title":"Learning llm-as-a-judge for preference alignment","venue":null,"work_id":"35feca41-2057-41c4-af8f-8dce9a72ac30","year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.642755Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:2096a5d4f23e7fbdb98d558035c898a302cd162064583d2220e8e5ef658f5852","observation_id":"d6997f2a-8ef3-4a86-bacb-be09c4ac33fe","resolution":{"observed_at":"2026-08-06T18:12:29.645710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11689","last_updated":"2025-09-07T11:12:02Z","snapshot_observed_at":"2026-08-07T18:12:51.694213Z","submitted_at":"2025-02-17T11:28:43Z","title":"Improve LLM-as-a-Judge Ability as a General Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11689","snapshot_observed_at":"2026-08-06T18:12:26.670313Z","title":"Improve llm-as-a-judge ability as a general ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.670313Z"},"links":{"cited_paper":"/paper/2502.11689","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:981e224cd10aa927e0e9e39bc1a3e22f2dd54ee8a06bd1c9e0736127aa0e35c1","observation_id":"9bca6223-97c1-4117-b5e5-ea6569d54fe0","resolution":{"observed_at":"2026-08-06T18:12:26.670313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09893","last_updated":"2025-04-04T11:45:02Z","snapshot_observed_at":"2026-08-06T04:09:56.184787Z","submitted_at":"2024-10-13T16:06:54Z","title":"RMB: Comprehensively Benchmarking Reward Models in LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09893","snapshot_observed_at":"2026-08-06T18:12:26.702068Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.702068Z"},"links":{"cited_paper":"/paper/2410.09893","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:0c00e470894b35617e2bfcccaffce5021fd62d376b82727609449a27078044c5","observation_id":"87686c92-4e7f-4a09-a47c-0fcb6213e753","resolution":{"observed_at":"2026-08-06T18:12:26.702068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-06T18:12:26.737680Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.737680Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:e1a330c07079ed426dffd1e67c7307a83eb6991166f2556fe07e7f22ff1a9fcf","observation_id":"5f1839a8-3f0f-422d-b8dd-b5106ee3dee2","resolution":{"observed_at":"2026-08-06T18:12:26.737680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-06T12:42:08.815092Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-06T18:12:26.763993Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.763993Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:e75730bff09aca47fe5a1bb08a8dc4cb66436d87e1802b2e72d69f54729f1658","observation_id":"f79f2ab3-661c-4cde-afaf-718d10fe32d5","resolution":{"observed_at":"2026-08-06T18:12:26.763993Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.593901Z","title":null,"venue":null,"work_id":"a4898649-a643-4db1-8db7-4424f128046b","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.799679Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:8a0199f8ce3a52e643a01098060bec8a5c20b8830f7cca4c84b743fa0214fd51","observation_id":"39290a96-bdbd-414f-8930-1f51ff5d31fe","resolution":{"observed_at":"2026-08-06T18:12:29.612393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.569539Z","title":"Consider how well it addresses the user’s demand, meets the user’s constraints, and how well it serves the intended purpose","venue":null,"work_id":"c60f75ee-93ca-4d62-9495-8c0ddefbf3b0","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.834630Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:7b2237b713dc7933de2188bdadaa3d3f3d122a4fd028260ee9b6bdb8c9fb6660","observation_id":"7bd4b6f4-784d-46d7-a72e-30a8c34b6ebd","resolution":{"observed_at":"2026-08-06T18:12:29.578949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.535877Z","title":"What aspects of the response fail to meet the user’s request or constraints? What could have been improved?","venue":null,"work_id":"0369f4d1-b546-4960-a867-3f3fd6318bc6","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.868124Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:11b84817faf44780fd07670b0dfe68a8a2591de6004623d466c8b3c3a2630c57","observation_id":"69757312-1fbb-4263-b5dc-45a1a4838573","resolution":{"observed_at":"2026-08-06T18:12:29.548703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.491067Z","title":"Consider how well it addresses the user’s demand, meets the user’s constraints, and how well it serves the intended purpose","venue":null,"work_id":"0a9541b8-3b39-465f-a1a0-2e1c8e6d6c1e","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.888800Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:febacdc6eebcc8ff60abadee6b105b1c58886060ae628188826cfba4b3998d2e","observation_id":"4fc1365d-f39e-4d45-b641-6d7a7e2ab138","resolution":{"observed_at":"2026-08-06T18:12:29.510120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.445747Z","title":"What aspects of the response fail to meet the user’s request or constraints? What could have been improved?","venue":null,"work_id":"66107c26-e2e8-4094-9f84-587453bdc221","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.921244Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:a6c6a9060c28c4d54eacd7f0b0ef2b08e26fb59467a4de679eb530e15e4884a4","observation_id":"19933869-5ee9-4471-9f7f-896d60fd0d03","resolution":{"observed_at":"2026-08-06T18:12:29.457387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.408625Z","title":"Discuss which model’s response is more suitable given the user’s request and con- straints","venue":null,"work_id":"8d218219-b835-4f15-9f53-5f1bfd991213","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.952087Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:4608fdbe5aadbdef09896049455cfe3ee7d924ede7a282af783c93bf0ec86ee7","observation_id":"cafbf833-f115-4365-afba-5190523b1938","resolution":{"observed_at":"2026-08-06T18:12:29.428329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.378517Z","title":"User’s Demand","venue":null,"work_id":"8aa4353b-d034-487b-9ab0-e00da056d219","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.988135Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:8852944c89a9730a86d577a0eaa1694099d36d04c600c7e42f8be7f03f9ff32d","observation_id":"5e250681-443e-4915-9fe0-d0e4e3906f9d","resolution":{"observed_at":"2026-08-06T18:12:29.391320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.151620Z","title":"hushed, waiting world","venue":null,"work_id":"6373935f-4c71-4e90-b136-00ce8bffdbdd","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.190901Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:4d92baafad08491b3f4e0650f6a1a512fa0ece3acad0a61c09a51696f350b972","observation_id":"97afeb97-ec0c-4f5a-9392-f99d8ad9989d","resolution":{"observed_at":"2026-08-06T18:12:29.165270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.116273Z","title":null,"venue":null,"work_id":"bb7abc7e-a3f9-4859-9269-284e7af20fa0","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.211614Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:4666eb9995efbb1cc905a783ce5f392aa1e804de3f398f409a9c991e2fd26e23","observation_id":"9b1d7471-1463-420d-ad97-a81dc080490b","resolution":{"observed_at":"2026-08-06T18:12:29.126628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.071267Z","title":"winter\" or","venue":null,"work_id":"fe974248-cb12-4d11-973c-6ebd3f37c44a","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.237440Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:9cb0d631386cea14d7aa3d3f692f03d2eee25258f2a1a6518083bbe3db8945d9","observation_id":"4f1ecb96-0d57-4b53-a581-8d8a9af093e7","resolution":{"observed_at":"2026-08-06T18:12:29.085792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.023382Z","title":"Frost paints silent trees","venue":null,"work_id":"556148e1-c4d3-4298-ada8-cf294cb30ede","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.273350Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d66ad52b8587479a6359a942285aafb0878dfdc53f35f3d02fef6ea622268824","observation_id":"cb8f08da-78c5-4932-af6a-d324e3f48bad","resolution":{"observed_at":"2026-08-06T18:12:29.039194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.985848Z","title":"Areas for Improvement:","venue":null,"work_id":"bb78f488-d1f3-4924-bffa-a5c362e01b39","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.307975Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:56c23e9f6366e30f222d75d8baa24d8f44aba7ea79062a525aae417df969ff66","observation_id":"a2dc8b3e-b321-45df-ad93-d42e2c5a7526","resolution":{"observed_at":"2026-08-06T18:12:29.000972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.946560Z","title":null,"venue":null,"work_id":"be3b18d6-2740-447c-8ff2-d6540fc11871","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.343975Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:a9c273690639d9ce598636b094897de6de8efa62365b7294657680d43db25f5b","observation_id":"f5f50768-320c-4ffe-b633-fb24295d1e6a","resolution":{"observed_at":"2026-08-06T18:12:28.959781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.906549Z","title":"Hushed, the world awaits","venue":null,"work_id":"6d489683-9dd3-4cb4-a418-d23c3b99357e","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.379650Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:c1a26653d17dc2d4302fab8760059f988ab0d26f056640c58258672f308d100d","observation_id":"4dabcec5-a205-4020-a9fb-8001799c2277","resolution":{"observed_at":"2026-08-06T18:12:28.925905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.870981Z","title":"Overall, the model’s response is a well-crafted poem that meets most of the criteria set by the user’s request","venue":null,"work_id":"ab31245f-eb72-46c4-9aeb-21fc7a51a996","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.406197Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:c84ba227b4b5fe9438b9ed8a2b564564bb68b7efdacaea7983a7bd44c32f9066","observation_id":"da3599d4-4a77-42ad-9dd7-21a63ff4dca4","resolution":{"observed_at":"2026-08-06T18:12:28.888987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.344990Z","title":null,"venue":null,"work_id":"9854e1c6-72ff-4053-8126-c29c548e6184","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.442401Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:75499665bd04c3bbb4c073b1e2b5e1e54a034ba3ab25e001498771c9504da71a","observation_id":"90a7f719-402d-4232-af37-03bd184a0d68","resolution":{"observed_at":"2026-08-06T18:12:29.360097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.311873Z","title":"winter\" or","venue":null,"work_id":"d967e4cc-4a4d-4aaf-9e5b-2ef56267bce2","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.474519Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:a3e246d1e88b5e4903c1669407684ed28831e202f15be5e71f28e244f9ceccbb","observation_id":"3760ca5f-29b7-492b-bafc-66a1f6127621","resolution":{"observed_at":"2026-08-06T18:12:29.326832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.273100Z","title":"Footsteps fade on paths","venue":null,"work_id":"6b320786-1a8f-4f1d-9da8-ff50b9ea9351","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.498619Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:dd67e9787f01bf05a87607c60f27b6da8be05d935e65eda8f8209b3bb36f9824","observation_id":"81617923-d253-4bcd-84ee-d0bd20ab08c7","resolution":{"observed_at":"2026-08-06T18:12:29.290702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.234237Z","title":"Snow\": While the user specifically asked to avoid the word","venue":null,"work_id":"63eb0040-51cb-40a2-8fa5-a852d16b9d99","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.524571Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:f1629c0fed807b8b2d4657da6472394b2f7a91222e0a31cd95b52989150e5e85","observation_id":"f99abb23-5c3e-467b-9bb5-56e6d605ded9","resolution":{"observed_at":"2026-08-06T18:12:29.249162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:29.193947Z","title":"Introducing a bit of variation in sentence structure could add to the poetic quality, such as using a question or exclamation to create a different tone or emphasis","venue":null,"work_id":"cf94741a-c574-4794-af07-9e2182e75e06","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.557622Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:54a3d3494b589c72334bae73dd51e9d7244ef55249323ca5b9c85c1ee6a3e089","observation_id":"732feab5-0c52-4947-9755-1c654ff4287d","resolution":{"observed_at":"2026-08-06T18:12:29.211427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.819301Z","title":"hushed, waiting world","venue":null,"work_id":"fc47b13f-8d72-40a7-85c6-266637525f89","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.585953Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:f9b3559c44c64add0338d8c7234bdfb51deded726f78228dd4b9100df1535745","observation_id":"18639146-0e69-446c-92e3-3d1c6358ea0f","resolution":{"observed_at":"2026-08-06T18:12:28.843893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.786801Z","title":"winter\" or","venue":null,"work_id":"5723cc95-a73e-4d36-a585-636304c38652","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.621485Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:0460fb898a3350cb1ec2539187de3bf6b99f0fd450cca60844050231bec11d92","observation_id":"085ef6eb-93af-49e5-8768-f947b4eee1c3","resolution":{"observed_at":"2026-08-06T18:12:28.802136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.749047Z","title":"Frost paints silent trees","venue":null,"work_id":"94dfd2f3-e026-4c35-ae50-3be051b020c0","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.656931Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:818d2f9be3596dd8b4897f9bb444615e26d6d0bf8ce0e20241fb7607557512cf","observation_id":"2f2578bb-fb20-47d0-ab72-5fd11d05d2d5","resolution":{"observed_at":"2026-08-06T18:12:28.759702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.713796Z","title":"Areas for Improvement:","venue":null,"work_id":"39a0d307-cbf8-425b-b06b-df31ca02675c","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.691320Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:913149cf8eba47cf6c9dba01dee82aba0b04e31d6b7b918a34aa99b9eeea1ec6","observation_id":"30f937ea-45dd-497a-9ac0-ab57082168cb","resolution":{"observed_at":"2026-08-06T18:12:28.728416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.646285Z","title":"For example, including different sensory details (e.g., sounds, smells) could make the poem more immersive","venue":null,"work_id":"4f79f90f-b4bf-4ed7-a92d-0d81dd3afc8b","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.712977Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d366a0c58378d64783c6910ececab71954b66aec6f65d301a46baf7326d81e10","observation_id":"fe1a8d83-464b-4755-951f-ae615343ce38","resolution":{"observed_at":"2026-08-06T18:12:28.673946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.614069Z","title":"For instance, a line that hints at nostalgia or anticipation could deepen the reader’s connection to the season","venue":null,"work_id":"4e30b82c-6a65-4abd-b58f-f9bc32dd504e","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.747083Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:bbcca922c28f940fffd804d5c54100817b3ffa0fa4f788fce5ba1acd68514f65","observation_id":"fcdebfd1-4cf9-403f-b87a-12c4d9483e16","resolution":{"observed_at":"2026-08-06T18:12:28.626009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:28.567422Z","title":null,"venue":null,"work_id":"2fd06502-3e23-433c-8a1f-8e58affb42a6","year":null},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:27.792351Z"},"links":{"citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:1e027bd6bb257a2860b1f00a9d518d80705aa00e4e60f7cba60211bdcd0c2b73","observation_id":"1fe53379-46ae-4626-bee2-c05fbcf51fc7","resolution":{"observed_at":"2026-08-06T18:12:28.584414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-06T18:12:26.105107Z","title":null,"venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.105107Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:d5e3873b380cde88074253b00bfcc373b859fc35ed1459b381753c5fb4a50fba","observation_id":"88afcf16-237b-40ed-9de4-73d8854d0102","resolution":{"observed_at":"2026-08-06T18:12:26.105107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2507.09104."}