{"as_of":"2026-08-17T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d5127e32d3907bb684edb9d7bb9dd51ec431a875885a0c9b11f79b32bd95bf6","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:50:10.809590Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T06:51:56.556213Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T06:54:01.037769Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.11875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11875","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J1: Exploring simple test-time scaling for llm-as-a-judge.arXiv preprint arXiv:2505.11875","venue":null,"work_id":"2c5b58eb-d3d2-410c-81db-648ad38ed9bc","year":null},"citing_paper":{"arxiv_id":"2605.20745","last_updated":"2026-05-20T05:48:16Z","snapshot_observed_at":"2026-08-16T06:41:37.484341Z","submitted_at":"2026-05-20T05:48:16Z","title":"The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T06:51:56.556213Z"},"links":{"cited_paper":"/paper/2505.11875","citing_paper":"/paper/2605.20745"},"observation_digest":"sha256:66fb7790cc9550467cc33c949bbde426bde56f43ff5d203accf36cb5ac851036","observation_id":"800902ac-7871-4cda-8b64-b03a5c706977","resolution":{"observed_at":"2026-05-21T06:54:01.039517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11875/citation-record","integrity":"/paper/2505.11875/integrity","json":"/paper/2505.11875/citation-record.json","paper":"/paper/2505.11875"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-08-17T19:11:47.163118Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-15T20:50:10.436494Z","title":"Critique-out-loud reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.436494Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:c5f1765fba1425b20cad2666f06dce29999ff9a3054dff643b298f5030ae8a31","observation_id":"5ac5df32-1d18-42bc-a1be-30d764a83e2a","resolution":{"observed_at":"2026-08-15T20:50:10.436494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-16T12:51:00.810519Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-15T20:50:10.444035Z","title":"Chain-of-thought reasoning in the wild is not always faithful","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.444035Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:71b406f5cac01d40e01d5762fa2ab8c25ae2e583b65c0cfcef8916128b108f9f","observation_id":"b0790348-3993-483a-ae30-0118665643a4","resolution":{"observed_at":"2026-08-15T20:50:10.444035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T20:50:10.449658Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.449658Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:899387e51c139a0b63f049ee5ca14bc4f5ca658be0f09525e021495f278afcb3","observation_id":"651d2625-62df-4db1-a08b-cae1ffdd979b","resolution":{"observed_at":"2026-08-15T20:50:10.449658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.455694Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.455694Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:b48be84c665a98b260db2beea1bedde9eaf8d99980c885bd8b11c79bd1c7629e","observation_id":"88d6640e-8e54-4ec7-9bc1-7af1024a6ddc","resolution":{"observed_at":"2026-08-15T20:50:10.455694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-15T20:50:10.461007Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.461007Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:0f5b8ab3086e055699c707f17ce08a9fdcbee8aa1d7d5d843521bf60ef336c06","observation_id":"b8e11bc1-ab12-473a-9276-a6e1e919ceab","resolution":{"observed_at":"2026-08-15T20:50:10.461007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.466439Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.466439Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:d509a057962293a862eb74fec774765d146d460aa354c56939a787e60649fe03","observation_id":"14106471-aeec-4471-b4e2-9063e597965b","resolution":{"observed_at":"2026-08-15T20:50:10.466439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00610","last_updated":"2024-03-31T08:58:54Z","snapshot_observed_at":"2026-08-16T14:04:53.635805Z","submitted_at":"2024-03-31T08:58:54Z","title":"RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00610","snapshot_observed_at":"2026-08-15T20:50:10.472032Z","title":"Rq-rag: Learning to refine queries for retrieval augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.472032Z"},"links":{"cited_paper":"/paper/2404.00610","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:95f929f46aef9d547ff4abcef4eef75721abdf5cc647489c28bbeb3410c65cc8","observation_id":"c1ac62e6-1f14-4b5f-8fa8-28400518939f","resolution":{"observed_at":"2026-08-15T20:50:10.472032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14723","last_updated":"2025-02-03T18:57:05Z","snapshot_observed_at":"2026-08-12T18:56:51.611569Z","submitted_at":"2025-01-24T18:58:40Z","title":"CodeMonkeys: Scaling Test-Time Compute for Software Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14723","snapshot_observed_at":"2026-08-15T20:50:10.477308Z","title":"Codemonkeys: Scaling test-time compute for software engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.477308Z"},"links":{"cited_paper":"/paper/2501.14723","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:ae2aba86ffa479e86e8a7785316eb7cf7d2c50980d7e097e2dbcfc0bd12949b3","observation_id":"7f265e26-4bd5-407f-ac99-635c2e12cce4","resolution":{"observed_at":"2026-08-15T20:50:10.477308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.482771Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.482771Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:d07c80d725e9058396850e6b87c8ddbd70bcd4dd956efb398b1544a312514b71","observation_id":"59b2a579-93bb-4804-8422-89810d1e3aed","resolution":{"observed_at":"2026-08-15T20:50:10.482771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.184880Z","title":"Gemini 2.0 flash thinking mode","venue":null,"work_id":"5369a448-9bbc-451f-bb6d-ce5fd9a74e25","year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.487974Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:3dc3f03e0baddb8534a0a2ce01b45db20eca3fe0e7d4a59080d04e0576b2e00e","observation_id":"7d0b3ea7-ab84-403d-a478-a23e1727bb7c","resolution":{"observed_at":"2026-08-15T20:50:12.190589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:50:10.493461Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.493461Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:35a71b18a3fac9473053934093fd28a3cc94d473990b7c5cf5b058b11c18d4bb","observation_id":"8a8d7b61-c5e5-4153-b04f-10555938505e","resolution":{"observed_at":"2026-08-15T20:50:10.493461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T20:50:10.499201Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.499201Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:b93a3174b05226c96ef17000ba003e5be3806599e70161896e940585ed63bdc9","observation_id":"d9a0143e-6e3a-4eca-87a3-14a6d2fac6e0","resolution":{"observed_at":"2026-08-15T20:50:10.499201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:50:10.504807Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.504807Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:796f015535e8c2cf0a68f4fa37a6d972887ff6ed21ffe90788a53a59957dc71a","observation_id":"b173fb99-234d-4b52-ac4b-186ad1b9730b","resolution":{"observed_at":"2026-08-15T20:50:10.504807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-12T20:12:20.465098Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-15T20:50:10.509542Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.509542Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:56d8ccd2e22522a341bbea581d9ed09575f4978ff3ae874b95741ac39f6d392a","observation_id":"f1e6d08d-c4a8-4340-bfa6-6e477506c399","resolution":{"observed_at":"2026-08-15T20:50:10.509542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04608","last_updated":"2019-02-01T09:31:08Z","snapshot_observed_at":"2026-08-14T17:45:07.127135Z","submitted_at":"2018-12-11T18:50:02Z","title":"Metrics for Explainable AI: Challenges and Prospects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04608","snapshot_observed_at":"2026-08-15T20:50:10.514533Z","title":"Metrics for explainable ai: Challenges and prospects","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.514533Z"},"links":{"cited_paper":"/paper/1812.04608","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9f15987b65ebb408aaa645576cc24d2d3bb2ac3877e32e3e370675862f5cb7ef","observation_id":"3517ec8c-e637-46c0-8a66-19dd9032f937","resolution":{"observed_at":"2026-08-15T20:50:10.514533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16349","last_updated":"2024-01-16T16:51:33Z","snapshot_observed_at":"2026-08-16T14:56:53.422613Z","submitted_at":"2023-09-28T11:18:20Z","title":"Human Feedback is not Gold Standard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16349","snapshot_observed_at":"2026-08-15T20:50:10.519624Z","title":"Human feedback is not gold standard","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.519624Z"},"links":{"cited_paper":"/paper/2309.16349","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:f84db3d8ad237bf4082721a53c27544b4d77038131560b85671f74b3894efa8f","observation_id":"cd9810c7-f516-48af-ba87-11efe248e784","resolution":{"observed_at":"2026-08-15T20:50:10.519624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-15T20:50:10.524402Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.524402Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:0c709492189f13c70645877c16855776410a55539770f25a694d8ec39533c961","observation_id":"6f680da6-fc13-4fd1-afb2-0df8f6d4a6f3","resolution":{"observed_at":"2026-08-15T20:50:10.524402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.168634Z","title":"open-r1/openr1-math-220k","venue":null,"work_id":"6f300d77-a27b-4003-8985-e9b7867e79e4","year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.529827Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:b08bf9258cf88f4c416cbbafa001fcf6b2c57b3af22b6b42cdd5196aa2a35966","observation_id":"fc4e5462-60a0-42b2-a694-27af085da23e","resolution":{"observed_at":"2026-08-15T20:50:12.173715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-16T13:40:57.893955Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-15T20:50:10.534659Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.534659Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:1bcd889d7640d56bd6058c369456f83ce8c627d7d4897d84aecaf0a78b0a7ee2","observation_id":"06262224-13c3-4f23-8a03-21b71a1463e5","resolution":{"observed_at":"2026-08-15T20:50:10.534659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.151373Z","title":"On scalable oversight with weak llms judging strong llms","venue":null,"work_id":"b65253ad-08b4-4e9e-ba00-46167fdc45bd","year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.539974Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:133d9e06b1c969606a04616036d8f26cd92f9ab5fbd30c512af45ff476e6b6dd","observation_id":"c51ce50a-8322-42fd-a578-22b3ed8fc3f7","resolution":{"observed_at":"2026-08-15T20:50:12.156458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01729","last_updated":"2024-10-02T16:39:58Z","snapshot_observed_at":"2026-08-16T13:13:16.599471Z","submitted_at":"2024-10-02T16:39:58Z","title":"Evaluating Robustness of Reward Models for Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01729","snapshot_observed_at":"2026-08-15T20:50:10.544791Z","title":"Evaluating robustness of reward models for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.544791Z"},"links":{"cited_paper":"/paper/2410.01729","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:75386cdfd8be8ad3b7408b3fa558ed1a5d17e3ff5265b594ad25a663750555e5","observation_id":"ab2762c8-24bd-4359-9e61-9eb3ecee8bea","resolution":{"observed_at":"2026-08-15T20:50:10.544791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07629","last_updated":"2023-10-11T16:18:13Z","snapshot_observed_at":"2026-08-17T03:30:03.754636Z","submitted_at":"2023-10-11T16:18:13Z","title":"The Past, Present and Better Future of Feedback Learning in Large Language Models for Subjective Human Preferences and Values","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07629","snapshot_observed_at":"2026-08-15T20:50:10.549841Z","title":"The past, present and better future of feedback learning in large language models for subjective human preferences and values","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.549841Z"},"links":{"cited_paper":"/paper/2310.07629","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:bc1735d14acf693cc90f43929057f668656626f0353f382641a81b2426ae05ed","observation_id":"fcc46d3b-de50-4ce1-9122-010879d858a3","resolution":{"observed_at":"2026-08-15T20:50:10.549841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-17T18:23:08.323051Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-15T20:50:10.554990Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.554990Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:7294de05a8b021aff4f85aa871b0cd462040910c5fe5271791382f9cc4f6db78","observation_id":"5077b2c0-f17a-4ef2-aec8-ca995dad0fb5","resolution":{"observed_at":"2026-08-15T20:50:10.554990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.559959Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.559959Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:8908f1e12e1a2e7ccbcb6ecfe6ab3664ffa8e7e1d7e3916882fb4b9243c9699d","observation_id":"d7f8acd1-148d-4dd3-86b6-a248966a084b","resolution":{"observed_at":"2026-08-15T20:50:10.559959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-16T14:53:56.793203Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-15T20:50:10.564644Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.564644Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:83efedf3c90be9ad723b044cf8ab747d770dc9c843cc5e9c78e78b2ce8deecbf","observation_id":"b134077e-e4b5-48b2-90a9-8c8a634e2ff6","resolution":{"observed_at":"2026-08-15T20:50:10.564644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.570180Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.570180Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:85f616335f4043f1c8f36c8a1004f8011848b159862100375ee4d0bc432378f0","observation_id":"8d988751-2e87-461e-844d-882b2cf70639","resolution":{"observed_at":"2026-08-15T20:50:10.570180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-15T20:50:10.575982Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.575982Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:7082f4511af66714b71f046084d3d39b212f02c061d4b752221848a548b321b4","observation_id":"717df3ac-9d5c-4bfb-a2cd-60bbc516554e","resolution":{"observed_at":"2026-08-15T20:50:10.575982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18942","last_updated":"2025-04-01T06:52:58Z","snapshot_observed_at":"2026-08-16T12:47:14.770576Z","submitted_at":"2025-03-24T17:59:04Z","title":"Video-T1: Test-Time Scaling for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18942","snapshot_observed_at":"2026-08-15T20:50:10.580904Z","title":"Video-t1: Test-time scaling for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.580904Z"},"links":{"cited_paper":"/paper/2503.18942","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:6fe901e5a7767165f74428c596a27983062ed3ce5e5d0f723405b1ed5ed662e3","observation_id":"fac3f3d2-a97d-49a0-947e-cbbe3f21fa50","resolution":{"observed_at":"2026-08-15T20:50:10.580904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03837","last_updated":"2024-10-23T22:22:20Z","snapshot_observed_at":"2026-08-16T13:12:28.889892Z","submitted_at":"2024-10-04T18:05:22Z","title":"Learning Code Preference via Synthetic Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03837","snapshot_observed_at":"2026-08-15T20:50:10.586287Z","title":"Learning code preference via synthetic evolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.586287Z"},"links":{"cited_paper":"/paper/2410.03837","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9a36096ba32ca8a93f54eb172e9a32e8dbaae8160c298daae7d58b39d4329f83","observation_id":"74c64b38-a827-492c-a85e-aa5eb19e2e68","resolution":{"observed_at":"2026-08-15T20:50:10.586287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.591957Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.591957Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:3cdf946691b9c72ef1202e67e7e67bc4b952f2b0cda037428a38535b68bb8ced","observation_id":"18096810-0622-4985-94e7-6b9917ed69c8","resolution":{"observed_at":"2026-08-15T20:50:10.591957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.123628Z","title":"Principal components analysis (pca)","venue":null,"work_id":"79942163-304f-46d5-8ab4-a9cb0a1d7f7e","year":1993},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.596839Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:29b518bba05a4e5ece37bb2b5b0fa152e143dcfc3032605f71e35a5b52c12cde","observation_id":"a53a6a3f-e3e1-4310-80bd-5f6d3cccfb02","resolution":{"observed_at":"2026-08-15T20:50:12.128796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.601696Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.601696Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:054347e5eec59506bd800544e5bf1e7f508674da93f969aae415ffdfab93a095","observation_id":"9c42e0fb-1f97-4bed-86b9-82d50605798e","resolution":{"observed_at":"2026-08-15T20:50:10.601696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-16T13:38:37.638259Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-15T20:50:10.606695Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.606695Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:368c8f3b0cede07a8ee6a138f5e5634ecf116de42c7bbdbb3094d8240c3be2a8","observation_id":"ee70976a-dda7-4ce8-83d6-b3643658689c","resolution":{"observed_at":"2026-08-15T20:50:10.606695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T20:50:10.612040Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.612040Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9116d15b866ed624c7545d06443b071d50130a865d2b21e0e10d59cfdd12811a","observation_id":"f4c9b583-8b7b-48a9-b3b6-37edf0b766e9","resolution":{"observed_at":"2026-08-15T20:50:10.612040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.096375Z","title":"Learning to reason with llms","venue":null,"work_id":"6e97d01d-2294-45d3-9afa-ab8dc59735fe","year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.617303Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:e916a1ec4ee482115fb61d939d17a3a36aad1297b1e680ca8d11b8103602ffb6","observation_id":"2534edf0-a286-426d-9b53-1d05f9dfa127","resolution":{"observed_at":"2026-08-15T20:50:12.101504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.622075Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.622075Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:575a5359b742a03a46738c8e9498607f6896e94cff7fb279043df218ad97a387","observation_id":"74bf2cca-d301-45a0-91cb-cf6d7ee3cc84","resolution":{"observed_at":"2026-08-15T20:50:10.622075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-15T20:50:10.626884Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.626884Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:c2d300f813d80f89f2650bea81ebf7648e372d25673ba3c6f2e0b8343f3a5aad","observation_id":"9032f033-466d-4408-bd5f-3777967ffaeb","resolution":{"observed_at":"2026-08-15T20:50:10.626884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.632128Z","title":"Codeforces cots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.632128Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:7f37a02a8073e49f9569197818ef5e2d04657dfaa4ca2369649367f54f82fcff","observation_id":"06f743cf-9983-4d01-b785-b09d267b93fe","resolution":{"observed_at":"2026-08-15T20:50:10.632128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18099","last_updated":"2025-07-08T09:49:57Z","snapshot_observed_at":"2026-08-17T07:00:12.389328Z","submitted_at":"2025-01-30T02:21:59Z","title":"Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18099","snapshot_observed_at":"2026-08-15T20:50:10.636826Z","title":"Learning to plan & reason for evaluation with thinking-llm-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.636826Z"},"links":{"cited_paper":"/paper/2501.18099","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:5831cf10fc14a920fb33b030e2b3ba77df804b81c1040f523b5626a659ae5873","observation_id":"2dc70ec6-264d-45fc-83fe-70a0567d2b40","resolution":{"observed_at":"2026-08-15T20:50:10.636826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-15T20:50:10.642154Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.642154Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:7a6ca61c4b75cc81ba10357f8bb85046605dcba1a3f38550b3d8791d1219e032","observation_id":"a3910a0e-0383-4bdb-9fc9-e02f56917c99","resolution":{"observed_at":"2026-08-15T20:50:10.642154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:50:10.647716Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.647716Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:bd5769fb701dfebab645b87366fd8bf30956be41f056c39a4534df4bb1568750","observation_id":"ab972d01-0af6-4a51-9f44-4d5429532e87","resolution":{"observed_at":"2026-08-15T20:50:10.647716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-16T12:43:48.435094Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-08-15T20:50:10.656123Z","title":"Rethinking reflection in pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.656123Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:e51f76d90ec1593a6d3db860d5db966d6c8ec7bc69d743526cafa399d5b49a38","observation_id":"10defcfb-39b0-4479-b126-91e9e4654881","resolution":{"observed_at":"2026-08-15T20:50:10.656123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:50:10.661362Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.661362Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:28a66485e07461ea98e31e55ffeb59f9b29c1933dac13ea14afa1b318dd9048a","observation_id":"5265dbef-10ca-4f34-bacf-f96f10d32b45","resolution":{"observed_at":"2026-08-15T20:50:10.661362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.058381Z","title":"Skywork critic model series","venue":null,"work_id":"ec8ee279-3450-45f3-a74e-4f52cc62d6b9","year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.666183Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9eb8dfac50d29e516cd3a4433c1d1f3db95b826d653dfb5a815aca540e18e260","observation_id":"d7437445-4e5c-4204-b640-ffcd69daff0d","resolution":{"observed_at":"2026-08-15T20:50:12.063946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T20:50:10.671068Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.671068Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:1e6f00b7aaacd32b7bca2e92bf8abb9fd6e48ebdd349feab660224cedf3451ae","observation_id":"0ccec354-002b-4a03-bac9-76eda568aa24","resolution":{"observed_at":"2026-08-15T20:50:10.671068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:50:10.676036Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.676036Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:a943d177713af92169c15b1fad55e64aacf65654b850f9dc9463d63dd1ae2d73","observation_id":"2eb1173f-22a9-49de-920e-8a77f649ecf5","resolution":{"observed_at":"2026-08-15T20:50:10.676036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-16T13:09:59.425817Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-15T20:50:10.680809Z","title":"Openr: An open source framework for advanced reasoning with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.680809Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:13d79d65f42a3484d9f8c9deb16c76e5fc5c9ea42b597cf6d0f79a78e5bc05f4","observation_id":"7332358e-dafe-41d3-8598-01038e3d75a3","resolution":{"observed_at":"2026-08-15T20:50:10.680809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.685925Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.685925Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:04744e0e6ad2e959421bb2fc1aa97ec12419a2d97afc9e35efd23ef43217ab86","observation_id":"1d273eb4-3e0e-4360-aefa-53deaf8f8177","resolution":{"observed_at":"2026-08-15T20:50:10.685925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-15T20:50:10.690874Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.690874Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:24d55b2208768a3500e7ff228938f10825840f9f1560cd8f7025ad6576e808bf","observation_id":"d1a924e3-b953-46bb-b261-45d2f70bc1f7","resolution":{"observed_at":"2026-08-15T20:50:10.690874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T20:50:10.696490Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.696490Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:f95c76a13eb760369d6b3920a06558ae40f1f2e9e46c5808bcf732049c7eab9c","observation_id":"8f717129-d5ef-4671-9290-c40b8efb86ff","resolution":{"observed_at":"2026-08-15T20:50:10.696490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09032","last_updated":"2024-12-27T05:13:23Z","snapshot_observed_at":"2026-08-16T14:09:59.223904Z","submitted_at":"2024-03-14T01:51:35Z","title":"CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09032","snapshot_observed_at":"2026-08-15T20:50:10.701477Z","title":"Codeultrafeedback: An llm-as-a-judge dataset for aligning large language models to coding preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.701477Z"},"links":{"cited_paper":"/paper/2403.09032","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:48b0a1591009b116c150e6aa4e1d038fabef8157bafeb9c1da55a745e3c52fd1","observation_id":"d2b6d259-7d69-40d3-8045-0e66ca820046","resolution":{"observed_at":"2026-08-15T20:50:10.701477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-15T20:50:10.706682Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.706682Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9d4be9b8ea8e2a5919dc304c903a2e952da01b73f0d8d32edc71c4aa8e5552ac","observation_id":"5b070bb3-c9d3-4433-99a9-60e9b48b9bce","resolution":{"observed_at":"2026-08-15T20:50:10.706682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-15T20:50:10.711821Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.711821Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:00fec004c8c885f5ef377983cead6ac2296ce21300a1d1f84c1ad19f6cc76751","observation_id":"74837265-47e4-4644-a030-e78669015e47","resolution":{"observed_at":"2026-08-15T20:50:10.711821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.716804Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.716804Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:301231e5483b7b9b3635903b3590eb665876cf8c3d5c427fa2b87ae15ec8d709","observation_id":"2dfe73a8-18ed-42ac-ae77-95ff14473511","resolution":{"observed_at":"2026-08-15T20:50:10.716804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T20:50:10.721529Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.721529Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:206c3a7770aa725e5e8a00a76ff2644a8f61c73a0f606a021a2f8813ac61ebb7","observation_id":"68bc86be-7a87-4501-9799-e0d7efb070ce","resolution":{"observed_at":"2026-08-15T20:50:10.721529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-12T12:16:58.791696Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-15T20:50:10.727349Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.727349Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:363b7578f449e91f1c5951adc12973bd8b378d5b5893dabd7ebd6419dc9e5368","observation_id":"e8da5a41-b423-4431-af5e-73ffb094deec","resolution":{"observed_at":"2026-08-15T20:50:10.727349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:50:10.732498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.732498Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9b16c16698648d766d9393ed31e9514a100ad1b8c3dcd231cead7d437c78a0b2","observation_id":"27fb38c9-5622-4ad3-8c07-db05c783cf0c","resolution":{"observed_at":"2026-08-15T20:50:10.732498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:12.018028Z","title":"Mastering complex control in moba games with deep reinforcement learning","venue":null,"work_id":"7f484d5f-6575-4763-8c55-f59e8b31bb69","year":2020},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.737309Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:398c51c9348f78bfffbb040d2704d4e7ec1801bf5d2c36c13b15acc26ea1d7b2","observation_id":"da640ddb-bfa1-46a9-9be8-d2e574d7a34f","resolution":{"observed_at":"2026-08-15T20:50:12.023617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-15T20:50:10.742029Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.742029Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9e1e4b3d05d493d503132508838b7bfa00b91873df6f90e40711082bd14a5626","observation_id":"2420f695-7e96-4b88-8ad8-1164498e6519","resolution":{"observed_at":"2026-08-15T20:50:10.742029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20850","last_updated":"2024-10-18T15:43:02Z","snapshot_observed_at":"2026-08-17T08:48:24.090826Z","submitted_at":"2024-05-31T14:33:07Z","title":"Improving Reward Models with Synthetic Critiques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20850","snapshot_observed_at":"2026-08-15T20:50:10.747217Z","title":"Improving reward models with synthetic critiques","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.747217Z"},"links":{"cited_paper":"/paper/2405.20850","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:5166f3a16718c83b526e9fb8d921a81e21bcbb5aa687d407589e7c8e22a4162c","observation_id":"f6e5db68-d593-4fe2-8b62-5192716d26df","resolution":{"observed_at":"2026-08-15T20:50:10.747217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11689","last_updated":"2025-09-07T11:12:02Z","snapshot_observed_at":"2026-08-16T12:57:46.162401Z","submitted_at":"2025-02-17T11:28:43Z","title":"Improve LLM-as-a-Judge Ability as a General Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11689","snapshot_observed_at":"2026-08-15T20:50:10.752460Z","title":"Improve llm-as-a-judge ability as a general ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.752460Z"},"links":{"cited_paper":"/paper/2502.11689","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:f46c273591ae1183ba8aeb6669f77ce78fbb0fba458a4f8af77c76a75f7f0b33","observation_id":"fb263d60-1f64-4aa3-bf27-ec3c70ea846a","resolution":{"observed_at":"2026-08-15T20:50:10.752460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-13T05:48:57.895519Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-08-15T20:50:10.757228Z","title":"Self-generated critiques boost reward modeling for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.757228Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:8875cf3fa531d7f6b69dcb2c68995f535afebc01b04895dc503209cea7f48ddc","observation_id":"13be2a22-8da4-46b1-9941-d6d1fb329489","resolution":{"observed_at":"2026-08-15T20:50:10.757228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00810","last_updated":"2025-04-01T14:01:50Z","snapshot_observed_at":"2026-08-16T12:44:56.257040Z","submitted_at":"2025-04-01T14:01:50Z","title":"Z1: Efficient Test-time Scaling with Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00810","snapshot_observed_at":"2026-08-15T20:50:10.762040Z","title":"Z1: Efficient test-time scaling with code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.762040Z"},"links":{"cited_paper":"/paper/2504.00810","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:4233ed2fafb75c566dbb6161cf3d2864faf0ba1979639464c7bf1c1d40fe6e01","observation_id":"d38de029-615c-4ca0-aa7e-4a6ba0707f3f","resolution":{"observed_at":"2026-08-15T20:50:10.762040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-16T13:12:50.131108Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-15T20:50:10.767033Z","title":"Llama-berry: Pairwise optimization for o1-like olympiad-level mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.767033Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:c27a672380b295f61de2d511ad25bf022ba92361c79686b629263fc70623a3b5","observation_id":"2b61f84a-557a-49f5-8e22-56a820d7d41e","resolution":{"observed_at":"2026-08-15T20:50:10.767033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:11.998880Z","title":"Openprm: Building open-domain process-based reward models with preference trees","venue":null,"work_id":"e7a5bb3a-e9df-4309-9f62-1c82e2a303cd","year":2025},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.772283Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:2b1b8c4b3a901cfa03934b1a0993fb51b6668f03b315fe2c2726ae7aaed0fbfe","observation_id":"cf0ccd04-6bfa-4465-af41-e84551740a41","resolution":{"observed_at":"2026-08-15T20:50:12.006003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-17T07:45:48.419891Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-15T20:50:10.777366Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.777366Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:4fe68fd3187c1a1d6c27951d3b067661f32ffdd3c922597b2413e37bf5b7f394","observation_id":"99e9c94b-caf6-494d-960e-65dde388b2a1","resolution":{"observed_at":"2026-08-15T20:50:10.777366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.782262Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.782262Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:9a85b8b1feb1bfdfdf59eed1eeac0d7acb64a064fa47a2c4d46e203fdb9273cd","observation_id":"75580b05-339e-4015-b754-d08d2082f886","resolution":{"observed_at":"2026-08-15T20:50:10.782262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-16T14:48:30.939401Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-15T20:50:10.787220Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.787220Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:4a73e32326e01f09276bff18216e00d6d4ca2d6038c263dd756347e3f8ed0631","observation_id":"3142b804-82d7-4317-a93c-a1dbceeb2f23","resolution":{"observed_at":"2026-08-15T20:50:10.787220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.792368Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.792368Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:ac10e051ec8045e632f41f28934afaa9336d4bbef22a43135933e0a41c839927","observation_id":"a68f265e-105c-4f61-8486-e1a9b497d9b1","resolution":{"observed_at":"2026-08-15T20:50:10.792368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.798582Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.798582Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:477b45c83e780e56e82020c1d65672289c2647e1f088731f380983c497be0234","observation_id":"e2fcb828-fd43-413a-97e8-d86becababed","resolution":{"observed_at":"2026-08-15T20:50:10.798582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.804046Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.804046Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:297337e2f5392c48d43aeed5a68ca642a66183bfcdc89894880c8a8d166be01e","observation_id":"789001e0-dfb7-45ef-828a-a5dc19afdac5","resolution":{"observed_at":"2026-08-15T20:50:10.804046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:50:10.809590Z","title":"wait\" step across four benchmark tasks. Because the proportion of responses altered after adding each","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T20:50:10.809590Z"},"links":{"citing_paper":"/paper/2505.11875"},"observation_digest":"sha256:10f8f3d2dc5cdb7e9ffb279491dac3a77b4e7d3fb864c85c81a1a9b319c2da39","observation_id":"2482c9fe-d73e-4b1d-bbef-857ee8f47697","resolution":{"observed_at":"2026-08-15T20:50:10.809590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11875","last_updated":"2025-05-17T06:58:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T07:01:23.593980Z","submitted_at":"2025-05-17T06:58:42Z","title":"J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2505.11875."}