{"as_of":"2026-08-19T22:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:178e38791132912247391a8f931fff76ffb1b327b5ae725641250d8f4dbe6060","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:10:31.113654Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12585/citation-record","integrity":"/paper/2608.12585/integrity","json":"/paper/2608.12585/citation-record.json","paper":"/paper/2608.12585"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19633","last_updated":"2026-05-19T10:18:12Z","snapshot_observed_at":"2026-08-19T14:39:34.546718Z","submitted_at":"2026-05-19T10:18:12Z","title":"optimize_anything: A Universal API for Optimizing any Text Parameter","version":1},"cited_work":{"arxiv_id":"2605.19633","doi":"10.48550/arxiv.2605.19633","metadata_source":"pith","pith_arxiv_id":"2605.19633","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"optimize_anything: A Universal API for Optimizing any Text Parameter","venue":"cs.CL","work_id":"137d3ced-ddcb-4e19-9d66-576c09ce4e91","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.845169Z"},"links":{"cited_paper":"/paper/2605.19633","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:d430501408386099212582255b923cba32b26f3bd3fad89482fb596058459825","observation_id":"f21e2386-3b3c-42cf-bd06-8a7f791376da","resolution":{"observed_at":"2026-08-16T00:10:31.155688Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.196011Z","title":"Claude opus 4.6 system card","venue":null,"work_id":"0b4377d3-9149-4880-a150-e4cbfc9ae0ff","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.851238Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:8e1566d6dfbc668cc8ea06ddfbc88b6b3363ae13e11c6e3172f1337827dec6e3","observation_id":"d59f0149-2ae2-4964-8da2-993b1d04fc2e","resolution":{"observed_at":"2026-08-16T00:10:32.200939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.182519Z","title":"Claude sonnet 4.6 system card","venue":null,"work_id":"66b4c152-7658-4791-a2a6-b6d66dd4dd48","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.857010Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:33454cc2681a78bbac3f3c72e3113b796ec1cc3c14b71854d1c7aa9ffb033e01","observation_id":"718f155c-2323-4307-9406-a9031faefdf9","resolution":{"observed_at":"2026-08-16T00:10:32.186714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21028","last_updated":"2025-07-28T17:48:40Z","snapshot_observed_at":"2026-08-17T23:06:20.288921Z","submitted_at":"2025-07-28T17:48:40Z","title":"Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21028","snapshot_observed_at":"2026-08-16T00:10:30.862323Z","title":"Multi-agent-as-judge: Aligning LLM-agent-based automated evaluation with multi-dimensional human evaluation.arXiv preprint arXiv:2507.21028, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.862323Z"},"links":{"cited_paper":"/paper/2507.21028","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:82ad3b7c54c20bf2b3c51a51bbbce76549ab830953bc8a4b69eac094faf1ac89","observation_id":"df871948-4df4-4ede-9831-4217e1e92d9b","resolution":{"observed_at":"2026-08-16T00:10:30.862323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.168507Z","title":"Nudging the boundaries of llm reasoning","venue":null,"work_id":"063dd0a1-c9b3-4dde-be24-1880ae5c2d4e","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.867093Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:2c950537eb67dcb495a80a7dc10e36ca8bdfac73b7f21147e2f0087510284089","observation_id":"1d7c96cf-3105-44b8-9885-9c6309d84dc6","resolution":{"observed_at":"2026-08-16T00:10:32.173193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:30.871471Z","title":"Stop summation: Min-form credit assignment is all process reward model 17 needs for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.871471Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:8adc59c626b663a8e18d37d159975dd379ed0631750b268b5806e7170b4a182d","observation_id":"15ce2d86-1359-42a7-807e-5a850116d3e7","resolution":{"observed_at":"2026-08-16T00:10:30.871471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T00:10:30.876413Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.876413Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:0c0430671dbdfbe0a33214ae386c7dec8096760d9a34d259436a57f7ae2d5215","observation_id":"2f2c8ee3-ce2b-41a5-a398-852395b08c39","resolution":{"observed_at":"2026-08-16T00:10:30.876413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.154008Z","title":"DeepSeek-V4-Pro model card","venue":null,"work_id":"8546b3bd-db20-4a6d-add2-f3ed3400d73a","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.880998Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:013f3c054d86823bad3e68d61ee3d8ff702a04fba8d6fb246076eee6bc4b3ea9","observation_id":"921030ce-a718-4456-8d8e-d5a8ec94c920","resolution":{"observed_at":"2026-08-16T00:10:32.158523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-17T12:39:54.496393Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-08-16T00:10:30.885694Z","title":"Beyond benchmarks: Matharena as an evaluation platform for mathematics with llms, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.885694Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:253ed60efe5c4e3655d773c8de9fcdb2b15149f7b25644df59ecc27e78adfc8a","observation_id":"b5839ea3-7483-4d51-aa0c-81c9046863e4","resolution":{"observed_at":"2026-08-16T00:10:30.885694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:30.890190Z","title":"Tenenbaum, and Igor Mordatch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.890190Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:3ce03efc0365fb0bdb9f25c697fe754fe2102267a1d67a2922bad22d910fd03e","observation_id":"6fcde8c6-5046-47a9-a28e-b47072f85a81","resolution":{"observed_at":"2026-08-16T00:10:30.890190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-18T16:22:37.329414Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-16T00:10:30.894249Z","title":"Gemma 4 technical report.arXiv preprint arXiv:2607.02770, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.894249Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:b1d23bc09df7f4e20041465cf375fda23d83f5001a3fc8bc66a2030e61d38cb0","observation_id":"608c3d74-1f40-4785-bd73-e78d67664c51","resolution":{"observed_at":"2026-08-16T00:10:30.894249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-16T00:10:30.898657Z","title":"GLM-5: From vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.898657Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:72d2d5304147e183841d18bc085395e111184441638aa009ce26eb40cc425173","observation_id":"d9ca9d02-271b-4223-957b-f5d9acf8d133","resolution":{"observed_at":"2026-08-16T00:10:30.898657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.130326Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":"656118e2-9668-4c7e-9de6-8ede34e22ec6","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.903491Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:e68e2d30733257794b0d6b1ec8775b11ed0e5c90afd74b2e7e124908bb96824e","observation_id":"355378b9-a272-4d95-a592-0eccf02c49b4","resolution":{"observed_at":"2026-08-16T00:10:32.134679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-16T00:10:30.907639Z","title":"A survey on LLM-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.907639Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:42158dceae32f2d7c03d5c49cb00ab499189e7630fc09436c59f617bfdd87828","observation_id":"049203f7-36ae-4393-98ab-9b58fd1be231","resolution":{"observed_at":"2026-08-16T00:10:30.907639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.116050Z","title":null,"venue":null,"work_id":"3ddf7d2f-5100-4bb6-8ce1-43d8c6651b7c","year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.912743Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:90457cf91096c5fdac318aac35e2aa235ec4d55609aaa91eecf72754482ec14b","observation_id":"071ccec1-df26-4011-aa0d-39ed69a4c597","resolution":{"observed_at":"2026-08-16T00:10:32.120673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.101688Z","title":"Reinforcement learning via self-distillation","venue":null,"work_id":"4da1d89b-930f-4466-8daa-d04ef2c67056","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.917621Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:8ba431c96327967c26ca3b70ff3bb04c2b6bab0655e3b5671a955fc767d06d3d","observation_id":"e94f6ab1-8757-4ae8-b04d-001db078b1d0","resolution":{"observed_at":"2026-08-16T00:10:32.106361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.087519Z","title":"Let’s verify step by step.International Conference on Learning Representations (ICLR), 2024","venue":null,"work_id":"dcfc689e-7282-4996-92e4-103bbf20314a","year":2024},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.921912Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:0c4bedf38896413e506766b1427826c28ab1b43acb5990451f2ef134184a1e9f","observation_id":"b71ddfae-7498-4b82-9ef8-911b1c200313","resolution":{"observed_at":"2026-08-16T00:10:32.092394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.072905Z","title":"MiniMax-M2.7 model card","venue":null,"work_id":"b3ca0b6f-b4d7-4939-8784-c1c8f4c9d86c","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.926091Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:043ce1c343a528904ec758d808c5ac1c146a2bf3daaaec433a264a4a84f4ce1e","observation_id":"d41f5618-2d4b-4012-95d0-7a734068d122","resolution":{"observed_at":"2026-08-16T00:10:32.077650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.056741Z","title":"MiniMax-M3 model card","venue":null,"work_id":"60a3cfb3-8531-4b7a-b54f-454a91490a88","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.930191Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:9c3b8c8b2aebbbbd6a3a4bab39939a830a5bd51d29d5ed444ec46c6ef4d6cd02","observation_id":"6c738d28-fb2d-4b1d-b2a5-44516d3b4401","resolution":{"observed_at":"2026-08-16T00:10:32.061828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.041591Z","title":"Kimi K2.6 model card","venue":null,"work_id":"7902f3be-d44a-410f-bec1-bcc10a4d0deb","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.934393Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:b138ad88dd23a67aa71fa835e617759b7d1d969c33e5a4a43854af0bdaaff32c","observation_id":"f5098b60-f70e-42da-ad53-0e5297b5902f","resolution":{"observed_at":"2026-08-16T00:10:32.046099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-18T03:02:34.206139Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.20856","snapshot_observed_at":"2026-08-16T00:10:30.938490Z","title":"NVIDIA Nemotron 3: Efficient and open intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.938490Z"},"links":{"cited_paper":"/paper/2512.20856","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:743772f4a6583e8ea986d047dc7b65943234c0612357235be4cce6aae3bef5f8","observation_id":"c74fd16b-adaf-426c-bd8a-791b7a00c02a","resolution":{"observed_at":"2026-08-16T00:10:30.938490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-16T00:10:30.942860Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.942860Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:ba2ef69e472056d2dd222ac9940307c5b1eefa06e2dcc0a6048f73fea939720a","observation_id":"652f0cc2-6db9-434e-ae6f-6a3ff8a1d8e8","resolution":{"observed_at":"2026-08-16T00:10:30.942860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.027005Z","title":"Introducing gpt-5.4","venue":null,"work_id":"d16c171f-2453-43ec-b483-d548810c1a0b","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.947282Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:3e19e1668bc3ca74483fadbf5cc0a6b2f19c0defe042dc0f3b8439c5d74c79cf","observation_id":"1c554cdf-237e-4df1-9077-32cdc09277ed","resolution":{"observed_at":"2026-08-16T00:10:32.032103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:32.011692Z","title":"gpt-5.4 model","venue":null,"work_id":"7bca868e-857e-4390-9f53-cdd737b32265","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.951744Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:7f51c04f647f7497a0819b608509cff690e366775519ed25dc153ac166aacd64","observation_id":"c56f2cf5-2033-48c3-8e7b-4a34d83f6e04","resolution":{"observed_at":"2026-08-16T00:10:32.017031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.997438Z","title":"Hard2Verify: A step-level verification benchmark for open-ended frontier math","venue":null,"work_id":"2bbc1c87-20e6-4eba-844a-48de47964232","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.956022Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:f7d5f867a28e8b0a5adfceab323f9c7a7fa18410bd056fffca9080b42d3ada81","observation_id":"45587909-2574-45cd-b9f3-600680787b51","resolution":{"observed_at":"2026-08-16T00:10:32.001905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:30.961108Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model, April 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.961108Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:35d601933e906797deb4d8f729df1ffc2f26bd18ad00e3c772da41dbee03d0f2","observation_id":"abb66afa-3208-48ab-85c5-018c01dfbd2f","resolution":{"observed_at":"2026-08-16T00:10:30.961108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:30.965881Z","title":"PRISM: Pushing the frontier of deep think via process reward model-guided inference.arXiv preprint arXiv:2603.02479, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.965881Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:6fdf8671a9e23c199c38725bb1f9adbdaf5196b04707c9fcdbcaa903d8e28ddc","observation_id":"b02523f1-3375-4498-8fe1-e96d5ccf6d4b","resolution":{"observed_at":"2026-08-16T00:10:30.965881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-16T00:10:30.971538Z","title":"Replacing judges with juries: Evaluating LLM generations with a panel of diverse models.arXiv preprint arXiv:2404.18796, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.971538Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:18b15322e0b0ca40d73326ac0d773a4da7e52a09cb8792bc0cb1f8a7d1a94125","observation_id":"8846d2bd-3617-4b6e-8b5c-954153477856","resolution":{"observed_at":"2026-08-16T00:10:30.971538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.974580Z","title":"GLM-5.2-FP8modelcard","venue":null,"work_id":"04c156a2-7a85-4c25-a82b-acccb68034be","year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.975946Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:eadfab070692526964ee345cf31a51696796e3acb29bb43671e0ec128729d030","observation_id":"58dcdbb4-0c40-44ca-85a1-1dedf7b3057b","resolution":{"observed_at":"2026-08-16T00:10:31.979041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:30.980189Z","title":"Scaf-grpo: Scaffolded group relative policy optimization for enhancing llm reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.980189Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:01a0d94d3b90dc078f0d0c534d759af1b0ae7d877762c4abfd2f96aa09f1d451","observation_id":"ed9d793f-42e4-49e3-ae45-4ed544b5e97c","resolution":{"observed_at":"2026-08-16T00:10:30.980189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-16T00:10:30.984349Z","title":"ProcessBench: Identifying process errors in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.984349Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:99ccd65c24b89a166bccb024aa3aef6d22f0ff83cbe08e44315ccd35d4d91b67","observation_id":"1f52b0c4-b61d-44cd-b11d-8b6f1e243439","resolution":{"observed_at":"2026-08-16T00:10:30.984349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.961082Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"7ea41661-a898-4740-ab62-d94d3ac13526","year":2023},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.988727Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:0a31a66cf98fa76bbce95fd7f10abc8e36224df69da52b658853759eb6e9e36c","observation_id":"9394466a-8ec3-4354-901f-c5ea6c9bc3bb","resolution":{"observed_at":"2026-08-16T00:10:31.965569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:30.993024Z","title":"statement_refs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.993024Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:30528916fd9234bea0f5573a7909144c185bd2464b3b1c995f8915488b432f20","observation_id":"a971ac6c-432b-472b-bd3b-4cf6c2779531","resolution":{"observed_at":"2026-08-16T00:10:30.993024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.947385Z","title":null,"venue":null,"work_id":"9cec4b04-bf3d-43ea-9592-47b31b1df588","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:30.997123Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:e75c3c7f00e6bef65a7e10154d74b70d43159fadac9e0ea5bfc6e3332b8a11d1","observation_id":"b0df11bf-611a-4a02-a9e6-94b7f7d283ec","resolution":{"observed_at":"2026-08-16T00:10:31.951962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.931953Z","title":"The trace is divided into segments, each prefixed with [STEP-x] where x is an integer indicating the ordinal position of each segment in the trace","venue":null,"work_id":"8324e429-394c-4b3c-99bd-6e5343a74ae4","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.001397Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:c40107ab5831e5b01e8833a176ac53a6717d2f6040f9739a85e1fde5d2b88d05","observation_id":"2f69b421-adae-41b0-911c-8847c0d5b4c1","resolution":{"observed_at":"2026-08-16T00:10:31.937454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.917649Z","title":"## Primary objective 20 Judge the *weaknesses* of the provided reasoning trace by pointing to **specific bad reasoning moves**","venue":null,"work_id":"b4cfa4be-3240-45d6-b1d3-c2fb76109a95","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.005951Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:de9c5f267c8bd12eeafc6b0fc4a54f95722b7ef62e42ce885f1019fb822108c4","observation_id":"80654fb4-1e54-4d9e-aefa-180d3ce11061","resolution":{"observed_at":"2026-08-16T00:10:31.922093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.904184Z","title":"In [STEP-14], the trace states","venue":null,"work_id":"9f9a84d9-3536-45f8-936a-7cb27c20bde0","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.010544Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:e13ad3163232084dab7c6f3533b14a03b8c850a9e350eeb9682e4ab8fecba90b","observation_id":"efa9f52b-58b2-4615-8f97-81dfbab87af5","resolution":{"observed_at":"2026-08-16T00:10:31.908517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.889983Z","title":null,"venue":null,"work_id":"0d30955f-cd1d-4130-8eea-9b8b0966805e","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.014658Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:119a5c6d1df385b1b443294c0e4ccb82b49be584a6b751c70be3a51a36bccf3c","observation_id":"10587715-23da-49ee-9bd5-391da0d2b361","resolution":{"observed_at":"2026-08-16T00:10:31.894262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.876286Z","title":"Could this comment apply to a totally different problem with no edits?","venue":null,"work_id":"41bf7e99-8e3e-4eca-a0f9-1b1bce5d3884","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.019716Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:14edae456118c83dfe5e5c928ddec45c270579aa4c970053b8244153e0e343bb","observation_id":"f0004429-d15e-4fee-b61c-9d99b35cc430","resolution":{"observed_at":"2026-08-16T00:10:31.880632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.862406Z","title":"Adopt it only if the trace itself supports the claim","venue":null,"work_id":"515029c0-58a0-438b-9604-8a6f90f6144e","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.024221Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:5e535618d514f93cc54411ed7b2d33bba6b795a09fb54489c816aa6f8a1035a7","observation_id":"ece76177-47c8-4cfd-862a-7c0bb2726d7e","resolution":{"observed_at":"2026-08-16T00:10:31.867247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.847534Z","title":"Supplement, don’t average: fold in supporting evidence from the other auditors, but never replace a specific claim with a vaguer paraphrase","venue":null,"work_id":"ddebdc8a-d827-4033-bb64-2da9f7284edf","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.028309Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:54028ced39e9186b76f19fe94aa3dd717dc390686c95c229c304fca8a6bd1761","observation_id":"a16b8b3f-a662-4fc7-853d-55e52820cac0","resolution":{"observed_at":"2026-08-16T00:10:31.852478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.834086Z","title":"Include genuine defects that NO auditor raised","venue":null,"work_id":"3fb57863-858f-4bea-a524-4bb3526a5951","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.032482Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:f33151efa1c8357ef02af15f3e5dccc821626cb6ff5dc4b88ab1bbe0130b73ec","observation_id":"db132aaf-4ef7-4c85-925e-40affeafe5a8","resolution":{"observed_at":"2026-08-16T00:10:31.838266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.820758Z","title":null,"venue":null,"work_id":"f9050a26-2def-4ccf-8802-b49988b1ac76","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.037610Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:804025c6710a53d0fbac8c616673fbb98ebf7f7e72964908e2c4059256838253","observation_id":"3df25981-5aaa-4751-b576-3a4f028053aa","resolution":{"observed_at":"2026-08-16T00:10:31.824963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.806970Z","title":"Output format","venue":null,"work_id":"0014cd26-694a-490a-a1d8-ba766e6f8347","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.042042Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:4431b1f469f204745db33cd3f2346be5327dc1d56aaed6bef257dd2fa28d8317","observation_id":"5b170482-5faa-4775-bc88-9cad5c57ccc2","resolution":{"observed_at":"2026-08-16T00:10:31.811759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.791952Z","title":"- **Do NOT abstract away specifics.** When multiple judges describe the same issue at different levels of detail, use the MOST SPECIFIC description as the base","venue":null,"work_id":"8377a4e5-8556-4840-9885-8a992d5d8725","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.046268Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:3945fdadc22c8f75a78e94534cb62026a5e500a2e63cbf434e2bc5a1ffd23b77","observation_id":"337f6346-afd6-439b-b515-d92f0224747c","resolution":{"observed_at":"2026-08-16T00:10:31.797545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.777909Z","title":"Use that as the canonical wording","venue":null,"work_id":"665b2a5c-22cb-4d10-a28d-c32b15fb2794","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.050736Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:55c62b569e85bdc30b6a48329d40c3227bb5064b94082571fa1cc59f3609c1f7","observation_id":"2fd8e08a-991f-4841-ab96-43a427df2997","resolution":{"observed_at":"2026-08-16T00:10:31.782210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.763795Z","title":null,"venue":null,"work_id":"bc3e6bcc-ab3f-43d7-9024-082deb67b481","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.055480Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:bfac31b74a42fb7c6377e94dc76d4a72f802d679da8e200b47b819cc61b9a464","observation_id":"85b107e2-6636-445a-8184-abcbdfbef682","resolution":{"observed_at":"2026-08-16T00:10:31.768133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.750256Z","title":null,"venue":null,"work_id":"636f16d3-919f-4f5c-ba83-37b20e9afb5e","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.059503Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:d0bf07e5b7682ba34564a5946d5d5a49a16fbbe76feb1c95ae4bb08994cb995f","observation_id":"5839ec36-68d2-434e-96ce-f06906d53a6f","resolution":{"observed_at":"2026-08-16T00:10:31.754766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.735025Z","title":"Could this description apply to a totally different problem with no edits?","venue":null,"work_id":"3fde1125-9a36-4196-916e-4d79a3b7321d","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.063645Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:9054bce70e15b756fdcb010a5df270b49a9225bc58a9b579a5f0cbe415662a4e","observation_id":"2fc9325b-0855-46ca-9872-418300376d7c","resolution":{"observed_at":"2026-08-16T00:10:31.740655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.720445Z","title":"- Prioritise panelists involved in unresolved disagreements","venue":null,"work_id":"8427083a-2a06-4a0d-bcb7-1812edc95537","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.068235Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:fe2213673965bbd3b44c91274b35f2571a5acce8a753ee6d47352655c3e0587c","observation_id":"f3ac5ff6-e02a-4227-84b4-8998b9a25e5b","resolution":{"observed_at":"2026-08-16T00:10:31.725592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.704721Z","title":"- Ask them to clarify, defend, or concede specific points raised by others","venue":null,"work_id":"e3d3e7df-381f-42a4-999d-fa21a1d1c773","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.073066Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:85469175a91066ec862157bbe14526ac923d574c2dba57395c6914c372afcf5f","observation_id":"320f0778-34bf-490d-ae79-59d40cf701ae","resolution":{"observed_at":"2026-08-16T00:10:31.710823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.689776Z","title":"should_terminate","venue":null,"work_id":"37c24517-dee0-4037-883a-af2fd80badfd","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.077316Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:e826860c5363d599aa61b48e566ceee3a3d5242f5fe0ef8f8ffaea35024b998a","observation_id":"bba92a13-aa3a-4b88-9dc8-e5560c6efb42","resolution":{"observed_at":"2026-08-16T00:10:31.695060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.675819Z","title":"consensus_state","venue":null,"work_id":"4c6ecb0f-9264-4c05-b093-954f4d3ebb97","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.081932Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:e37b6ec8fd1e7053b283b2bce3caa360a8346539518db3efe434e361718dde58","observation_id":"a0395b97-0c0a-4144-8d1a-ce242be9406b","resolution":{"observed_at":"2026-08-16T00:10:31.680081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.661199Z","title":null,"venue":null,"work_id":"77805275-0d1b-4686-b1a9-57c429a527dd","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.086343Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:782a3cdadd16bbf619679fb11bff37e0559a4dd787dcf65606988a886b11eb3b","observation_id":"5f1c410a-8d86-43cc-b243-68e660292f29","resolution":{"observed_at":"2026-08-16T00:10:31.666002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.646891Z","title":"Additional rules","venue":null,"work_id":"cb649f6a-92e0-4a33-bb63-24cfb8276ee9","year":2025},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.090654Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:a6a14a72e379f0d339ebe74a59ff7a36e427a8a30d68da87c9fab2c4713aae19","observation_id":"a581ee97-b37d-4741-9b93-859143dbcbd6","resolution":{"observed_at":"2026-08-16T00:10:31.651348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.631450Z","title":"The per-problem analysis addresses dependence among traces from the same problem, but broader generalization remains untested","venue":null,"work_id":"639bfdba-6fc7-43b7-95c7-bf421dc3aef8","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.097102Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:12a1535936b1379ca9245360593c93c3523789e26258f2b4c0b8971607c15557","observation_id":"1fe3810e-4cc8-43f0-a3c4-b3960c8c83bf","resolution":{"observed_at":"2026-08-16T00:10:31.636380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.616734Z","title":"Some improvement over the original answers may therefore come from making a second attempt rather than from the feedback itself","venue":null,"work_id":"0f1e308b-cb55-464b-8add-1b0d0bd28080","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.101215Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:8a7e993b18684620744bfcf2c0429c1611146e94828987c3ebaf53cfc4da845b","observation_id":"fdeeea0b-efc2-45aa-bdb8-3b90e1f13d4d","resolution":{"observed_at":"2026-08-16T00:10:31.621376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.601571Z","title":"The experiment consequently measures the complete rich-feedback package; it does not isolate the effect of either field or distinguish explanation from a supplied fix","venue":null,"work_id":"e1f8ebfc-f62e-4439-9fb4-35d2869cd38f","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.105377Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:39136e890a68cde154c5a2204335cf41b06cc0f4d0c295d4796886ee1b47d61c","observation_id":"befefdbc-7159-4b2c-93fc-5c439c999781","resolution":{"observed_at":"2026-08-16T00:10:31.606485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.586519Z","title":"Failures caused by omissions may also escape detection","venue":null,"work_id":"3e18a11d-83d9-42b5-abe1-7289e5a95245","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.109511Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:b5cfe2c19834181fb90a3710b1913dcd8c087f3b8a16f0fd8c6803a5f7fa5ea6","observation_id":"2a3720f9-c740-45ae-a478-c519493437a1","resolution":{"observed_at":"2026-08-16T00:10:31.591533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:31.571792Z","title":"The external AIME answer key validates the correctness of retry outcomes, not the factual accuracy or severity of individual defect descriptions","venue":null,"work_id":"a05a8e52-3400-4d8c-a822-257d0c8e64b0","year":null},"citing_paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:31.113654Z"},"links":{"citing_paper":"/paper/2608.12585"},"observation_digest":"sha256:caa545671b02beecfe5cce7c5c7e45fda574d2ac4bda25be1579270822857aec","observation_id":"3cd5c726-b836-42e8-a4ef-2e0cf111611e","resolution":{"observed_at":"2026-08-16T00:10:31.576459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12585","last_updated":"2026-08-12T21:00:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T21:54:37.249029Z","submitted_at":"2026-08-12T21:00:22Z","title":"Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2608.12585."}