{"as_of":"2026-08-15T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86e8f68ce6665cdee270ab576a95e19cc65e1c1b96a3b4809cdb9ea9642f9830","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:31:40.971330Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09324/citation-record","integrity":"/paper/2608.09324/integrity","json":"/paper/2608.09324/citation-record.json","paper":"/paper/2608.09324"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T19:31:40.801100Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.801100Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:1e66406f6e71240d4a67c6b752c3fa4b5a5e6fadd373f09ff1b8b8985e98245e","observation_id":"f30a8904-d07d-4dbf-95f9-3d25598e0620","resolution":{"observed_at":"2026-08-11T19:31:40.801100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T19:31:40.819331Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.819331Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:950bb2c116cdc89b754f98afdbc170f997c10c9465d0319ca29286bc3905e657","observation_id":"2154c012-1a09-493b-9037-3a2dcf974eea","resolution":{"observed_at":"2026-08-11T19:31:40.819331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-11T19:31:40.828258Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.828258Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:114713b820a74aa456e27932f8647466144fad1c85dcc154f00ac1d358590651","observation_id":"b4c865d0-7b3f-4aab-9ca8-d369bf9b13a4","resolution":{"observed_at":"2026-08-11T19:31:40.828258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T19:31:40.832494Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.832494Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:cb0636a008fd29cc16ad0e2781005d13437a9cfb79d3328e4813f0d50d65cd91","observation_id":"3eb025ee-b9be-4d07-b61a-2a2976290f80","resolution":{"observed_at":"2026-08-11T19:31:40.832494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-11T19:31:40.837316Z","title":"Language models (mostly) know what they know.arXiv preprint arXiv:2207.05221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.837316Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:3041e1d7539f1313a1a430ff9045d9d81cc49a95204303d10c4365f2f4d6e905","observation_id":"67e570e3-ef33-40e8-8ab1-57cd9d5de482","resolution":{"observed_at":"2026-08-11T19:31:40.837316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:31:41.887959Z","title":"Let’s verify step by step","venue":null,"work_id":"b50aa5c5-90b0-4de8-b2f2-30ebc57e1354","year":2024},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.852283Z"},"links":{"citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:7c498707b49adf9460bf4e28d637dea98af35acf176cdfabc924027a11e9f035","observation_id":"3763d5af-c35b-40e8-8efa-1acead1f0eaa","resolution":{"observed_at":"2026-08-11T19:31:41.893764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14334","last_updated":"2022-06-13T05:04:53Z","snapshot_observed_at":"2026-08-09T23:45:38.167954Z","submitted_at":"2022-05-28T05:02:31Z","title":"Teaching Models to Express Their Uncertainty in Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14334","snapshot_observed_at":"2026-08-11T19:31:40.858193Z","title":"Teaching models to express their uncertainty in words","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.858193Z"},"links":{"cited_paper":"/paper/2205.14334","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:5d1f62bdab6f9564d5435fe059e1ddd9309f03bd38562b74c961552395cfa1e7","observation_id":"0ca7ff60-b193-43ea-80f3-3c4a1b3e7ec9","resolution":{"observed_at":"2026-08-11T19:31:40.858193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-11T19:31:40.864651Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.864651Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:5b9d60ecc4717c8bb552dec432b4b41e206eca44a0bc29e99b06519b84deb8ca","observation_id":"ecf3ec00-7a5e-45db-8cae-bce95f165443","resolution":{"observed_at":"2026-08-11T19:31:40.864651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-13T04:40:05.019883Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-11T19:31:40.875842Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models.arXiv preprint arXiv:2201.03544,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.875842Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:cd1455f7c88b90dcc45c873e3b53bd8e3aae889433096bcaab0ee21e21c09cf9","observation_id":"9918b9b5-9c6c-477e-8735-df3179ae6635","resolution":{"observed_at":"2026-08-11T19:31:40.875842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T19:31:40.885338Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.885338Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:e5bb07ff73ca89bb375ae2f523da34ea0fa5c459dfaa8272becd2a6d440672d8","observation_id":"c8f32949-0c2d-416b-b2ca-d565972e4262","resolution":{"observed_at":"2026-08-11T19:31:40.885338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-11T19:31:40.900230Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.900230Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:8d357fc101522933e639c6d9c7e2d83897923ddf0a262890eb937935e29597d1","observation_id":"972f5e9b-f015-43b8-ad1d-a35d8b32f25f","resolution":{"observed_at":"2026-08-11T19:31:40.900230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T19:31:40.904736Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.904736Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:909d6dd6babb3f0f88d3cf2777103858da9cd0eb0e72581d776769f02bb15efa","observation_id":"4a0a4733-879f-44ea-9178-5e4fdd7908e8","resolution":{"observed_at":"2026-08-11T19:31:40.904736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-11T19:31:40.909954Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.909954Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:fd33375e5c1d49d5ab541727a4078b32363872b11df981d683365419ce57d8dd","observation_id":"106e879b-f55d-4cd7-96c1-d27ab1b02433","resolution":{"observed_at":"2026-08-11T19:31:40.909954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-11T19:31:40.922992Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.922992Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:7bc38480c47b047f7d7b3ee69d1c1ba399c9bf132270225c62d032766f92e812","observation_id":"ed71015f-8220-4ee6-bd25-0d48f95b0b1d","resolution":{"observed_at":"2026-08-11T19:31:40.922992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-08-14T09:05:55.324880Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-11T19:31:40.928529Z","title":"Tent: Fully test-time adaptation by entropy minimization.arXiv preprint arXiv:2006.10726,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.928529Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:f3f358fe3ec29f02e588fc141db1915a380737d8b4f00170aedf77515f440288","observation_id":"6f47bff3-84ae-434f-b9e6-1be1c7a93777","resolution":{"observed_at":"2026-08-11T19:31:40.928529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04252","last_updated":"2020-06-19T17:36:57Z","snapshot_observed_at":"2026-08-15T20:19:29.272018Z","submitted_at":"2019-11-11T18:59:27Z","title":"Self-training with Noisy Student improves ImageNet classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.04252","snapshot_observed_at":"2026-08-11T19:31:40.939920Z","title":"Self-trainingwithnoisystudentimproves imagenet classification.arXiv preprint arXiv:1911.04252,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.939920Z"},"links":{"cited_paper":"/paper/1911.04252","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:726f6c4f2ae15ed715b468bf406c8241a2bbe3a3f618c44e9f8d7e6eb1aa8281","observation_id":"da00f497-998e-4b43-ac65-8843f7d92cf8","resolution":{"observed_at":"2026-08-11T19:31:40.939920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-11T19:31:40.945421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.945421Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:fb09e8bae8b428b676fa180091e306a81d4c6b769420a31fbf6d7766fd8d218d","observation_id":"db26dd7a-caae-4063-b2eb-074cbbf4155f","resolution":{"observed_at":"2026-08-11T19:31:40.945421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T19:31:40.949492Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.949492Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:b3bdd9f37595ecbe444495f8e8d59178a2a707303312e443311fef93792aad35","observation_id":"c3a74c6b-e452-4117-890a-58820d90bbdf","resolution":{"observed_at":"2026-08-11T19:31:40.949492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-11T19:31:40.953612Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 3:2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.953612Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:c059944c1dcbf4feddce4aec1f062dc3495b62edb276d13b02dcb49fa67bb632","observation_id":"cb06f9fc-655a-4d51-8dd5-4a8d5a17b7ac","resolution":{"observed_at":"2026-08-11T19:31:40.953612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-11T19:31:40.961404Z","title":"Learning to reason without external rewards.arXiv preprint arXiv:2505.19590,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.961404Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:bb1e92ec7efbd1d0ea64f326b0060865d2f4cbd279c95bc10ba11241d1b25309","observation_id":"9294ac53-e399-4e84-abc6-f6ad3434aec7","resolution":{"observed_at":"2026-08-11T19:31:40.961404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:31:41.862906Z","title":"B Use of Large Language Models Large language models were used only to improve grammar and clarity in author-written text","venue":null,"work_id":"0917cd39-ab0f-4a5a-b716-1fd9a6272aab","year":2007},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.965726Z"},"links":{"citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:4f881bb568eaedde7b0db46666263dd0aa70e754a8bcc980bc81d145c5cc67e6","observation_id":"5ababe61-88b4-4790-87a4-14418dfe98ec","resolution":{"observed_at":"2026-08-11T19:31:41.871053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:31:41.840741Z","title":"role\": \"user","venue":null,"work_id":"46fb5eb3-1711-4fd3-bc37-e113d5c41df0","year":2024},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.971330Z"},"links":{"citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:951a13d2603e89ef5e2f133815a0a31fdc6ad4c329ff04e800a4e9281a9b02c9","observation_id":"3b0560b6-dc2c-4861-89c7-b1767232d739","resolution":{"observed_at":"2026-08-11T19:31:41.848806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-11T19:31:40.870949Z","title":"Training language models to follow instructions with human feedback.arXiv preprint arXiv:2203.02155,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":1965,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.870949Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:0aae62500b59f06c4fd438cda7a3e6d544b32d6238d96f7d84eca8cfe03b9d84","observation_id":"b1e51fd3-abc4-48c4-bc3e-34771d4744c9","resolution":{"observed_at":"2026-08-11T19:31:40.870949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-11T19:31:40.915743Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.915743Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:224e418578ba4c6bf49ee9243a177e906c5af430c20d0c59dde987745d3dd839","observation_id":"439abf01-d528-4a3e-b250-662f26ec332d","resolution":{"observed_at":"2026-08-11T19:31:40.915743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T19:31:40.890115Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.890115Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:429f84b2bd35d69a52c1ad4c408d0212f4c7faabaab6b354501bb9209976434a","observation_id":"b567eace-03b0-4e05-a22e-705ae91c44b9","resolution":{"observed_at":"2026-08-11T19:31:40.890115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-11T19:31:40.794957Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.794957Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:b857d03d38e8ce6089586068a7c66db9658fd714adcb4d8ee060b04fcc6fbf56","observation_id":"d5224e1c-488d-4bd6-a3a4-87d6c2f7adf2","resolution":{"observed_at":"2026-08-11T19:31:40.794957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-13T20:01:21.267324Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-11T19:31:40.880140Z","title":"Maximizing confidence alone improves reasoning.arXiv preprint arXiv:2505.22660,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.880140Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:911087de6a707bfda7c91d8b97bfd44655df4195553c8ce16ae67932f80ea833","observation_id":"8155807b-da34-401a-897e-8159a418b84f","resolution":{"observed_at":"2026-08-11T19:31:40.880140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:31:40.895438Z","title":"Can large reasoning models self-train?arXiv preprint arXiv:2505.21444,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.895438Z"},"links":{"citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:39bea2fce7d8398aef3087d31fea49bd834101306097e81bd976122978fc6410","observation_id":"2b76d1b3-2956-4e92-b2d1-d42c60fc789a","resolution":{"observed_at":"2026-08-11T19:31:40.895438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-11T19:31:40.934963Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.934963Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:5b7dbb100430b5747ba9f0203610a8cd47db325f2c218a935a1fd2bb96b4c9e2","observation_id":"a8dc9f2c-f800-4540-8084-e3f16997dd95","resolution":{"observed_at":"2026-08-11T19:31:40.934963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-11T19:31:40.806378Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.806378Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:2c62930cbe1a977c0e6ca3eae7f85c94395e9fa4d0ed370a51c9b3040bec40b1","observation_id":"ceb19587-0ff7-4c21-a5df-33c004284db0","resolution":{"observed_at":"2026-08-11T19:31:40.806378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-14T20:27:37.802651Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-11T19:31:40.843022Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.843022Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:82cd6a75c2f223d7d2d54d2ed6bb60bf0204f19c5d39db001db547df30228877","observation_id":"21b7eeaa-3378-4cf0-9f30-494b318e321e","resolution":{"observed_at":"2026-08-11T19:31:40.843022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T19:31:40.814245Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.814245Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:e6e344183b5a5a5aaf2b013a072d294ffa3a577a84447e561374277ef82d6d80","observation_id":"2c133695-b7c3-40d1-b1fc-7bb7dea348f8","resolution":{"observed_at":"2026-08-11T19:31:40.814245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-11T19:31:40.788731Z","title":"Concrete problems in ai safety.arXiv preprint arXiv:1606.06565,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.788731Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:4b86b34a92aa13973157ae65bfb2527a5568e8e2c81d72ce65dac7a525df96b0","observation_id":"f64ae17d-0407-4c4c-917c-e2cc6e5b07d0","resolution":{"observed_at":"2026-08-11T19:31:40.788731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T19:31:40.824204Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.824204Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:eb97ef4e14996bb0d91bee7ab02deebd650884e623f52a99cb8f073494adfc69","observation_id":"2169df09-6c62-4dc3-81d5-3b3baee10156","resolution":{"observed_at":"2026-08-11T19:31:40.824204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:31:40.957387Z","title":"Co-rewarding: Stable self-supervised rl for eliciting reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.957387Z"},"links":{"citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:e412402a5e5f35a4d26317252fa9a26684b42b0aefc989ffdd99b114586c01cf","observation_id":"b466cfc6-3bbf-4847-b6d6-ea2c260e53cd","resolution":{"observed_at":"2026-08-11T19:31:40.957387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T21:35:02.996233Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.09324."}