{"as_of":"2026-08-09T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3546e8bd04f7228c3690b6be1d6b40205fc12959a6927e04fc85d9630295707c","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:52:37.405393Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03545/citation-record","integrity":"/paper/2608.03545/integrity","json":"/paper/2608.03545/citation-record.json","paper":"/paper/2608.03545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.359295Z","title":null,"venue":null,"work_id":"889c5df3-1ed5-475b-bf26-5a97827b6725","year":1986},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.125672Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:3c9ba30833d7c49889b5db8c89d1f504e03cd821f1b77675dba5a3472c89cc7d","observation_id":"9ed278b8-71eb-4459-9c40-e8e4f961a4ae","resolution":{"observed_at":"2026-08-08T00:52:38.363913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.345329Z","title":", year = 1983, title =","venue":null,"work_id":"2d8c242b-ea94-4cf3-8637-72f6dbd5683e","year":1983},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.131388Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:b1b8af575b6809522b8126690e5d004a3f298e307d75e855b09047a978bccc51","observation_id":"35873716-33c1-4ee7-a5d7-687ed403528d","resolution":{"observed_at":"2026-08-08T00:52:38.349715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.331270Z","title":", year = 1984, title =","venue":null,"work_id":"8084104c-8514-4ded-9ff1-960dec2ec021","year":1984},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.138291Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:483d077952a9da8c73fbd7769f3964c0ed09511b2fa2f0f260ebd55e557df43a","observation_id":"185ea821-dcd0-4fa2-a70b-1c8587f17197","resolution":{"observed_at":"2026-08-08T00:52:38.335520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.143686Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.143686Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:2ae1f0333c5cf9b4637da7d1f2ed86765b41f9e5a8792eb78f91ed4167a06c4e","observation_id":"b3d29bff-8b19-4eab-85af-8753c59bde22","resolution":{"observed_at":"2026-08-08T00:52:37.143686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.306677Z","title":", year = 1980, title =","venue":null,"work_id":"2aeb8b3a-d49d-4a4c-b01d-f92fd2aefea6","year":1980},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.149323Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:6d0cda8fca82440a5f4b783b16f80f8b621f731052e36b5cc5d3033d0cdd9135","observation_id":"3608bf1c-1911-4653-84ac-93be67822f81","resolution":{"observed_at":"2026-08-08T00:52:38.311285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.154451Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.154451Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:67e2a8fa8d18bb721cef6446ecafd8b410ff0dc42d196c6cd2841f7a9393635c","observation_id":"7fe45bb2-cba3-4838-b941-ae90ab071f1d","resolution":{"observed_at":"2026-08-08T00:52:37.154451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.292436Z","title":"and Rennels, Glenn R","venue":null,"work_id":"f9489b86-9b76-4d29-a182-0a48914760de","year":1983},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.160028Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:392468909a68b813472f02176238d311455b46923845dad1c03d932869f3acb1","observation_id":"0ac35a06-d4bf-4e1d-9431-1f99db176d23","resolution":{"observed_at":"2026-08-08T00:52:38.296976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.277977Z","title":null,"venue":null,"work_id":"ede16c16-9e4a-4a59-bef4-dbf07117b79d","year":1986},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.164832Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:276c65d68e10ecb880140465bd9394a8e7bb438a34f5d9abc7d214c8b62850c5","observation_id":"cfc2ccef-ffbd-4879-bdb2-229b356bac7a","resolution":{"observed_at":"2026-08-08T00:52:38.282460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.263627Z","title":", year = 1979, title =","venue":null,"work_id":"4f5e99a1-5a58-43f6-9071-0f5944b2538b","year":1979},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.169591Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d0ddedad29c3919b0b0e9d90396535b62eefda5f6004b2009f8e70e1b8a1c25f","observation_id":"6f41fcd9-91d7-4a90-85ab-5a1651d6b9e8","resolution":{"observed_at":"2026-08-08T00:52:38.268248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.248926Z","title":", title =","venue":null,"work_id":"74dcb357-c618-4713-852a-578e7634beaa","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.174492Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:86518f7af11c1b22697d442df180cc2bb6544d5292417ca73bf5dbfc168d5040","observation_id":"8423e12b-d49c-4ca6-8743-803e28c5f2ff","resolution":{"observed_at":"2026-08-08T00:52:38.253850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.179241Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.179241Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d1fa9a262172cd234f4ade680d605cbeb06c53520a389e6081fd4355e281e839","observation_id":"fef0cc84-d6bb-489c-bc68-e029c50a9b71","resolution":{"observed_at":"2026-08-08T00:52:37.179241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.183822Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.183822Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:f14f70e12094ab55deb6f7f0733c544c2a669c970187dc0f6db667237a5f5152","observation_id":"f57f9d02-2e29-4399-a2a4-e07407b6d9df","resolution":{"observed_at":"2026-08-08T00:52:37.183822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.188675Z","title":"The Eleventh International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.188675Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:e8cf2fe528bd26bcea7eb4a873d914fe37e5bb22a73a2385f589795483fe8d96","observation_id":"7230285f-38ad-475e-9636-945b7b7b6387","resolution":{"observed_at":"2026-08-08T00:52:37.188675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.193820Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.193820Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:20f3774e9493ecba8e0cd93b089fc2adef357cd15a772724c856cad6fd23bb6b","observation_id":"a192e1c2-29e3-421f-ba77-5439c7648c1b","resolution":{"observed_at":"2026-08-08T00:52:37.193820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.198413Z","title":"TTRL: Test-Time Reinforcement Learning , url =","venue":null,"work_id":"f7742f3b-44d2-4cea-9471-907e72f7d0bb","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.199002Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:fc1185e1b5e629ed89d1574b0d4374c409fdf1164cfff7c8d67202c3e1d422f3","observation_id":"28f925f4-298b-49af-bc80-cafc8694a046","resolution":{"observed_at":"2026-08-08T00:52:38.202867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.184261Z","title":"2026 , eprint =","venue":null,"work_id":"08144007-74d6-4dd7-b15f-bca5c0a5d60e","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.204174Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:116fba518020916d95c08f7d1151d739f72ca6d879cefd35761f12af8b7b4269","observation_id":"7a9c20f4-41d6-4a78-8f6c-cc472feeaa1c","resolution":{"observed_at":"2026-08-08T00:52:38.188738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.170031Z","title":"2025 , eprint =","venue":null,"work_id":"3773c481-e0f1-4cb0-9310-dff25ca7c065","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.209028Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:e4dea360abfe17ef06d75e11ed6782d24f7f8925abe1c3f7669a772418fedbea","observation_id":"7f668440-b608-4435-8fa4-1ee9e9964a04","resolution":{"observed_at":"2026-08-08T00:52:38.174641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.155001Z","title":"2026 , eprint =","venue":null,"work_id":"1cd817ca-c42e-43ba-aa76-a4c9f2a8b4cc","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.214354Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:9c67ec96cc939f730edb4f47434a625007d687792633438eced64d05c952a7fc","observation_id":"a27ffac8-fbe4-4c6c-930f-d5d2e403c0b3","resolution":{"observed_at":"2026-08-08T00:52:38.159714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.139904Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) , pages =","venue":null,"work_id":"357758e0-e456-46e6-95ba-ecb5ec03e551","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.218963Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:87d1b93d7b818ac902d5c8cf880ebce16993ede99a4b903164216e469d46c61c","observation_id":"adbaa938-1bcf-47fc-8526-8307834ead2d","resolution":{"observed_at":"2026-08-08T00:52:38.144454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.126276Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"e7920ca5-b891-4a0e-9e49-9e6e8488b708","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.224796Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:4dda415993ffb175a6aa87087fbd240d7c3ddfde4387c4aa4d9d1a35e00b43f3","observation_id":"20e4baa6-33a1-486a-bb8e-f7f86972d041","resolution":{"observed_at":"2026-08-08T00:52:38.130677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.112355Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"732575a4-cb4d-4f6a-a689-d201e18cd18f","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.229542Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:dff1842e5e05eea3f4e9d026052d50c91882c938a58b3d81d7a716a0d6e306c7","observation_id":"79e68d40-b81d-499d-968b-c94afc4010e3","resolution":{"observed_at":"2026-08-08T00:52:38.116799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.098794Z","title":"2026 , eprint =","venue":null,"work_id":"9a542147-6c39-415f-b9e8-8617216fab6e","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.234366Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:5613adecd4c958d09aab4d96fd4774330f5eb703de89854cdc36c07c48a0c20d","observation_id":"aad71683-7505-4632-bdae-ade1e461c9f4","resolution":{"observed_at":"2026-08-08T00:52:38.103194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.085261Z","title":"Forty-third International Conference on Machine Learning , year =","venue":null,"work_id":"50c40dc7-6ba1-4197-b92e-4771204bfb1b","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.239627Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:c17fa2a275040dc5a0600e7439049a9edc757d85935ae5370ce960c34857164a","observation_id":"1718470a-a437-4913-a8fe-0b4324b23d6a","resolution":{"observed_at":"2026-08-08T00:52:38.089662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.244689Z","title":"DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.244689Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:ad739cdec973ae1c8ae231abcc7cff4af1b2d443491935225e0a1b14a2ea0895","observation_id":"3c107409-0448-475b-91d3-245a5a6e1c69","resolution":{"observed_at":"2026-08-08T00:52:37.244689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.249652Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.249652Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d9e79d62f4e8e6aeaa146dd3ceadb9c7abcd5e4ce5eef86f07dc4d61c69e77f9","observation_id":"72850efe-d844-4d56-b9bf-396ea6340ca9","resolution":{"observed_at":"2026-08-08T00:52:37.249652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.254564Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.254564Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:fec93805f66b49ea7d1fd54ba5341c59443a601c79b213c02f8908edbc6640b1","observation_id":"7d739666-e02b-4c69-96ea-050634c320bc","resolution":{"observed_at":"2026-08-08T00:52:37.254564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.053269Z","title":"ACM Computing Surveys , volume =","venue":null,"work_id":"9901de7b-69c3-4dfa-8a81-15197471699d","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.259146Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:6745f2994d5e7d0524990c791af44293bf51da41970092412b7b0e936195f3fd","observation_id":"fb731896-e67e-4e71-bd9b-a1385c1ed121","resolution":{"observed_at":"2026-08-08T00:52:38.058301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.039210Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":"8c108e1b-c52c-49b8-86b1-7feea2bc427b","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.264159Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:f6580c070689a2e28a8633513461fd6472245338b071830dfe89156aa6ee3c50","observation_id":"a2328cc5-d3fb-41e8-bc74-bead1257befe","resolution":{"observed_at":"2026-08-08T00:52:38.043693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.025264Z","title":"2025 , eprint =","venue":null,"work_id":"c0c81bc0-d8d8-4396-82dd-3baea1b01307","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.268766Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:75a257fe3e5997ebec7bce9898e27e48aba4d5cc28fff357e5332ee2ee6ec1c1","observation_id":"b5eb781d-193a-4253-a3b9-c151273900a7","resolution":{"observed_at":"2026-08-08T00:52:38.029749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:38.010861Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"13c527a5-9e71-4ddc-8e35-e04fe14965f8","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.273663Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:48de78e8049fc59ef242df7b1cf95dbce76b90d756e3b55b61b000d2706746cb","observation_id":"11539c81-0316-421a-b678-9166245911af","resolution":{"observed_at":"2026-08-08T00:52:38.015451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.995888Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization , url =","venue":null,"work_id":"14ef96f1-a7c8-41fd-9247-3656159527f5","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.278216Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:5960501e592770c1af87b3e733053edf8fa05365f776e3b886b44416f3cc823f","observation_id":"f788e82d-6b0d-4c88-9236-6177cfd148ea","resolution":{"observed_at":"2026-08-08T00:52:38.000775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.980596Z","title":"2026 , eprint =","venue":null,"work_id":"a426858f-490b-48ab-8fda-353ee988daf7","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.282965Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:9c04bb3910f54e1c6c9470a1159a990f3a9f6541c1b30a17f8703d2769743af4","observation_id":"813a7dde-7224-4df4-b079-24cc74824a68","resolution":{"observed_at":"2026-08-08T00:52:37.985176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.965961Z","title":"2026 , eprint =","venue":null,"work_id":"b397f76a-f921-4e64-a71a-84cd65f86097","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.287476Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:82fc8affa7ae43df2d1484a6d278dc58b647bbfdecf26d416c12798b8d47532d","observation_id":"19522351-5d6b-4f5a-8ea7-4483c3b21224","resolution":{"observed_at":"2026-08-08T00:52:37.970491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.951107Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , number =","venue":null,"work_id":"d6e37fa1-401b-4037-86d1-ae2fa74f7e41","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.292516Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:823f3933d9d8bc5996fd5cf3ce3ca4eb892883bf6c30428e6c86f1490f44b959","observation_id":"d29273ac-bbb1-4f0f-a13b-caf93ea42e2f","resolution":{"observed_at":"2026-08-08T00:52:37.955910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.936133Z","title":"2026 , eprint =","venue":null,"work_id":"f543bb97-da2d-421a-8025-e985e02df9cc","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.297300Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:3dd43e44765eb774711ea4d391899a9f1562c2078b02f3285135800075fa9605","observation_id":"613632e7-a01d-4dda-a218-95bcc6f1caae","resolution":{"observed_at":"2026-08-08T00:52:37.940948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.921937Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"765443ef-e4c6-4547-9c76-fc2baff60a36","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.301938Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:c5d73cd0ca3847beb8a38a04d5eca0674993d60e2ed7c1bb290c55d23919cd83","observation_id":"f8802d1c-dc37-4058-8c6c-ac8382597cb9","resolution":{"observed_at":"2026-08-08T00:52:37.926536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.306383Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.306383Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:697a19312774a063a7d1a924218321edc109f78c4c4fcc0f903a1eef5c33fa53","observation_id":"d9c7f3dc-d4a5-49c1-91cc-cad23708d9e2","resolution":{"observed_at":"2026-08-08T00:52:37.306383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.311151Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.311151Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:de63c5acf64fa0cd9718182e27aa4a2160e08bc37f4d0c5290ffd42078369c01","observation_id":"ae6db8fd-e887-4b58-822f-50e922298525","resolution":{"observed_at":"2026-08-08T00:52:37.311151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.889988Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"65fd2aa7-b3f2-4e97-a9d1-e0b8b36f59c7","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.315756Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:47491f89add26dfe34358d2b4adae510475ed44425dc0f5b4e1f22642e9785dc","observation_id":"6f09fccf-7350-4f5d-b300-9bb198b0639c","resolution":{"observed_at":"2026-08-08T00:52:37.894932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.876620Z","title":"2026 , eprint =","venue":null,"work_id":"ac9718f6-d8ea-4e86-a476-5d685ffe7488","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.320316Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:4a1e2b8fee0049b3d6692ee51903b8a13f248334b10ee5954efa59c8c7c919e1","observation_id":"7b77432a-8fd5-407a-99e6-c7719486bfa8","resolution":{"observed_at":"2026-08-08T00:52:37.881012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.861797Z","title":"2024 , eprint =","venue":null,"work_id":"c111fa3d-e40b-419d-a1c7-12c9aa3b817d","year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.324949Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:fde9aebf3544e1aa5b818b7dfb14297fa8c2d980988cf6a7e174ac12405881a8","observation_id":"685415de-be4c-495f-b9df-191984cf0c50","resolution":{"observed_at":"2026-08-08T00:52:37.866652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.847925Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"bcaa00e8-cbfc-412d-b1ac-a5411dd6a938","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.330636Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d760539bd05101b03e840f24d118924a4c28613188739603816bcf97919f2571","observation_id":"c9123113-4c72-4338-bad5-3c1160a8ae38","resolution":{"observed_at":"2026-08-08T00:52:37.852473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.834259Z","title":"2026 , eprint =","venue":null,"work_id":"b650adb8-239b-479c-9bda-0ea4483c0726","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.335195Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:1f7b1cdec9e4aa2ad4e8f7fc74959ceb37c51ed42bb016e58e96fbb276e59333","observation_id":"c83c0caf-7d57-436f-a0d7-282ad478b756","resolution":{"observed_at":"2026-08-08T00:52:37.838805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.820309Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example , url =","venue":null,"work_id":"b3639774-eccd-46a6-8388-db9b28919c36","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.340347Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:0de899c9f2db7dc734508daef71b388affa288a8ee68175afffa77f31372f86f","observation_id":"206a6009-f473-414a-b89e-7b37689ea0f4","resolution":{"observed_at":"2026-08-08T00:52:37.824996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.806567Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning , url =","venue":null,"work_id":"70a45ab3-eb0e-45a7-85b4-2c5b4634d152","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.345104Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:d071fc00e354c50c7f0b3f98f173c7f622a4addf4c26c78f9ebe825d280d4256","observation_id":"b5cfdda8-f7b2-4197-a10b-5932bf58afdc","resolution":{"observed_at":"2026-08-08T00:52:37.811006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.792056Z","title":"2026 , eprint =","venue":null,"work_id":"4269c99e-b22a-472b-a41e-d5681eaca9a4","year":2026},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.350015Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:8cf1e5842cf08da1d82fd971629b88344f522ee98adc5def39f68a59c209edba","observation_id":"9f72fd16-6654-4ccb-8c74-5f5c6a2c1814","resolution":{"observed_at":"2026-08-08T00:52:37.796660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.777147Z","title":"2025 , eprint =","venue":null,"work_id":"f5a329ea-03c6-4d83-acbb-c123964e0574","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.354797Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:7793889d3e6643787eb587252aaebc120db8ee0092f3b8f6f305934705496ea7","observation_id":"c4f1566f-16b2-421e-82dd-9063565dd468","resolution":{"observed_at":"2026-08-08T00:52:37.781622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.763195Z","title":"2024 , eprint =","venue":null,"work_id":"03f96a30-b6a5-4893-ab7d-74be34f3f391","year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.359492Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:22c3310e940a99915ef59eccfab0228dea308eff7c5706de71ee761b57139751","observation_id":"4c46b567-af8e-4ca3-9634-9754c596e643","resolution":{"observed_at":"2026-08-08T00:52:37.767694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.749485Z","title":"2021 , eprint =","venue":null,"work_id":"2857f1d5-aad8-4f5b-ba0c-b3425c7968be","year":2021},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.363908Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:7513b3740aaa6db8b538052eb4bb87c65f3a532e3cc1fdfca9ad75c7ea9132ec","observation_id":"1579bc71-7677-4a15-aa62-b16ae9304b4d","resolution":{"observed_at":"2026-08-08T00:52:37.753867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.735150Z","title":"Advances in neural information processing systems , volume =","venue":null,"work_id":"6138e916-5da0-4f1c-b24f-4987d7e3043e","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.368739Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:24b52e89baa0f1f0f4ae4fe714fe21d12c43f09481cc1ccba81b26cc06c8b86d","observation_id":"19720dca-b1e2-48e0-9c2a-1b824bad68a0","resolution":{"observed_at":"2026-08-08T00:52:37.739927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.721041Z","title":"Hugging Face repository , volume =","venue":null,"work_id":"779432a8-d41e-462b-919b-8820d7235de7","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.373259Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:0338e56e8f71956fb62e6db04f8cad711e1118e3fa8bc08849d329accaee6dab","observation_id":"7e02f688-fc05-453e-81b9-93c2e71db1c8","resolution":{"observed_at":"2026-08-08T00:52:37.725796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.377789Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.377789Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:9cfd15eb9212e8ad8e8addd6b2cf6996a8817fc63b46124bdfee010afe2c024e","observation_id":"4988a4e9-2759-4038-844c-33085495760b","resolution":{"observed_at":"2026-08-08T00:52:37.377789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.696411Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages =","venue":null,"work_id":"75d5209a-38fc-4755-880f-1ab5f58b1a38","year":2024},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.382398Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:20ab2b0782ad43383f82776fcc5b531a8bc86fe81c926496e790b78a3fe8d921","observation_id":"06de54c9-ba28-4e50-8f3b-0211714439d0","resolution":{"observed_at":"2026-08-08T00:52:37.701090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.681320Z","title":"2025 , eprint =","venue":null,"work_id":"4bef44d7-916c-4655-8884-32ec7d83cd40","year":2025},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.387143Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:3afa569bf2097b4867d151ab7ddd0bccdfd09e7e71e9de1948eda45e9fe44f1d","observation_id":"cbb5181a-3311-4f3d-8d9e-152a201fe851","resolution":{"observed_at":"2026-08-08T00:52:37.686100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.391538Z","title":"The Hidden Link Between","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.391538Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:523c55161a8acfccf6ebbfaa22d1656c947af757e7d0ec7a566042c6d24aa9cb","observation_id":"88758300-b891-42c6-ac45-1711f3e6a1f0","resolution":{"observed_at":"2026-08-08T00:52:37.391538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.666938Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":"fcd12012-3164-4637-b5ee-3df519267ab4","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.395884Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:9eb08c2a89936411726e6a94116c6838b2c65b287463250de04b95f0fa0dd5dd","observation_id":"306e9743-db19-4fe3-9559-470fa2c9c306","resolution":{"observed_at":"2026-08-08T00:52:37.671530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:52:37.648480Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"8424bdab-5f37-48e6-ad48-5d67685dcaf4","year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.400464Z"},"links":{"citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:cfc4a9fcb7c8eb880dee05a334bdaf5c2101556dd9313ebba13957f1567f2fb8","observation_id":"35b06d4f-4564-49d9-83a5-ab510ec2c64d","resolution":{"observed_at":"2026-08-08T00:52:37.656364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-03T11:31:07.805515Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-08T00:52:37.405393Z","title":"arXiv preprint arXiv:2406.11191 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T00:52:37.405393Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2608.03545"},"observation_digest":"sha256:cd7387986e6bf58315194079e98898b8dd7fe34193815fb4f42ccf1d57ec7edc","observation_id":"7fe7ba90-5138-4f16-8f00-5575d2f34a96","resolution":{"observed_at":"2026-08-08T00:52:37.405393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03545","last_updated":"2026-08-05T03:37:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T23:10:49.661599Z","submitted_at":"2026-08-04T12:20:17Z","title":"Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.03545."}