{"as_of":"2026-08-08T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5909c5daee918e4fd622155d824cd93781d122862d52b436f806137ff112cf7","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:02:38.886258Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01327/citation-record","integrity":"/paper/2507.01327/integrity","json":"/paper/2507.01327/citation-record.json","paper":"/paper/2507.01327"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-06T21:02:36.942746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:36.942746Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:261c76e8193a3041f531049c4169817d9e19c1b8d8aefe7828cbd844dd8e6658","observation_id":"31a208ec-737b-4732-823d-902ac8dc57a8","resolution":{"observed_at":"2026-08-06T21:02:36.942746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18438","last_updated":"2025-01-31T15:39:00Z","snapshot_observed_at":"2026-08-02T16:14:14.331258Z","submitted_at":"2025-01-30T15:45:56Z","title":"o3-mini vs DeepSeek-R1: Which One is Safer?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18438","snapshot_observed_at":"2026-08-06T21:02:37.032293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.032293Z"},"links":{"cited_paper":"/paper/2501.18438","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ab533042e0b88b8e131b79a1a7dc012656f3e78cab7ba8c520e81d0c5935413b","observation_id":"5f9e17e1-3cc5-483a-b922-d22bd53228f7","resolution":{"observed_at":"2026-08-06T21:02:37.032293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:02:37.183211Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.183211Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:9f15259d524284277cd89b1bebe467a27a3af1c8f96f89ba8ab333097a139fe7","observation_id":"14b9f2ce-14ee-4cf7-a291-fb1d8309115d","resolution":{"observed_at":"2026-08-06T21:02:37.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.230211Z","title":null,"venue":null,"work_id":"a60430c9-297b-4dff-9fda-ea19687cc6c1","year":1995},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.319463Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:45b2fcb352a52b66a8c2c4c0b9a0c3dcd143f6c68305b34881552f0cf14a148e","observation_id":"0d5c8270-2ff8-49f1-b33a-2dbbc9d82af1","resolution":{"observed_at":"2026-08-06T21:02:40.234899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-06T21:02:37.502465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.502465Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:5c432e6ce5adade2b5f6457117cce051a2b4fe8d82ebc220525252e567a14efc","observation_id":"023fce87-47f5-49f7-8100-39b5698eaf4c","resolution":{"observed_at":"2026-08-06T21:02:37.502465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:37.699455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.699455Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ed721508e1879d882537aaee107bcc4ef82fc1fee86cca96f4332cd9164f64f2","observation_id":"0aa882ab-7b75-4db8-8aef-e46eea1ddc3a","resolution":{"observed_at":"2026-08-06T21:02:37.699455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T21:02:37.820378Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.820378Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:fe9aed6a4b78aede96203c862374cf437a1df4b5bf189be928b40d466ae57e54","observation_id":"86e7978e-5dd8-4787-9961-5830e10eec17","resolution":{"observed_at":"2026-08-06T21:02:37.820378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.215914Z","title":null,"venue":null,"work_id":"d6f23526-ef0a-49c6-9288-4218298825fe","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:37.955406Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:4e80dab99015a79ce0656253e34ee005a248f52a4917b1c1f183b9c2b7848a0a","observation_id":"ce74fb56-f1ee-4738-a1c1-2e2a673cc6c3","resolution":{"observed_at":"2026-08-06T21:02:40.220572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.201207Z","title":null,"venue":null,"work_id":"6d1af688-f471-4b12-99ec-3326df663f69","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.044785Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:0d0988c7d35599cd212859d36ace07b64f02e762153570a020740d19da7afb33","observation_id":"c657feba-84a2-4a22-8038-9a9c4d28439b","resolution":{"observed_at":"2026-08-06T21:02:40.205589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.151830Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.151830Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e06c8b91b596aa6ff56e3859b2ffb245e37d6f0d6b299a08463f3ea10cd768b4","observation_id":"b4835359-7fc4-40df-b9fd-6224fa5dd951","resolution":{"observed_at":"2026-08-06T21:02:38.151830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18576","last_updated":"2025-01-30T18:45:51Z","snapshot_observed_at":"2026-07-06T20:28:33.378335Z","submitted_at":"2025-01-30T18:45:51Z","title":"Token-Hungry, Yet Precise: DeepSeek R1 Highlights the Need for Multi-Step Reasoning Over Speed in MATH","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18576","snapshot_observed_at":"2026-08-06T21:02:38.200430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.200430Z"},"links":{"cited_paper":"/paper/2501.18576","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:afbad86b664f17bd022e0d123028b0ef709923fde96e1ba162ed856c16943b65","observation_id":"2c2ad01c-1d6e-4ccf-abb3-9329f1992d0e","resolution":{"observed_at":"2026-08-06T21:02:38.200430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.176099Z","title":null,"venue":null,"work_id":"bd161eae-d876-46f4-908c-f02467ba5470","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.263726Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6a0353b22aaf12feb6f4bcd4541da3053b8500f0522c5ef37ed32ab75c4f873d","observation_id":"a1327e2c-c0e8-4beb-85d4-dfe89e595765","resolution":{"observed_at":"2026-08-06T21:02:40.180524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:02:38.448293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.448293Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:7a136237efeb0cbbf1fe61e8b5cdcda266934957d45f2d5faa77d56ee87b8c66","observation_id":"e57f1145-b8fc-42c4-bed9-231ca0008c03","resolution":{"observed_at":"2026-08-06T21:02:38.448293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.160789Z","title":null,"venue":null,"work_id":"1296d730-bf54-4f95-8db5-74cb8b03c8be","year":1960},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.528388Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:39e4ae40f3f3a3a2087e5de3487c36f68cb5477e8f4e19d17da055c082412f45","observation_id":"8878cbaa-47b4-4a76-80a2-7262b7f49da0","resolution":{"observed_at":"2026-08-06T21:02:40.165410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-06T21:02:38.646820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.646820Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:c8f1ce51cee5457dbe62018e49d65d5f1043b59952d3cf2e02ee328288662dbf","observation_id":"dd28b2ec-b78f-4368-bd84-ba7e374f707d","resolution":{"observed_at":"2026-08-06T21:02:38.646820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T21:02:38.664449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.664449Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:4db99de711f11881fb2f74c6aa1cf1749a135c426bfc065200ec05badcaf50a9","observation_id":"9c259246-689b-4490-928f-5ad5de36cd71","resolution":{"observed_at":"2026-08-06T21:02:38.664449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T21:02:38.671165Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.671165Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:c0d59ca8199599204f35a90b2ff853ecb61bde36f2a3c02302b2e4e40bbf0d1a","observation_id":"b7e29413-02af-4dc8-8d42-a5e0a05c3671","resolution":{"observed_at":"2026-08-06T21:02:38.671165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.676052Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.676052Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e8471a9e0171b58500574c86786d602644532f3460c331f9e293da64d5af1062","observation_id":"f43a6cd5-3164-47a8-a521-720e6188e685","resolution":{"observed_at":"2026-08-06T21:02:38.676052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.681209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.681209Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:eb2c9c5102759d0c301ee4fbca095f07d0bcd889d1fa8812d92c376a218198b8","observation_id":"12f06d24-1b9c-4673-bf13-d373f5c1b33a","resolution":{"observed_at":"2026-08-06T21:02:38.681209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-06T21:02:38.685458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.685458Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:d0352e9e4cd315b58dd50dfa8c02c0e0868bd2dabd79535e1c9d901215c99762","observation_id":"3b8e6642-fd7f-4db2-babd-ce61d14f1753","resolution":{"observed_at":"2026-08-06T21:02:38.685458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-06T21:02:38.690014Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.690014Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:7a9d846b800ee62c55daf8bcb608d627fce53ed6860a5936d704afd8b3d30e21","observation_id":"6cb29d71-2aa2-4135-8315-01a3eedbb761","resolution":{"observed_at":"2026-08-06T21:02:38.690014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.694881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.694881Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:fcdd63f70329e2f7ebe0bf10ca9acad793185764f497ca59561dc0e879e2f65a","observation_id":"a3d2dc45-2930-4ced-9b96-f57ef3b601f6","resolution":{"observed_at":"2026-08-06T21:02:38.694881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T21:02:38.699466Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.699466Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:048cf53b14ec86d010e8c98744dedd7fa6b390da32f0765eaed809cb6fb628a4","observation_id":"806618c4-0cc6-4a35-9b9a-34319bb0c842","resolution":{"observed_at":"2026-08-06T21:02:38.699466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.704508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.704508Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8a5849aceb2a386e05d714df6617ed4a98bd8ef4ad874bee75869235da2ada78","observation_id":"7586d958-0dc2-4586-9fd6-44af33d8ac51","resolution":{"observed_at":"2026-08-06T21:02:38.704508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12837","snapshot_observed_at":"2026-08-06T21:02:38.709251Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.709251Z"},"links":{"cited_paper":"/paper/2202.12837","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:4cc1e68f2f2a692bce33deefe9ae200e8fedd6352363f9fe7f7170b0074115c7","observation_id":"07392453-e916-4d8d-8ef8-bc9b199f4f63","resolution":{"observed_at":"2026-08-06T21:02:38.709251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.125373Z","title":null,"venue":null,"work_id":"ecd38286-03e9-453f-a493-49eba791de09","year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.713899Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6b55e5f41823eaea7d73b0b68b12b246b2af74c0b6809aa13ffc0087777a6dd1","observation_id":"9aeb3252-57f0-4b23-9cf4-20a64e488caa","resolution":{"observed_at":"2026-08-06T21:02:40.129593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.111174Z","title":null,"venue":null,"work_id":"2c88482f-ae7a-4e7a-8779-258b2eb409f4","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.718779Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:6b316a169860dbd65a3026e4329b569847c20d5d224c63b82c127ac3bca7cae2","observation_id":"b96b7442-c81b-4c59-80d4-041fdf07e4dd","resolution":{"observed_at":"2026-08-06T21:02:40.115473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.096306Z","title":null,"venue":null,"work_id":"c6b5c040-631d-4680-8746-da8a43de407e","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.723190Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:7831a8a0760e14e2a16fc05c4335286ec3728829309577307e429c00649d798e","observation_id":"8d6d9956-b807-470b-ad2e-2f02d026acf9","resolution":{"observed_at":"2026-08-06T21:02:40.100897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:02:38.727798Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.727798Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e232b81a60f5012f93cd9d7cdfaf34ff776f37ed62321434897ecb7f85438bca","observation_id":"ceacf498-c68d-439d-9547-2842c0e27f5d","resolution":{"observed_at":"2026-08-06T21:02:38.727798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.080804Z","title":null,"venue":null,"work_id":"3ff80188-cbc9-4a73-97b6-4ca5873fb977","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.732475Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:60156613fe401867b475507e5474c1f75895896886ce44515c8afcd8d1b0e6ab","observation_id":"f1d61937-ff6d-4540-bd52-7cfa4ed879ee","resolution":{"observed_at":"2026-08-06T21:02:40.085501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.736901Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.736901Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:c099be195288dc75470050babce53b7900c2b2eca5c0c29a7da452ed8548641b","observation_id":"04ea2fdc-426e-4521-8c9c-92d6778a9918","resolution":{"observed_at":"2026-08-06T21:02:38.736901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14289","last_updated":"2021-09-19T04:46:17Z","snapshot_observed_at":"2026-07-06T11:04:44.562595Z","submitted_at":"2021-04-27T19:49:39Z","title":"Multi-class Text Classification using BERT-based Active Learning","version":2},"cited_work":{"arxiv_id":"2104.14289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.14289","snapshot_observed_at":"2026-08-06T21:02:39.428255Z","title":"Multi-class Text Classification using BERT-based Active Learning","venue":"cs.IR","work_id":"c696470c-74a2-427d-a8c0-3f11357e3ec8","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.741316Z"},"links":{"cited_paper":"/paper/2104.14289","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:69ea536b991726b70792ae9e97f1f2b69c8c6f53b221c82556b48b8b8eecd98c","observation_id":"a00037ce-f4da-4fb2-ba28-2a7ffbd0fbe1","resolution":{"observed_at":"2026-08-06T21:02:39.432882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.055345Z","title":null,"venue":null,"work_id":"09a77883-92e1-4573-8eb4-ac6ffe0b3c20","year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.746100Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e1c71b912b8de45f53a54312613937bd3ff73407070770418e35fe41ec2e3ef6","observation_id":"32ffb3d0-ec8e-4c7b-b520-c4910cf7dc8b","resolution":{"observed_at":"2026-08-06T21:02:40.059976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:02:38.750400Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.750400Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:b7c477eb8ab393808e5e12df7a9fbebea049236d990ae53255bb7db9a1c37a1e","observation_id":"0591341e-520c-4e6c-af89-90d0f5dffecf","resolution":{"observed_at":"2026-08-06T21:02:38.750400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.754928Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.754928Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:737d7a0f4b32c6972e6e69716662e359bbc02cd76c065fd840d4b0b46c30a796","observation_id":"c7ace076-2e60-4f14-8da7-2890c9818394","resolution":{"observed_at":"2026-08-06T21:02:38.754928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.031382Z","title":null,"venue":null,"work_id":"5d92f8bc-e44e-45bb-ac31-3ddab8b16e4c","year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.758816Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8dc78c94cddb12a493d94378e4bec35916a94143bd748d8316305eb3015c6d66","observation_id":"d9babff3-870f-4bcd-b9bc-6ed2395b8610","resolution":{"observed_at":"2026-08-06T21:02:40.035515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.11455","last_updated":"2019-04-25T16:54:02Z","snapshot_observed_at":"2026-08-07T23:05:56.736777Z","submitted_at":"2019-04-25T16:54:02Z","title":"Ray Interference: a Source of Plateaus in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.11455","snapshot_observed_at":"2026-08-06T21:02:38.763176Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.763176Z"},"links":{"cited_paper":"/paper/1904.11455","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:dcb4337ebe1090b1ed2c7b9e196566854f62835620fe427458fefddad4638926","observation_id":"2715de2e-6c1d-45f2-ac73-649341fc1bea","resolution":{"observed_at":"2026-08-06T21:02:38.763176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T21:02:38.767702Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.767702Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:20b7d4e5870418ed7f5a9be5ee15eea6c0b5f7f4724cfc7a3db71e287903f6d3","observation_id":"7b522326-3a75-4857-915a-6ccf1c508f45","resolution":{"observed_at":"2026-08-06T21:02:38.767702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T21:02:38.776906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.776906Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:41fa8e2ebb4e9fac2cd5c1ec8cf04040e915e59045bd3049db44b046dc0729dc","observation_id":"fdb864e8-2e6b-4ad6-92e9-26720e25ec49","resolution":{"observed_at":"2026-08-06T21:02:38.776906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T21:02:38.781944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.781944Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:635393f2dda347a2d7ab9d40914bf9544026f8835b914d7053ace3935880f3e4","observation_id":"4571d06d-73c8-4ff6-83e7-161d0e3e36d0","resolution":{"observed_at":"2026-08-06T21:02:38.781944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T21:02:38.786360Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.786360Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:1376ce5377a233bfd19a1d7cc77f42bdb77e20beb4410266d8b3748dfdd12c2c","observation_id":"042cd7d2-6082-4890-bce1-bb2480a4d2e9","resolution":{"observed_at":"2026-08-06T21:02:38.786360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.016839Z","title":null,"venue":null,"work_id":"b9ba8c87-ce5e-4b68-bfa6-a29baa30a796","year":1993},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.790628Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:967631510b5abfc375ac68b1ede4ea6a9a858326613a34c3daa174bf65e8a8d7","observation_id":"e05d6af9-440d-4d16-bb6d-5ce7cc0b3662","resolution":{"observed_at":"2026-08-06T21:02:40.021093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T21:02:38.794746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.794746Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:737edcd94b58e2551857936d915c8e75a8c568ff313a62e994c2bf8133c468c1","observation_id":"11905553-2ea7-4744-ad24-d71fc44b1561","resolution":{"observed_at":"2026-08-06T21:02:38.794746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01854","last_updated":"2023-10-03T07:34:30Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T07:34:30Z","title":"Fine-tuned vs. Prompt-tuned Supervised Representations: Which Better Account for Brain Language Representations?","version":1},"cited_work":{"arxiv_id":"2310.01854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01854","snapshot_observed_at":"2026-08-06T21:02:39.290422Z","title":"Fine-tuned vs. Prompt-tuned Supervised Representations: Which Better Account for Brain Language Representations?","venue":"cs.AI","work_id":"a4af2fe4-cc52-4651-a80d-549835d84eed","year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.799491Z"},"links":{"cited_paper":"/paper/2310.01854","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:d84053e8c3d950f3060ed2ee20f9f3a8942ba432e9698b43cee6d7e99d8094b3","observation_id":"9e72aea4-7d5f-474f-be6f-67a07e0a119e","resolution":{"observed_at":"2026-08-06T21:02:39.295404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T21:02:38.804100Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.804100Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:1ebd57831e01eb9e8f45c316add9cd6e359dd4efe4de2674c39b58f43700b288","observation_id":"8a02cf4b-ebfd-4335-aac8-44d35fa87c26","resolution":{"observed_at":"2026-08-06T21:02:38.804100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T21:02:38.808953Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.808953Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8f8d57b93d57551f3667199db411dd0dae36711ce28cb3e8e1b926d2c1d3e124","observation_id":"df9f09b6-8183-466e-98d8-68bd965f2c22","resolution":{"observed_at":"2026-08-06T21:02:38.808953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03893","last_updated":"2023-08-30T03:38:22Z","snapshot_observed_at":"2026-08-07T01:46:48.713323Z","submitted_at":"2023-04-08T02:41:40Z","title":"ChatGPT Empowered Long-Step Robot Control in Various Environments: A Case Application","version":6},"cited_work":{"arxiv_id":"2304.03893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.03893","snapshot_observed_at":"2026-08-06T21:02:39.232809Z","title":"ChatGPT Empowered Long-Step Robot Control in Various Environments: A Case Application","venue":"cs.RO","work_id":"86658c33-b3ad-4ce5-a61c-953e75b87207","year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.813932Z"},"links":{"cited_paper":"/paper/2304.03893","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ec62b5958ec40e2b61e2e2dec5fc01a30c7c280565a1f6306a12893a3bc41f4f","observation_id":"33e7ef3a-5699-49e0-8229-fa15229b2143","resolution":{"observed_at":"2026-08-06T21:02:39.239638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T21:02:38.818681Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.818681Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:bc8ae80120d7e6ca5a05dbc57682e07eb044802620c34e6ac527c576be8c0988","observation_id":"5765637a-d77e-4077-9058-a0f4022bc6d1","resolution":{"observed_at":"2026-08-06T21:02:38.818681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:40.002232Z","title":null,"venue":null,"work_id":"ce018d36-7ce1-4168-bcc4-7c77cd158d14","year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.823905Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:2e55be73db9cc3af7e14ba55126553353a0c15d113c50a64a6dfad3222524592","observation_id":"8e8d32ef-5428-4420-81a6-7d0ec150fb46","resolution":{"observed_at":"2026-08-06T21:02:40.006437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.828256Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.828256Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:873b16b1d1a14e33311c9fead4f99f0d60c150d26976a9d59a00d8a055a786ea","observation_id":"dd18e72e-1c9a-4bbb-92b7-fee9f47c2141","resolution":{"observed_at":"2026-08-06T21:02:38.828256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T21:02:38.833031Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.833031Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:79bfa008812c69dd4f3eefa239fea91971909e8dbf24ee049d99773487b03bcf","observation_id":"20842445-d568-402d-b50f-703292704157","resolution":{"observed_at":"2026-08-06T21:02:38.833031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:39.977446Z","title":null,"venue":null,"work_id":"2024cb05-c6f3-46c4-beaa-08af75b1313d","year":2024},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.837355Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:1e6a33f043a958bb451834cf75fbbe3dbc65a9a1e624028722c147eeca1beabf","observation_id":"4dc20609-ed91-4ef5-a216-9aa1bdba487c","resolution":{"observed_at":"2026-08-06T21:02:39.981747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.841898Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.841898Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:5894b334785e01de5145b498f7a43398ae2a860ac2f301572f47c6b2b00b3957","observation_id":"777fff92-f2f1-415f-9946-188530af05c8","resolution":{"observed_at":"2026-08-06T21:02:38.841898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T21:02:38.846079Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.846079Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:ad1eb09f566f784f709efbc569c0ded2778f3fa2994c8eda8955cdb293052716","observation_id":"c1c42d31-9ed7-48d7-8c42-8cefef7bf7ad","resolution":{"observed_at":"2026-08-06T21:02:38.846079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:39.952608Z","title":null,"venue":null,"work_id":"f01b1f7e-a55e-48a9-a8f4-aac295a9677b","year":2019},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.851156Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:c41119879a3926a1ed6a59b97e615b61009ffeaceebd39f6d665a2be26796184","observation_id":"1bb0e20d-945b-41d7-a4a4-30fc039d6810","resolution":{"observed_at":"2026-08-06T21:02:39.957748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T21:02:38.855807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.855807Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:74468d1648746ad5c2a438d54b48a0d47ee2a920981a86af1869c2f167c8879c","observation_id":"48d27688-5e9e-45c2-a2d9-51bd55bfa345","resolution":{"observed_at":"2026-08-06T21:02:38.855807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-07T15:57:22.394744Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-06T21:02:38.860058Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.860058Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:396433e894744985bae2c2118cddc15d2d47f6d51d7a99d9b1b93fcc476a285a","observation_id":"71613651-96da-44e0-bf60-01d6a1a7ebf9","resolution":{"observed_at":"2026-08-06T21:02:38.860058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.864617Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.864617Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:a158f1c400b80c0074c8361c7231d3d674303357c8dfc51cf50b95f5a74548a4","observation_id":"c0df93c6-3af7-4ce3-ad93-beb0d070b678","resolution":{"observed_at":"2026-08-06T21:02:38.864617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-06T21:02:38.868488Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.868488Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:fbbc116d2d4b3ed98fdfaf990311057220dfc8d56452e83b9516682b7f0dfaac","observation_id":"6c168912-83aa-46d6-94cc-af00a997d0dd","resolution":{"observed_at":"2026-08-06T21:02:38.868488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.873273Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.873273Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8b4e6066456c0ebb8aeed48edc9b22e637ab271cc6d76caeaaba69910226c58b","observation_id":"c0586836-fa80-412a-920f-13e07fa9f098","resolution":{"observed_at":"2026-08-06T21:02:38.873273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:39.937945Z","title":null,"venue":null,"work_id":"5043bb5d-e271-42a5-b5b2-962eda425875","year":2021},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.877329Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:598ad655166104e00dd450302ba67601afe27854220ff2f4faa8f4738e901969","observation_id":"656c26ef-ca14-4248-8233-0421db02e172","resolution":{"observed_at":"2026-08-06T21:02:39.942268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.881524Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.881524Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:8019eed890f3d500323027555336f649109668c7e920ee1c9232dbb75dade168","observation_id":"1d90440a-2dd7-43ce-8ece-082d594f8f6d","resolution":{"observed_at":"2026-08-06T21:02:38.881524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:02:38.886258Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.886258Z"},"links":{"citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:e63d3c117b2fb4daffcfed0718e8fd864664b8c4f992dbc4ccd861b243cfbe82","observation_id":"16f3e57d-a978-4b96-9d35-2180688f1449","resolution":{"observed_at":"2026-08-06T21:02:38.886258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:06:19.893799Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2507.01327."}