{"as_of":"2026-08-08T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97aa446ce87f7d5374ff58582cbb14424a65fee0fcd9b3b069c97a823539612a","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:52.808169Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24500/citation-record","integrity":"/paper/2505.24500/integrity","json":"/paper/2505.24500/citation-record.json","paper":"/paper/2505.24500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T12:27:48.099504Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.099504Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:9aa2517672c3f90154034a646b71de770afde1ea50bb252286201460d82bddd3","observation_id":"19b10a2d-5766-43e4-baf5-9eeb9d2a81c2","resolution":{"observed_at":"2026-08-07T12:27:48.099504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T12:27:48.257139Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.257139Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:29a3822e04660a70f21d35c424549af012e9c5f20aa23f75b24ea8d24f56a704","observation_id":"308dc582-050e-4727-b741-33d9c09ef9e0","resolution":{"observed_at":"2026-08-07T12:27:48.257139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:27:48.555039Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.555039Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:1e9c1f342a4bdcac3f86fac0b46ce2c8842ca14d5f8bdb2d6509d6507bb31b59","observation_id":"39d74bd7-4134-4130-aef8-714800e24531","resolution":{"observed_at":"2026-08-07T12:27:48.555039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T12:27:48.797927Z","title":"Progressive tuning: Towards generic sentiment abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.797927Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:e7b35618e54c0f377559c896a0961c93aab00dfc77035e8df1aa28b817635656","observation_id":"4fb164ae-8e0c-4378-893d-f0e5e985c877","resolution":{"observed_at":"2026-08-07T12:27:48.797927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11886","last_updated":"2024-06-13T13:18:43Z","snapshot_observed_at":"2026-08-07T08:42:35.770187Z","submitted_at":"2024-03-18T15:39:14Z","title":"QueryAgent: A Reliable and Efficient Reasoning Framework with Environmental Feedback-based Self-Correction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11886","snapshot_observed_at":"2026-08-07T12:27:48.938782Z","title":"A notion of complexity for theory of mind via discrete world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.938782Z"},"links":{"cited_paper":"/paper/2403.11886","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:7a15ffca13569229e9731ee63b734b044177d995fe34f24062fe1f39d8d0981f","observation_id":"1093a78b-dfa2-4b22-995a-1f9a9b8871c8","resolution":{"observed_at":"2026-08-07T12:27:48.938782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:27:49.075144Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.075144Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:ad457870ff953737813a5f132e3b56e1fd0416f4799f170de49cc6b2b16ace01","observation_id":"6f3181d8-1738-40d3-9e36-d59e4c93e32f","resolution":{"observed_at":"2026-08-07T12:27:49.075144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T12:27:49.228737Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.228737Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:526e60961131538898ef6d3858680dff2563eecbf5278cce6e7f20c379dfdda8","observation_id":"b7a8e223-9433-4d61-ad96-5bda5d2fa32a","resolution":{"observed_at":"2026-08-07T12:27:49.228737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.577185Z","title":"Perceptions to beliefs: Exploring precursory inferences for theory of mind in large language models","venue":null,"work_id":"804a3341-eede-4f3a-816e-39a595586dfa","year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.386878Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:66397e5f8674505119d9c67db4374edee53c9d77c4ecc3947b3e28accaa09163","observation_id":"5d54a5a6-4a1b-4af1-a6cd-1ce9beb6e125","resolution":{"observed_at":"2026-08-07T12:27:55.671442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T12:27:49.679902Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.679902Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:6da3fe8bec579db3588b3c350790c60291d5c0172273cbf073ca4eff003afe1e","observation_id":"86bff7f8-0ddb-470d-8ee2-25c119f40e4e","resolution":{"observed_at":"2026-08-07T12:27:49.679902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12175","last_updated":"2024-12-12T21:29:00Z","snapshot_observed_at":"2026-07-06T20:08:02.963967Z","submitted_at":"2024-12-12T21:29:00Z","title":"Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12175","snapshot_observed_at":"2026-08-07T12:27:49.910942Z","title":"Explore theory of mind: Program-guided adversarial data generation for theory of mind reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.910942Z"},"links":{"cited_paper":"/paper/2412.12175","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:f6d31aa363b3ff41e9b4fdc01f6fa8c174adc9260ee6718230e96ffc476776b2","observation_id":"c307fdb2-94fb-47f7-965b-c555ddcb52af","resolution":{"observed_at":"2026-08-07T12:27:49.910942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:27:50.005114Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.005114Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:27bff454657d6900a2171c8dec5a9b10794a4e1b4c80c290930a7678de6e2f62","observation_id":"c3fdab7c-ad12-4103-b3fe-b67b516ae7e2","resolution":{"observed_at":"2026-08-07T12:27:50.005114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:27:50.102559Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.102559Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4c11bb013d5fd89926ac3ec27f857b9fa5d0381ded179d13177e20ae4712e4eb","observation_id":"7eacdde7-166a-4f7c-9059-def5e592d386","resolution":{"observed_at":"2026-08-07T12:27:50.102559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08838","last_updated":"2025-01-15T14:47:02Z","snapshot_observed_at":"2026-07-06T20:21:28.196206Z","submitted_at":"2025-01-15T14:47:02Z","title":"ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08838","snapshot_observed_at":"2026-08-07T12:27:50.270022Z","title":"Tomato: Verbalizing the mental states of role-playing llms for benchmarking theory of mind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.270022Z"},"links":{"cited_paper":"/paper/2501.08838","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:af6eeae0e9c356b9bd9fb9062f0d7f60492c7c4623605b9f1fa02c5c15e526f0","observation_id":"e809d746-7890-44c6-bfc8-5b44b0404e16","resolution":{"observed_at":"2026-08-07T12:27:50.270022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T12:27:50.567982Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.567982Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:d09717043e58f7209880489a93b9f73fbc56f1b2b57625235d706ee87936a61b","observation_id":"e5df7549-894f-46fc-8577-1c81973ef424","resolution":{"observed_at":"2026-08-07T12:27:50.567982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:50.713881Z","title":"Climbing the ladder of reasoning: What llms can-and still can’t-solve after sft? arXiv preprint arXiv:2504.11741,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.713881Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:d272ac5b2beb32aaf44f7e3a32f3c64644102e56294a9a4e5685a1fd9af0c654","observation_id":"9edca75c-ed6c-4a03-ac76-063551775524","resolution":{"observed_at":"2026-08-07T12:27:50.713881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-07-06T18:29:58.140132Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:27:50.908285Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.908285Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:ddadd0cdfb9c3ae80c9b76c7b480c251a2a6fd9e0a6e994b82b61f0693c27538","observation_id":"e57198dc-bc3b-4e25-9d4e-e0450c9c8766","resolution":{"observed_at":"2026-08-07T12:27:50.908285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T12:27:51.038674Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.038674Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:48947b1753fec2f7f4109d5b72581270d66745c9e60088b02b5eb525faa758b1","observation_id":"1b5f4533-fe3b-4e24-8961-ccccea2f8de8","resolution":{"observed_at":"2026-08-07T12:27:51.038674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.030856Z","title":"Hi-tom: A benchmark for evaluating higher-order theory of mind reasoning in large language models","venue":null,"work_id":"e8f6c39a-a548-45e6-8e00-81b39dd1dc7f","year":2023},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.153523Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:8b64bce7e2100ef41c158e8429d37a832aa656eb671730e4a778fbfc1c97afb2","observation_id":"7474caf0-d8fe-4815-8c1d-71db8aaaefec","resolution":{"observed_at":"2026-08-07T12:27:55.090600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T12:27:51.290313Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.290313Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:ae57508c77783644893565b36341c671578d3d093578a2fd9087a70b3da3710f","observation_id":"2c95a59f-4855-449a-a573-10761728cc9d","resolution":{"observed_at":"2026-08-07T12:27:51.290313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T12:27:51.421057Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.421057Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:f1bd44d7f2d28b3688723574637cc401a5c79d028a749e2b2228655442ff9941","observation_id":"1634f636-6489-4528-98a5-5373a857391d","resolution":{"observed_at":"2026-08-07T12:27:51.421057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:27:51.563161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.563161Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4b9d2a8316211452c50062a6fc5d3259e3415b56299a76371c7c0faba34dc8c4","observation_id":"28372f1e-66ef-40a4-a453-95af9b8631b5","resolution":{"observed_at":"2026-08-07T12:27:51.563161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T12:27:51.686739Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.686739Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:ffc4ab5aacc88bf43a4574c23dc4b776f8a5d5f313cd84cc044558f9c682a2ac","observation_id":"e4451955-6d9b-420b-85b6-d8f8577955af","resolution":{"observed_at":"2026-08-07T12:27:51.686739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00810","last_updated":"2025-04-01T14:01:50Z","snapshot_observed_at":"2026-08-07T16:17:22.645083Z","submitted_at":"2025-04-01T14:01:50Z","title":"Z1: Efficient Test-time Scaling with Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00810","snapshot_observed_at":"2026-08-07T12:27:51.841949Z","title":"Z1: Efficient test-time scaling with code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.841949Z"},"links":{"cited_paper":"/paper/2504.00810","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:39ebb1b99763b7ec059a6eaa2feb3b08bad3195485683d24c138662efaab84c0","observation_id":"1f316624-31ca-4996-a14e-5958a5b4f105","resolution":{"observed_at":"2026-08-07T12:27:51.841949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14135","last_updated":"2024-12-18T18:24:47Z","snapshot_observed_at":"2026-08-03T23:00:22.560900Z","submitted_at":"2024-12-18T18:24:47Z","title":"Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14135","snapshot_observed_at":"2026-08-07T12:27:51.974700Z","title":"Scaling of search and learning: A roadmap to reproduce o1 from reinforcement learning perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.974700Z"},"links":{"cited_paper":"/paper/2412.14135","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:6fa9325c89ac01b8d3e05b991ac6a26a25912e2199fe8058dfe0a19b760e3fef","observation_id":"585c6ccc-11bf-434b-b600-bd8655e19a10","resolution":{"observed_at":"2026-08-07T12:27:51.974700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:52.105777Z","title":"Autotom: Automated bayesian inverse planning and model discovery for open-ended theory of mind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.105777Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:8cb55e107a410acf388a279b9085d0a8ec775206da61ce86d80a102ba7168bc3","observation_id":"f36ab083-ece6-43d4-b9c9-3f3f29937d35","resolution":{"observed_at":"2026-08-07T12:27:52.105777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11667","last_updated":"2024-03-22T18:52:15Z","snapshot_observed_at":"2026-08-01T04:15:49.179138Z","submitted_at":"2023-10-18T02:27:01Z","title":"SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11667","snapshot_observed_at":"2026-08-07T12:27:52.254318Z","title":"Sotopia: Interactive evaluation for social intelligence in language agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.254318Z"},"links":{"cited_paper":"/paper/2310.11667","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:3c8ebdfba8774d9ae5872aa9cfb0e0304d523c0768d2e3991bacd71a3249c301","observation_id":"fd96bd9b-3e57-4aa4-80ac-fe5d99d7b201","resolution":{"observed_at":"2026-08-07T12:27:52.254318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-07T16:51:01.687483Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T12:27:52.419144Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.419144Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:879c18b32918b33041e06e52b213304fe75379882a6033dc00049056abb01e3a","observation_id":"4f807b02-017d-4bed-a1be-c32a4eab9262","resolution":{"observed_at":"2026-08-07T12:27:52.419144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:54.723859Z","title":"The comparison results are shown in Table","venue":null,"work_id":"27c33581-2245-4862-a9bd-12b97fb57b3b","year":2023},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.551126Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4d10e19d01a944069ddf08d933db05b6e980d7c2cda371f0c5db3dac3a7df0ac","observation_id":"fb1d23b2-1d90-41b0-b60f-9e45ef984190","resolution":{"observed_at":"2026-08-07T12:27:54.888072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:54.323293Z","title":"What LLMs Can—and Still Can’t—Solve after SFT?","venue":null,"work_id":"1df1571f-9ae2-4726-829e-f34323996829","year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.696376Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:d1ce30e5225ad073cf775df8f3ef14e70c9af4f52a8f36ebb7e9f3cf31b9e498","observation_id":"98b817c3-08ca-43c5-9bba-9f4ad29f3d62","resolution":{"observed_at":"2026-08-07T12:27:54.535643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:54.005201Z","title":"budget forcing","venue":null,"work_id":"f2eabf81-1069-4bc9-b1c8-a1d43dbfbb78","year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.808169Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:31c3576a4fdd3140e7560d7ffa0a754820dfa358925a491ed82e11d5ddc2cfb8","observation_id":"dd47479f-7f0e-451e-a765-43ba4198eef4","resolution":{"observed_at":"2026-08-07T12:27:54.170166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T12:27:50.446081Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.446081Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:bbfb3697960eb27b6196162be98b6a8ae8e98e5e9f85e05463c1dd3f428258ab","observation_id":"43b977b2-7bc4-4a82-8d8b-6f534d1c1dde","resolution":{"observed_at":"2026-08-07T12:27:50.446081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.382954Z","title":"Revisiting the evaluation of theory of mind through question answering","venue":null,"work_id":"55ba9d00-cede-4912-bb16-7c2d41641513","year":2019},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.528985Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:2d00355081f8f793ea137a6c322f5fcea2231dd1ee98ebd48ef787704ec17359","observation_id":"d8dc670e-9460-401a-9bd4-a8a430bd1ccf","resolution":{"observed_at":"2026-08-07T12:27:55.491641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T12:27:48.392575Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.392575Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:1edbe7a370c47ef290a208b0ea82320f47eae53ced7bac880db66287bb7c4b19","observation_id":"c181eec8-6d4f-42e4-a4f9-56e8da5edba2","resolution":{"observed_at":"2026-08-07T12:27:48.392575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:49.594703Z","title":"Relation-r1: Cognitive chain-of-thought guided reinforcement learning for unified relational comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.594703Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:cda6b68c8169f618bc6159b19b4718b78d3a157e6a2e06eb652e4dd5ce8b7158","observation_id":"257d3a63-41ab-44bc-afab-438bd05e1d94","resolution":{"observed_at":"2026-08-07T12:27:49.594703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.206937Z","title":"Social iqa: Common- sense reasoning about social interactions","venue":null,"work_id":"3d1e33d1-06fd-41bf-9c19-24348ce38440","year":2019},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.824323Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:e46028f1e5a8cdaaf769ee0229371b1d2219ddb9f8f9a80118cc5fa838bae479","observation_id":"0f1ef408-6abe-4356-bada-9bfd8f90590e","resolution":{"observed_at":"2026-08-07T12:27:55.299794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-07-31T21:52:59.633187Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-07T12:27:49.740854Z","title":"11 Zhenting Qi, Mingyuan Ma, Jiahang Xu, Li Lyna Zhang, Fan Yang, and Mao Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.740854Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:cbb50f88af5bdc18dbe4e9a7ac67b9972dbe8eba096ff5ca35f62482d9874a61","observation_id":"ae8e3374-ad35-4ae9-bc01-3de7c29f3cb3","resolution":{"observed_at":"2026-08-07T12:27:49.740854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T12:27:48.037680Z","title":"Bradley Brown, Jordan Juravsky, Ryan Ehrlich, Ronald Clark, Quoc V Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.037680Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:00083daff5927d2874a13fb594187101cc4afc48069b7bdd13c47283f56f5dbb","observation_id":"f67b7fdd-adbd-4450-a8c8-0c4c883b535a","resolution":{"observed_at":"2026-08-07T12:27:48.037680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19898","last_updated":"2025-04-28T15:30:58Z","snapshot_observed_at":"2026-08-07T15:58:33.955467Z","submitted_at":"2025-04-28T15:30:58Z","title":"GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19898","snapshot_observed_at":"2026-08-07T12:27:48.666190Z","title":"Gencls++: Pushing the boundaries of generative classification in llms through comprehensive sft and rl studies across diverse datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.666190Z"},"links":{"cited_paper":"/paper/2504.19898","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:e2a69e97198b30c90d8e73f22ef8f7afd4d58856a092ae74be1a2d5515a3505c","observation_id":"6e6e6052-e199-4952-ad4f-924d4dfd415b","resolution":{"observed_at":"2026-08-07T12:27:48.666190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:18:21.268211Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2505.24500."}