{"as_of":"2026-08-17T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7526bd5c3aa49e27bd50952845c7df7c73312d52e379c96ac190d768a13622d8","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:23:08.276030Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:44:27.881977Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T15:26:10.640839Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"cited_work":{"arxiv_id":"2508.12935","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12935","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards open-ended emotional support conversations in llms via reinforcement learning with future-oriented rewards.ArXiv, abs/2508.12935","venue":null,"work_id":"8e5beefd-3a6c-40a4-adca-468e6279072e","year":2025},"citing_paper":{"arxiv_id":"2603.06194","last_updated":"2026-07-29T06:55:29Z","snapshot_observed_at":"2026-08-03T09:13:12.714748Z","submitted_at":"2026-03-06T12:06:57Z","title":"MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T15:25:51.138776Z"},"links":{"cited_paper":"/paper/2508.12935","citing_paper":"/paper/2603.06194"},"observation_digest":"sha256:e57dd5f0e07be8dbc84d52ba032b84de022adc1ce3ea5bc3102740306aa741d8","observation_id":"4e8f30e5-461e-47af-82a2-6a5025cd2432","resolution":{"observed_at":"2026-05-15T15:26:10.644998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12935","snapshot_observed_at":"2026-08-02T18:44:27.881977Z","title":"Towards open-ended emotional support conversations in llms via reinforcement learning with future-oriented rewards.ArXiv, abs/2508.12935, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06194","last_updated":"2026-07-29T06:55:29Z","snapshot_observed_at":"2026-08-03T09:13:12.714748Z","submitted_at":"2026-03-06T12:06:57Z","title":"MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:44:27.881977Z"},"links":{"cited_paper":"/paper/2508.12935","citing_paper":"/paper/2603.06194"},"observation_digest":"sha256:63ff3bc9113923a22a16e7eae51a5a29ad81db92398d64fbf385e2fcb0e318da","observation_id":"e9a4f98f-3c66-4700-bf45-9fc25c08dc3b","resolution":{"observed_at":"2026-08-02T18:44:27.881977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12935/citation-record","integrity":"/paper/2508.12935/integrity","json":"/paper/2508.12935/citation-record.json","paper":"/paper/2508.12935"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:23:07.947972Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.947972Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:214a235233cde05c0b55b027b4fdf4de6e400319d26d1ae83c8f46ca12433a75","observation_id":"86142871-be70-42b5-863d-861233250486","resolution":{"observed_at":"2026-08-15T17:23:07.947972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T17:23:07.954920Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.954920Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:f0ae27921dcb6fa6af80f40e43418f75ecefb099bb5ae50de0d20a69120f1560","observation_id":"22133c54-a5ca-4898-8259-ed464fc5fc70","resolution":{"observed_at":"2026-08-15T17:23:07.954920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.535917Z","title":null,"venue":null,"work_id":"5298dc0e-5492-43c1-9528-672b0bc8fbdb","year":2003},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.964223Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:011f0606ea24f9b6c7745098880982fda1d09d8b71b57bb762db331adbe394aa","observation_id":"eb9187bb-afa4-4aac-97b4-eb4a020e0984","resolution":{"observed_at":"2026-08-15T17:23:09.547328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.509663Z","title":null,"venue":null,"work_id":"cb8648ad-4ed4-4909-951d-68e67a121e21","year":2013},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.974556Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6673c3bcb8fb70bb157d7c79977e57984d0da5d81c91afc2c64802de9615b49b","observation_id":"6f92f9a6-7bb7-4145-8cef-ef8230d6a9fc","resolution":{"observed_at":"2026-08-15T17:23:09.516545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:07.983124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.983124Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:1cb1ac84c7879693c1e6fc5e7e6b1c9082e451d4582623e8d43b649d00007c29","observation_id":"799b3054-db43-459c-ba1e-3f497f9a17ac","resolution":{"observed_at":"2026-08-15T17:23:07.983124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:07.989689Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.989689Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:537e1649d4ba63b0eeb810f67b2a85a05503d67fd5cf633eb2581bb0ed180987","observation_id":"b7474df8-fa4d-4cbd-b7e8-d30f47a87f9f","resolution":{"observed_at":"2026-08-15T17:23:07.989689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.474686Z","title":null,"venue":null,"work_id":"4d690bd7-fce1-497c-9bd3-3331fea39111","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.996169Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:7db942c52ec4769fe3971d83d7dbc25850ad6e428c16e0f233d48d326b4a5925","observation_id":"7065042c-150b-43ee-a90f-be4e7ae89df7","resolution":{"observed_at":"2026-08-15T17:23:09.481015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.002704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.002704Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:a095a1804476d9769dbe956c3229e00cb99b262bb6bb2db4ee46f5018a31d42e","observation_id":"4d73e047-4165-43db-815a-10a4259521c9","resolution":{"observed_at":"2026-08-15T17:23:08.002704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.009596Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.009596Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:a4c1449f7d4e12c0979efd2ded4b53b00a8acffd72956556d1d38c567508b8c2","observation_id":"77054278-3ed1-4475-acf6-e21c46c2e358","resolution":{"observed_at":"2026-08-15T17:23:08.009596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.447698Z","title":null,"venue":null,"work_id":"e76bef6c-e850-476c-b1b6-2083c3aa178f","year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.018066Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:2f659464aceb434bccec427f13b8bacde018d2c3154458c24e5b8dc9f66305be","observation_id":"69c73f77-ab89-469f-9257-109b98d8329c","resolution":{"observed_at":"2026-08-15T17:23:09.454602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10172","last_updated":"2023-05-17T12:55:52Z","snapshot_observed_at":"2026-08-16T15:32:22.113278Z","submitted_at":"2023-05-17T12:55:52Z","title":"Knowledge-enhanced Mixed-initiative Dialogue System for Emotional Support Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10172","snapshot_observed_at":"2026-08-15T17:23:08.025468Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.025468Z"},"links":{"cited_paper":"/paper/2305.10172","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ec6e94e3e256b75ecddbfb0ad23f99a435a060f8e7581a49855fd47214b79699","observation_id":"4e3de397-e2be-4b3b-930d-230dae3b5518","resolution":{"observed_at":"2026-08-15T17:23:08.025468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10142","last_updated":"2023-05-17T11:55:32Z","snapshot_observed_at":"2026-08-16T15:32:22.876032Z","submitted_at":"2023-05-17T11:55:32Z","title":"Improving Language Model Negotiation with Self-Play and In-Context Learning from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10142","snapshot_observed_at":"2026-08-15T17:23:08.031934Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.031934Z"},"links":{"cited_paper":"/paper/2305.10142","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:a9840fcd9239b817a267ca863ae3ef384f27ee44b92f1db4d2065af335effc10","observation_id":"fb01df84-3482-4719-a149-5e1684d0ec64","resolution":{"observed_at":"2026-08-15T17:23:08.031934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T17:23:08.036950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.036950Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ba15bc1cdbfae78c926f3e752f6c6d221e6981e58548a9f181a658144b0da842","observation_id":"f6b9070e-4092-4fbe-ba4d-96e8bac795f7","resolution":{"observed_at":"2026-08-15T17:23:08.036950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T17:23:08.043886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.043886Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:9b22b46ce26a2df79884d8884b9117aebe5b628d6c14291b74695d13481b30bd","observation_id":"8af4dda2-87dc-4eaa-ae11-11d2392c3da6","resolution":{"observed_at":"2026-08-15T17:23:08.043886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:23:08.050016Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.050016Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c920aa46a3dd6bcfd81b1e74eb225f1e620a9ec0d24c8000a4cdcdca101615df","observation_id":"ab61585c-c003-48e3-8b30-9ce5c0689137","resolution":{"observed_at":"2026-08-15T17:23:08.050016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.056184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.056184Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:dc83f8f8088baf97ffe07db02c453818ff4f0c339e91bbbfb76ca160093595d6","observation_id":"fc976764-be01-4850-a878-1f1dcd58c13e","resolution":{"observed_at":"2026-08-15T17:23:08.056184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.422671Z","title":null,"venue":null,"work_id":"0ae4edbf-f474-400a-8450-7927d3666909","year":2008},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.062781Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:74c9c56cd03a7b03d05bfd15dc105b6f360578dbaeb76ecc5a26edc028bb2338","observation_id":"0c039649-772b-4577-ad6a-d68682f169db","resolution":{"observed_at":"2026-08-15T17:23:09.430563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07700","last_updated":"2023-10-11T17:51:28Z","snapshot_observed_at":"2026-08-16T14:52:58.339560Z","submitted_at":"2023-10-11T17:51:28Z","title":"Knowledge-enhanced Memory Model for Emotional Support Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07700","snapshot_observed_at":"2026-08-15T17:23:08.071018Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.071018Z"},"links":{"cited_paper":"/paper/2310.07700","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:8714c90fe378527758bb85095d07b6427ee58ab07d961e802f1cf944f7016aee","observation_id":"b7a766de-bd57-435d-bcea-2c346f7ce583","resolution":{"observed_at":"2026-08-15T17:23:08.071018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-15T17:23:08.081427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.081427Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:805afd798d92f2c4ac2e4568c476c57ec5365066760fc240a58d58be099f155e","observation_id":"72cbd58d-bebe-4ffc-b2fa-deb17b876f24","resolution":{"observed_at":"2026-08-15T17:23:08.081427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.090372Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.090372Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:368a86af8fb2c3e8572d7ee20d0387fc2a47c610557b31090cdbdda41356c2d4","observation_id":"7367b818-af0c-40c6-a40a-74afbe1468d8","resolution":{"observed_at":"2026-08-15T17:23:08.090372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.097303Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.097303Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:77393f0237b37a3a18ca3d01d3208f885c3b5c0580ee031a8f88923a1a1947eb","observation_id":"6f2ca1e8-b7f5-4d1e-a4d3-d76284b3bc0b","resolution":{"observed_at":"2026-08-15T17:23:08.097303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.395136Z","title":null,"venue":null,"work_id":"f9e9ddf3-78d2-421e-b32e-096b6b0d3ab1","year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.103251Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c4cbd115768e020f5468fd2e3c154b607969e552c915b68c7039c6ae0db28cc3","observation_id":"52ceacb1-ceea-4f53-9b07-833cfc9aa726","resolution":{"observed_at":"2026-08-15T17:23:09.403450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12749","last_updated":"2022-11-08T09:00:13Z","snapshot_observed_at":"2026-08-16T17:04:17.774100Z","submitted_at":"2022-04-27T07:43:29Z","title":"Control Globally, Understand Locally: A Global-to-Local Hierarchical Graph Network for Emotional Support Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12749","snapshot_observed_at":"2026-08-15T17:23:08.109938Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.109938Z"},"links":{"cited_paper":"/paper/2204.12749","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:94ea50db906494c3af43e75bbce121086d22a167089f5c0672ce8f4f09dcf757","observation_id":"4cc495fb-8272-4291-906b-d462379d8bce","resolution":{"observed_at":"2026-08-15T17:23:08.109938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.119974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.119974Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:56ca82a307dce5e5d842c81cf436bd3575bdd62e112e32ddbdb55617a8cf819a","observation_id":"a05c2539-e36f-4540-8710-2ef59ed44112","resolution":{"observed_at":"2026-08-15T17:23:08.119974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.130981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.130981Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:5cd88f40a59f1e52f0d8bf7b70b979a4ecc68b80b8984b1cb59506abc3f6b5bb","observation_id":"9c220708-3d9d-47d9-9a84-2c92d32cd5c6","resolution":{"observed_at":"2026-08-15T17:23:08.130981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17795","last_updated":"2025-05-23T12:12:40Z","snapshot_observed_at":"2026-08-17T08:13:09.624280Z","submitted_at":"2025-05-23T12:12:40Z","title":"DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors","version":1},"cited_work":{"arxiv_id":"2505.17795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17795","snapshot_observed_at":"2026-08-15T17:23:09.081877Z","title":"DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors","venue":"cs.CL","work_id":"29f79e70-5716-4df0-b35c-ce159acca521","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.136883Z"},"links":{"cited_paper":"/paper/2505.17795","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:454da18eb3d0e98e8be720a712de0aeeb954e537b6a30d8d70daaac87aa22e95","observation_id":"a78d4596-083c-4051-995f-b23dc2cc464c","resolution":{"observed_at":"2026-08-15T17:23:09.092186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:23:08.145473Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.145473Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:99918223ad3b821d815204bbfed5268b965f033c9b0ca823a7a428e238b983e3","observation_id":"15b5f6dc-ab3f-4044-a7de-2d282c50d6fb","resolution":{"observed_at":"2026-08-15T17:23:08.145473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T17:23:08.152078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.152078Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:24f7f61449a29fd819600523987d11a2c5c7d1ea6790b914aae4be9e7682a7a7","observation_id":"4661cbb7-9953-4c7a-9c3a-6eea873a13cb","resolution":{"observed_at":"2026-08-15T17:23:08.152078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.159455Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.159455Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:4cb074e64511a08fc9fde5a354aa8d74dd6950e04bf443bf6c41f3e31477889e","observation_id":"cb70ae22-fbf6-4d03-b52c-4789fd24c773","resolution":{"observed_at":"2026-08-15T17:23:08.159455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.08782","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.985007Z","title":null,"venue":null,"work_id":"be59559a-693c-49c6-9965-122372d30f95","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.167143Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c3de91481409c89b26ba3df82bbe608672213e331f599ce34c4190ad41e86066","observation_id":"bdd8397e-9664-45ce-bf94-201cc7a15ba8","resolution":{"observed_at":"2026-08-15T17:23:08.997883Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06987","last_updated":"2025-08-27T08:21:50Z","snapshot_observed_at":"2026-08-15T22:25:42.956574Z","submitted_at":"2025-05-11T14:13:58Z","title":"Convert Language Model into a Value-based Strategic Planner","version":6},"cited_work":{"arxiv_id":"2505.06987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.06987","snapshot_observed_at":"2026-08-15T17:23:08.892937Z","title":"Convert Language Model into a Value-based Strategic Planner","venue":"cs.CL","work_id":"2b544cd1-66b3-4c6e-ad90-e41976d5ce53","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.174160Z"},"links":{"cited_paper":"/paper/2505.06987","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:b39c471211a3a47905eb16f6c90ca0c6e7ce8276ae4be1f1863873501ad92216","observation_id":"97a58edc-1278-49a9-af8b-0f32bc4bf717","resolution":{"observed_at":"2026-08-15T17:23:08.902534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-15T17:23:08.187202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.187202Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ef24a4c7d8fecfba1cab1260b0ebc83b46aea288efe86a9a18d1dfc6885532d2","observation_id":"cf7d4350-20c7-4229-bbee-5f0d1bb3662f","resolution":{"observed_at":"2026-08-15T17:23:08.187202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-15T17:23:08.194732Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.194732Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:5159c7deb8d84afc5cb700d5eb0f5ad527a6d222023ae4c79955ee297eac7a50","observation_id":"1d8e8fcd-67a8-4b44-9e1f-e6d20bf46ac6","resolution":{"observed_at":"2026-08-15T17:23:08.194732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18013","last_updated":"2025-08-15T03:28:39Z","snapshot_observed_at":"2026-08-16T14:14:41.393057Z","submitted_at":"2024-02-28T03:16:44Z","title":"A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18013","snapshot_observed_at":"2026-08-15T17:23:08.202344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.202344Z"},"links":{"cited_paper":"/paper/2402.18013","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:8e6eca4aad882c8e1da1ba02f9da059f6d198c63941ba0292a685fc8416ce199","observation_id":"caf9c035-6335-4b0b-a0fe-0283d8e4c754","resolution":{"observed_at":"2026-08-15T17:23:08.202344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.210664Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.210664Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ee869706cd516c94930ff01e2d5b133db5ebc21e3bb41deaf988b345b11881fb","observation_id":"a3034d0f-6934-4213-b3ec-b482a5ad0973","resolution":{"observed_at":"2026-08-15T17:23:08.210664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.218728Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.218728Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:69746b973f8e7f0826632b787a22daf2ae2c510761011bdde7b27805fad5553c","observation_id":"db432616-d80b-42ad-a10f-a970d1b668ed","resolution":{"observed_at":"2026-08-15T17:23:08.218728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.228856Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.228856Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:d11eb92f552a3dea0d86fb47794c8f798075a1c245bd34734089cbb6077d08fb","observation_id":"40f65c50-beea-4fb2-99be-3dfd909cc19f","resolution":{"observed_at":"2026-08-15T17:23:08.228856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.234483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.234483Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:1e3935c0e6df96508061ce7c9d6c7303a2025a27835a805081d4c88fe9720fa7","observation_id":"f3b0b9a7-f180-461e-b2e5-7c1c16b0c9b4","resolution":{"observed_at":"2026-08-15T17:23:08.234483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.240307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.240307Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:f19312c6def7835514c239efc8d710c47f58147457b2040f9c4a35f08530328e","observation_id":"d158ef72-66d3-490f-8b6b-e8b1fd4206e4","resolution":{"observed_at":"2026-08-15T17:23:08.240307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09582","last_updated":"2023-04-19T11:42:40Z","snapshot_observed_at":"2026-08-16T15:39:18.815056Z","submitted_at":"2023-04-19T11:42:40Z","title":"Is ChatGPT Equipped with Emotional Dialogue Capabilities?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09582","snapshot_observed_at":"2026-08-15T17:23:08.246157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.246157Z"},"links":{"cited_paper":"/paper/2304.09582","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6ae327f6b2c06132a598ef871404308f201d285b5923ebc43d401a1d2761460d","observation_id":"2d35f0ac-6e65-46a6-9452-277cffeea485","resolution":{"observed_at":"2026-08-15T17:23:08.246157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.254565Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.254565Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:9bfbdb415d86bbefa6bd709ebc9664a90488bdb44241074112a2b135c56edd60","observation_id":"057fdc77-3d9f-4243-a36b-6ee5ce92b7ae","resolution":{"observed_at":"2026-08-15T17:23:08.254565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11584","last_updated":"2023-08-17T10:49:18Z","snapshot_observed_at":"2026-08-16T15:07:51.919859Z","submitted_at":"2023-08-17T10:49:18Z","title":"Building Emotional Support Chatbots in the Era of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11584","snapshot_observed_at":"2026-08-15T17:23:08.262052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.262052Z"},"links":{"cited_paper":"/paper/2308.11584","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:e34aa589b833f2c4dcaa09f57413faafdd19c9fcb46a6c0ac98abc6579cc4a26","observation_id":"83ef3e5d-136b-4901-87d2-b402e1e92c46","resolution":{"observed_at":"2026-08-15T17:23:08.262052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.267615Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.267615Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:deb01961ee7d87e9704115487855f8ae8d6faa29fb01b2f24ddb9766c1ecbfa9","observation_id":"53ca47ee-4a2c-49e5-a426-528040c49908","resolution":{"observed_at":"2026-08-15T17:23:08.267615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.276030Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.276030Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c03a79717883036799490f63282d5efd3d0b1c59620bb7bdeb6dd6fcd7382b63","observation_id":"a715afce-975e-46a6-8be3-788593b3d03a","resolution":{"observed_at":"2026-08-15T17:23:08.276030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T08:13:09.047469Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2508.12935."}