{"as_of":"2026-08-04T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ac09cb0963c8bbbd77f53fe97230292b11fcd48057f2ec91ee5e080ff6f7152","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:44:33.432754Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25369/citation-record","integrity":"/paper/2607.25369/integrity","json":"/paper/2607.25369/citation-record.json","paper":"/paper/2607.25369"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T02:44:29.030089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.030089Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:3a857cc797e33383f512e293051324b2882c0ab95fcb63c4a12fb858d60fdfc9","observation_id":"58f3f583-70bc-4a8e-9769-6e73fadbce18","resolution":{"observed_at":"2026-08-01T02:44:29.030089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T02:44:29.142384Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.142384Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:f1782bb3fc37ad0c8b23a04c23e1fa123fae12d306b20112839e4dfa111f3255","observation_id":"15a77535-4fa7-4cce-8d30-7cc0e1a9d627","resolution":{"observed_at":"2026-08-01T02:44:29.142384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:29.254075Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.254075Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:2a6a9da6e3054205ae52d445b85238199efcba58ce16ad4a488d36746aef0ffe","observation_id":"e6014760-aaad-43d8-afac-a648af427baa","resolution":{"observed_at":"2026-08-01T02:44:29.254075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-01T07:39:12.092512Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-01T02:44:29.355941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.355941Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:d4568cd802a016e9eaab60ddf0aa0bd4e4c575fe88c642cfc44cca08949ffed7","observation_id":"212faca4-28ac-4214-93c4-009490a9726b","resolution":{"observed_at":"2026-08-01T02:44:29.355941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:29.468395Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.468395Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:d5923274c3941efb6942358aa67bbaac366eb092ef380cdd582e633b66e33fb1","observation_id":"66d0f88d-5d33-4e42-bb02-4fd408dc819e","resolution":{"observed_at":"2026-08-01T02:44:29.468395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T02:44:29.578227Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.578227Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:9b04813357fbbc1caee0cc914381aa1a4fad565997e9d8de284a9ebb659d42ae","observation_id":"2c8899e8-849c-475b-95ac-088f14c3c23b","resolution":{"observed_at":"2026-08-01T02:44:29.578227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:29.653544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.653544Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:7791586e305cdac8d1776a639da517ef42100ab0d0be8454bee4b0c8d4cbe9cc","observation_id":"0fe7d395-8db0-4109-96b0-e308c5d50ef1","resolution":{"observed_at":"2026-08-01T02:44:29.653544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-07-06T19:46:06.343310Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-01T02:44:29.873290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.873290Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:86a214c30ee0f67620259716399933fa8d728fc8394f7cc4e1a71c144c0753ad","observation_id":"c2808dcb-3851-44b4-bd24-dd3d3550767a","resolution":{"observed_at":"2026-08-01T02:44:29.873290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:29.974453Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.974453Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:20a863b02b78201ee2e2ba22ada3842fb056e4da7c6210c58feefe55d636ec8b","observation_id":"ee2297b6-fc2e-4a24-a527-71498abb493e","resolution":{"observed_at":"2026-08-01T02:44:29.974453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-01T02:44:30.092180Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.092180Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:c349ba54fa6de949ba4e6ac9fca137f5635f2515a0fea1836e265ca11840ff1b","observation_id":"40ce625e-4d6b-4884-b8bc-3a84d544f609","resolution":{"observed_at":"2026-08-01T02:44:30.092180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.232639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.232639Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:34b45eea821de3d895670cb2ceaf14c38010732b43f0a9baaa90c6228962072a","observation_id":"71d403d3-eda2-4fc8-a613-73c58194ca33","resolution":{"observed_at":"2026-08-01T02:44:30.232639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.342917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.342917Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:31315b7ddcc5d8ddea7ffcd768353e428fb35ef8a8d3cddf4b45aaa4091be299","observation_id":"880bd765-69b8-4ad1-b4f0-c7c87fd570b7","resolution":{"observed_at":"2026-08-01T02:44:30.342917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.380852Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.380852Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:2554efc7c9ca9e32ba7a0dddb170b50dfdd16adddee7297ba3641e24db9fca47","observation_id":"388dcb4c-d70e-42b3-9bd3-dececbbff4de","resolution":{"observed_at":"2026-08-01T02:44:30.380852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.449127Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.449127Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:3d509819e9f4ad27ea85295a3513eadc8a3ff7af5555e81bbc9217a31009f2ad","observation_id":"ee12d701-c700-437b-83dd-c7063ba2cbfd","resolution":{"observed_at":"2026-08-01T02:44:30.449127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-01T02:44:30.487990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.487990Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:a4c191fe0860df9f6ba478aef4cbff805127ace1a1661c6886a004b2bbceb521","observation_id":"2c282ac1-3a35-4f29-a61f-aafcc247f28b","resolution":{"observed_at":"2026-08-01T02:44:30.487990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03731","last_updated":"2026-05-03T08:05:20Z","snapshot_observed_at":"2026-07-06T22:40:56.386532Z","submitted_at":"2026-01-07T09:22:28Z","title":"From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03731","snapshot_observed_at":"2026-08-01T02:44:30.559900Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.559900Z"},"links":{"cited_paper":"/paper/2601.03731","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:e0bbe4d5b5eeb1e683888fca747ad987a32c65fe0a3d660b108b244ed7cbf565","observation_id":"ec876918-15e4-4592-8e12-99592aa3cfcd","resolution":{"observed_at":"2026-08-01T02:44:30.559900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-01T02:44:30.630565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.630565Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:f74722e2c5dba4e81e71c54465ee33781a211862a2466ab63d2671b1cb18c4d7","observation_id":"6fa4f9bb-57a3-4eae-8f77-8758f82df654","resolution":{"observed_at":"2026-08-01T02:44:30.630565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.704787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.704787Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:a8952d61ffe83b1680690179a56f737b6fba4238c3de9d359a3ecfd54f862f18","observation_id":"eece9899-17b5-4219-ac0b-587ba4dfd51b","resolution":{"observed_at":"2026-08-01T02:44:30.704787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.747447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.747447Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:61415259ccaa0d75492c8ddcab848d84ad8c4aada49e0e4b73e866cbe587c820","observation_id":"9960dda1-b0ef-4a73-ad1e-49e17baeccdf","resolution":{"observed_at":"2026-08-01T02:44:30.747447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-01T02:44:30.818457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.818457Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:1f3c1ff135a8dc627af3a36f2283af9aec73f507fb97c6cb1507418a260adfbb","observation_id":"157abbdd-6fb9-4ddb-b113-ac938e7bf219","resolution":{"observed_at":"2026-08-01T02:44:30.818457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:30.917786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.917786Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:d7b2cbc49276ba6ec2449325c1198c074ee4e70ee93c619bdcca2386d022a027","observation_id":"73398d19-4860-4aa9-84e5-9c476ca629a8","resolution":{"observed_at":"2026-08-01T02:44:30.917786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05765","last_updated":"2026-05-21T06:55:40Z","snapshot_observed_at":"2026-08-02T16:12:02.844781Z","submitted_at":"2026-05-07T06:58:34Z","title":"X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05765","snapshot_observed_at":"2026-08-01T02:44:30.959960Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:30.959960Z"},"links":{"cited_paper":"/paper/2605.05765","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:18eecfc9458cb367ccb4e67807179a3cce3b7308d9cee8e175bf651cd351db68","observation_id":"f7d06e82-c850-44e9-81cf-6b54fed0c298","resolution":{"observed_at":"2026-08-01T02:44:30.959960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.029300Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.029300Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:9a506589a0fa216ad5346d4ad1479e1430157978e5cef831a9a67a22cd65388c","observation_id":"91497f2d-7e15-4fbb-b50f-cee25b30a192","resolution":{"observed_at":"2026-08-01T02:44:31.029300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.102170Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.102170Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:dd58d5857b4d7cfb1e7fdf5991c27131f62e3b6c584023f91ea1496355bbb782","observation_id":"4afd7b9c-59bf-44ab-a362-c5a946216c51","resolution":{"observed_at":"2026-08-01T02:44:31.102170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.319484Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.319484Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:51c66e5aa967002a49ee1e90510bb45977975a5403a5ff2dc85bb2c579769fcb","observation_id":"7b63ecdf-9291-4b39-92cf-eb54e93d250e","resolution":{"observed_at":"2026-08-01T02:44:31.319484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T02:44:31.427858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.427858Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:0646e698f814b809ce38881434a42299e8294b1204652533f1986b370db7d06e","observation_id":"4b2c6bd0-cc90-4cb9-a844-6e61c5acfdb7","resolution":{"observed_at":"2026-08-01T02:44:31.427858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-01T16:50:48.509250Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-01T02:44:31.519890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.519890Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:ec103db203bf2046b4e41b45209fd824a53be3018986d472531b28900d725d01","observation_id":"e864c572-b28a-4bf4-bf8f-900a67cd20d8","resolution":{"observed_at":"2026-08-01T02:44:31.519890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.607597Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.607597Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:7b012873dd0eb27931682a989fce5550f10e2772448bc968b40c52d07b710b2d","observation_id":"a2a54a8e-37d7-4566-a743-38c3d5bdfa09","resolution":{"observed_at":"2026-08-01T02:44:31.607597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.741806Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.741806Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:78ef071ebcc5038e42cb811cc70d4c9a11b5c67ec7137b33e8c745566dbc683e","observation_id":"773a5ffb-195f-4335-af1b-349e45e0d3b1","resolution":{"observed_at":"2026-08-01T02:44:31.741806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.932750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.932750Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:e2e707a9be10744bbffd5dbbb43a6cd21b1b8ebb8bd0fd3e8c605711bcc1e129","observation_id":"064b171f-b589-4cda-9428-1e1d2bb06a69","resolution":{"observed_at":"2026-08-01T02:44:31.932750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10165","last_updated":"2026-05-11T10:03:41Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:59:01Z","title":"OpenClaw-RL: Train Any Agent Simply by Talking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.10165","snapshot_observed_at":"2026-08-01T02:44:32.111226Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.111226Z"},"links":{"cited_paper":"/paper/2603.10165","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:2de7e45298a1eeee21b4ab221ab927f1fc559bf14ae0ab2d384a22a4d304fff5","observation_id":"cb2d267d-00e2-47f7-9aeb-5b1c3b4e103f","resolution":{"observed_at":"2026-08-01T02:44:32.111226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:32.308466Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.308466Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:29e7e07dd69a1349a99fb1004da2f8413596fbcd4f4906ccd8d8c6fe36325327","observation_id":"cb3e8800-5cea-494b-ae26-5caf540394cf","resolution":{"observed_at":"2026-08-01T02:44:32.308466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:32.508057Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.508057Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:f49a7d7b7efd5ee2b8ff41176f0950023d5f1bc6d5111bf464c12082055d4444","observation_id":"945e01cb-44cc-438e-b99b-edd7d0b760b5","resolution":{"observed_at":"2026-08-01T02:44:32.508057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10029","snapshot_observed_at":"2026-08-01T02:44:32.617211Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.617211Z"},"links":{"cited_paper":"/paper/2604.10029","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:40ee6fec1a31ac6360a274cc88f14e831b1f9c39ec2392bf599cc0cbc8e964e7","observation_id":"5ba483d8-be47-44fc-a746-f91a8801b4f8","resolution":{"observed_at":"2026-08-01T02:44:32.617211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:32.737062Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.737062Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:134f05f4a72f2443fb642edf3b7dec704796f6db27123afb3d0483bc9f1bc6cf","observation_id":"9e394e04-c7f0-45bc-8e30-e4f8de9faa4f","resolution":{"observed_at":"2026-08-01T02:44:32.737062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12538","snapshot_observed_at":"2026-08-01T02:44:32.776319Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.776319Z"},"links":{"cited_paper":"/paper/2601.12538","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:a3a23c80805fac28912230ec3cdf76ba5b2771001e0a8b2239eb4f744cd5c95d","observation_id":"c871051c-eac8-464e-be0f-4efce5de4c16","resolution":{"observed_at":"2026-08-01T02:44:32.776319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:32.815219Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.815219Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:51803bf0702f3f1c11ee005c6db4dc05609bc29d42e09a8e1525f505ebebc724","observation_id":"bcf65ac5-2bd4-467b-b53c-074acb317f50","resolution":{"observed_at":"2026-08-01T02:44:32.815219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:32.853689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.853689Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:1bf54fb444d12a1d78622c776259a4a9ba9d79ca8db4f398204d6dce8153b52e","observation_id":"4c98dd14-f00e-461f-bebb-80a32febe6e1","resolution":{"observed_at":"2026-08-01T02:44:32.853689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-01T02:44:32.890559Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.890559Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:7e5811627c443d3a2b8dc197b2557aec75b1122280f4613845f05d2a962a4da1","observation_id":"c09ca760-3772-45a1-80b9-78f678767612","resolution":{"observed_at":"2026-08-01T02:44:32.890559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11565","last_updated":"2024-01-10T14:20:30Z","snapshot_observed_at":"2026-07-06T15:44:38.851931Z","submitted_at":"2023-06-20T14:30:32Z","title":"HomeRobot: Open-Vocabulary Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11565","snapshot_observed_at":"2026-08-01T02:44:32.954619Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.954619Z"},"links":{"cited_paper":"/paper/2306.11565","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:6f52cd5d168a8b59504a02be740d9038083850697b8c988b092473ad14af21c7","observation_id":"3297b684-4248-4c10-8cdf-c7210307d948","resolution":{"observed_at":"2026-08-01T02:44:32.954619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:32.991522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:32.991522Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:f475975c984b609261ff5fa53484fd3939e7dceae9b522b8dbe05a641f061720","observation_id":"b418a0bd-df24-4634-9464-13a4da7c0c8f","resolution":{"observed_at":"2026-08-01T02:44:32.991522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.028513Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.028513Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:a8103e95f690900d4ea80bf79be2a9daa076ad20d5a2733f9ea802c842d12394","observation_id":"106d3082-ea8b-412e-b1ae-1ac231548a4e","resolution":{"observed_at":"2026-08-01T02:44:33.028513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.060330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.060330Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:20df6f963bee119ff19e851514b95e6e5ad50125c6081b0e9ec93b0924871b27","observation_id":"be864231-b730-46a7-acdf-c92c11cabaae","resolution":{"observed_at":"2026-08-01T02:44:33.060330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.092825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.092825Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:48c46b134c42294856aecc717b8aad3210359652984ed737548f73e960a2c7d4","observation_id":"284279d5-12bf-425d-b36c-799523dce73c","resolution":{"observed_at":"2026-08-01T02:44:33.092825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.162251Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.162251Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:aee98679ba0986e81a482720287c4d6743c1b6ca112b72f0660547f935808cf7","observation_id":"20078f02-6ba7-405c-9c0c-58e27ae032b4","resolution":{"observed_at":"2026-08-01T02:44:33.162251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12345","last_updated":"2025-01-21T18:23:42Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T18:23:42Z","title":"The doubly librating Plutinos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12345","snapshot_observed_at":"2026-08-01T02:44:33.192307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.192307Z"},"links":{"cited_paper":"/paper/2501.12345","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:66450d3e8c3be7893ac3a3df205813fffb3115c1a7af7aff70d70726a77396f3","observation_id":"479c00b9-a6ab-4484-b106-ecd04b4ee11d","resolution":{"observed_at":"2026-08-01T02:44:33.192307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.224055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.224055Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:4096aa237efca571ff60b5482c7d221ef4a28404b76c4b23cb816d2525b2e8b7","observation_id":"cbdb7d06-b2f5-4131-94e2-7b3c64c7fe40","resolution":{"observed_at":"2026-08-01T02:44:33.224055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05659","last_updated":"2025-04-11T16:51:59Z","snapshot_observed_at":"2026-07-06T20:48:41.069542Z","submitted_at":"2025-03-07T18:20:30Z","title":"A Survey of Large Language Model Empowered Agents for Recommendation and Search: Towards Next-Generation Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05659","snapshot_observed_at":"2026-08-01T02:44:33.128004Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.128004Z"},"links":{"cited_paper":"/paper/2503.05659","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:7b42d84bca85d3280cb4fa4abba9d2d174152d323f74d6b5dc29aaf3a78c0eae","observation_id":"19789d3d-f449-4af7-a8a8-fa564f4626c9","resolution":{"observed_at":"2026-08-01T02:44:33.128004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-01T02:44:33.307285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.307285Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:ed373ac9671a36c0ac1bc55baa946c02ad25de32c26da272c3b409dc2f20f0e1","observation_id":"19ff2c2a-57ae-48cf-a597-819c5ef15596","resolution":{"observed_at":"2026-08-01T02:44:33.307285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11548","last_updated":"2026-04-13T14:37:53Z","snapshot_observed_at":"2026-08-03T02:13:56.701642Z","submitted_at":"2026-04-13T14:37:53Z","title":"SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11548","snapshot_observed_at":"2026-08-01T02:44:33.316386Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.316386Z"},"links":{"cited_paper":"/paper/2604.11548","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:9c0fe90cc4e512370445177a480c509a0263f430bf19d6087035c6cbc206bbbc","observation_id":"422feada-5b73-4fdc-8002-63a85f8d2062","resolution":{"observed_at":"2026-08-01T02:44:33.316386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-07-06T20:55:32.397101Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-01T02:44:33.291734Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.291734Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:5fd2e5702d1ddc56d3e1e71d1cc3e995752846fe6a3f2ec013213d69cacc60dc","observation_id":"0188d5a1-8c76-42b0-9bc7-0a7d4b590917","resolution":{"observed_at":"2026-08-01T02:44:33.291734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.338196Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.338196Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:7bc8720ad29f17f236d1c476c45f7561bf43f74dbd6fee9708a13dd735234423","observation_id":"8006beff-8efc-4d38-94de-7308fdd69321","resolution":{"observed_at":"2026-08-01T02:44:33.338196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.362229Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.362229Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:7d0ec92d76f743f15794ab298220c3426e21c9f3cae0cc3a046ff30fd141cc5e","observation_id":"ebeefab7-4b2c-4ed8-9225-d7d84263b6b1","resolution":{"observed_at":"2026-08-01T02:44:33.362229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.384019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.384019Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:77f50416d113ba532441cc530995f0e426a9ba99b0b00989b8801eee3cd39bf4","observation_id":"15578491-cf05-434c-8e67-15d42301103b","resolution":{"observed_at":"2026-08-01T02:44:33.384019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.407391Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.407391Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:096ed1dd27797cc9a5467e0fa459e8273e29f8f1794bac9cf056ec06d75e7771","observation_id":"29cdaf4a-0c77-48df-b4d1-b46a3e74bfe3","resolution":{"observed_at":"2026-08-01T02:44:33.407391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:33.432754Z","title":"•Do not output multiple<think>/<answer>blocks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:33.432754Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:9f156d47a02cebaf3009e36a496d9ba400094c74e87c03f4159d188b9d80ad04","observation_id":"00cdaf78-3c0b-40e8-88d5-b60f44f28883","resolution":{"observed_at":"2026-08-01T02:44:33.432754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T02:44:31.212369Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.212369Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:2129711b9683ce64a8a554d39f1afd45ab447569bc75b18ec3444dabd3e07448","observation_id":"f80b8360-9a88-48f3-9601-f6a549bd68e6","resolution":{"observed_at":"2026-08-01T02:44:31.212369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-02T10:10:46.757463Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-01T02:44:29.759049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.759049Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:4b64e46e6f5811a14f4104202a8e17e0753d6496d3c08c5ed5ca5f9823996d14","observation_id":"003a6523-95fe-4860-8329-fc4f1bbafd50","resolution":{"observed_at":"2026-08-01T02:44:29.759049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:44:31.665859Z","title":"InThe Fourteenth International Conference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:31.665859Z"},"links":{"citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:13d794d7e1c50bf97dee636396f1bab6c0571de89965d8839efadecc253643ae","observation_id":"66ea9cd1-ea2b-4dbd-8c5e-76a897a75c15","resolution":{"observed_at":"2026-08-01T02:44:31.665859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.25369."}