{"as_of":"2026-08-22T06:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a57724e28eb4180d24356b29dc310fc76b4471b6a7952f97c10076b40faecf6f","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:55:38.734605Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:48:42.025933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T15:11:10.856386Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"cited_work":{"arxiv_id":"2509.06283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06283","snapshot_observed_at":"2026-07-05T15:11:10.856386Z","title":"Sfr-deepresearch: Towards effective reinforcement learning for autonomously reasoning single agents","venue":"cs.AI","work_id":"8988474d-9090-48ec-a926-1c4c3bbeb1b8","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":289,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2509.06283","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:ee3cbfcf39dff790c6665213d795a7f853b8980eb58540fd1b4fd72ad6b5a4f8","observation_id":"43fac9e8-f59f-4309-a598-e273cd7bff31","resolution":{"observed_at":"2026-05-18T19:21:48.089808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06283","snapshot_observed_at":"2026-08-04T08:48:42.025933Z","title":"Sfr-deepresearch: Towards effective reinforcement learning for autonomously reasoning single agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18939","last_updated":"2026-07-14T02:30:28Z","snapshot_observed_at":"2026-08-13T23:50:37.737578Z","submitted_at":"2025-10-21T17:58:45Z","title":"Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T08:48:42.025933Z"},"links":{"cited_paper":"/paper/2509.06283","citing_paper":"/paper/2510.18939"},"observation_digest":"sha256:b00a2b8f96973d70be65a3686d47e6f03a90cb3b81ef5a6d6296b55232385153","observation_id":"d7e92b7d-3697-4d93-9b3e-5474dbeedd6e","resolution":{"observed_at":"2026-08-04T08:48:42.025933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"cited_work":{"arxiv_id":"2509.06283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06283","snapshot_observed_at":"2026-07-05T15:11:10.856386Z","title":"Sfr-deepresearch: Towards effective reinforcement learning for autonomously reasoning single agents","venue":"cs.AI","work_id":"8988474d-9090-48ec-a926-1c4c3bbeb1b8","year":2025},"citing_paper":{"arxiv_id":"2511.11793","last_updated":"2026-04-21T16:02:11Z","snapshot_observed_at":"2026-08-14T05:17:40.668746Z","submitted_at":"2025-11-14T18:52:07Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T21:44:18.744201Z"},"links":{"cited_paper":"/paper/2509.06283","citing_paper":"/paper/2511.11793"},"observation_digest":"sha256:0adcbcac803e7a5bf323dedec896f8dd83d5f25bc5982b14af455a028682dc86","observation_id":"c64481b9-d429-4109-a892-fac6de8f8057","resolution":{"observed_at":"2026-05-17T21:45:17.902577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"cited_work":{"arxiv_id":"2509.06283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06283","snapshot_observed_at":"2026-07-05T15:11:10.856386Z","title":"Sfr-deepresearch: Towards effective reinforcement learning for autonomously reasoning single agents","venue":"cs.AI","work_id":"8988474d-9090-48ec-a926-1c4c3bbeb1b8","year":2025},"citing_paper":{"arxiv_id":"2604.17931","last_updated":"2026-07-01T16:44:57Z","snapshot_observed_at":"2026-08-20T23:15:21.282567Z","submitted_at":"2026-04-20T08:11:09Z","title":"LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-05T15:03:50.420072Z"},"links":{"cited_paper":"/paper/2509.06283","citing_paper":"/paper/2604.17931"},"observation_digest":"sha256:543378f8a4f711712294cae393f7fc835b7e8e4e2ba7727f07fe6cbd65a9434e","observation_id":"b01e0d67-d5da-4a6a-8b09-5631a4e29744","resolution":{"observed_at":"2026-07-05T15:11:10.858577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"cited_work":{"arxiv_id":"2509.06283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06283","snapshot_observed_at":"2026-07-05T15:11:10.856386Z","title":"Sfr-deepresearch: Towards effective reinforcement learning for autonomously reasoning single agents","venue":"cs.AI","work_id":"8988474d-9090-48ec-a926-1c4c3bbeb1b8","year":2025},"citing_paper":{"arxiv_id":"2606.03841","last_updated":"2026-06-02T16:20:58Z","snapshot_observed_at":"2026-08-14T18:01:42.346916Z","submitted_at":"2026-06-02T16:20:58Z","title":"EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T09:32:51.765633Z"},"links":{"cited_paper":"/paper/2509.06283","citing_paper":"/paper/2606.03841"},"observation_digest":"sha256:f761a1995bccb3edb65a2512a12ce28aac7c60bdf3ff0973f47688eb1143b23b","observation_id":"2989f097-56e3-408e-8468-03fa761b66fa","resolution":{"observed_at":"2026-07-02T03:56:35.103267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"cited_work":{"arxiv_id":"2509.06283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06283","snapshot_observed_at":"2026-07-05T15:11:10.856386Z","title":"Sfr-deepresearch: Towards effective reinforcement learning for autonomously reasoning single agents","venue":"cs.AI","work_id":"8988474d-9090-48ec-a926-1c4c3bbeb1b8","year":2025},"citing_paper":{"arxiv_id":"2606.10684","last_updated":"2026-06-09T10:40:55Z","snapshot_observed_at":"2026-08-16T22:54:38.424124Z","submitted_at":"2026-06-09T10:40:55Z","title":"Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T14:23:06.932530Z"},"links":{"cited_paper":"/paper/2509.06283","citing_paper":"/paper/2606.10684"},"observation_digest":"sha256:83478b13bc16256e258da9ccf50bc325507febd63f47b5c78582860876548956","observation_id":"a8d41468-a08f-4be4-98fc-b5866c6e64c1","resolution":{"observed_at":"2026-07-03T03:57:38.327066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06283/citation-record","integrity":"/paper/2509.06283/integrity","json":"/paper/2509.06283/citation-record.json","paper":"/paper/2509.06283"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-04T23:55:37.706182Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.706182Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:0f77898a5c07cb484bf58353484f87f872063598338cb78eafb101dd5693353e","observation_id":"556dd4b0-eeac-47b2-b240-88876f1a0a2b","resolution":{"observed_at":"2026-08-04T23:55:37.706182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-04T23:55:37.711661Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.711661Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:69d53c001f694776dac14a2eeef6e61a8bcd158a6a44c9b40e3bc880d51b1b1d","observation_id":"2304a2d2-ab78-47ad-9972-0abd7ef86a24","resolution":{"observed_at":"2026-08-04T23:55:37.711661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20201","last_updated":"2025-03-26T03:51:32Z","snapshot_observed_at":"2026-08-20T12:09:39.887157Z","submitted_at":"2025-03-26T03:51:32Z","title":"Open Deep Search: Democratizing Search with Open-source Reasoning Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20201","snapshot_observed_at":"2026-08-04T23:55:37.716627Z","title":"Open deep search: Democratizing search with open-source reasoning agents.arXiv preprint arXiv:2503.20201, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.716627Z"},"links":{"cited_paper":"/paper/2503.20201","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:15d1a8d876eaad93eb497cc6d6b99cabae2f8092951f6ad2394f7186e98d94cd","observation_id":"9c4b1357-78e4-46a9-9a29-58a20e0c6eaa","resolution":{"observed_at":"2026-08-04T23:55:37.716627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:37.721667Z","title":"A survey on rag with llms.Procedia computer science, 246:3781–3790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.721667Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:0696422821e49bc2785152eb2aa4fea13e16fdf4b01abd2058d053be94c25eed","observation_id":"4f2ca88e-e8ab-4202-9231-a75aaafd9225","resolution":{"observed_at":"2026-08-04T23:55:37.721667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:37.726230Z","title":"Mindsearch: Mimicking human minds elicits deep ai searcher.arXiv preprint arXiv:2407.20183, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.726230Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:132203bf09b646fd5aab4ed84fe0bbe05c9774ceb6b305111b2472685f617f94","observation_id":"bdec6b1e-b6f1-49c5-82ff-c03aa979db81","resolution":{"observed_at":"2026-08-04T23:55:37.726230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23139","last_updated":"2025-06-29T08:34:59Z","snapshot_observed_at":"2026-08-18T02:42:08.066732Z","submitted_at":"2025-06-29T08:34:59Z","title":"Benchmarking Deep Search over Heterogeneous Enterprise Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23139","snapshot_observed_at":"2026-08-04T23:55:37.731166Z","title":"Benchmarking deep search over heterogeneous enterprise data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.731166Z"},"links":{"cited_paper":"/paper/2506.23139","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:0e4c0798707390bc067d255f7a6e6c340e999a126db98897e2975b9805735ebd","observation_id":"9cdfc913-c152-4621-9cd7-ffd49e7a17a2","resolution":{"observed_at":"2026-08-04T23:55:37.731166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-08-14T09:16:00.399049Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-04T23:55:37.736756Z","title":"Agentic reinforced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.736756Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:2413c84b1610904e3178eb517f379594e04e4075ab9adc7dcfb12015f494fd45","observation_id":"bb1f8fa2-b117-40a7-9948-593371d358ff","resolution":{"observed_at":"2026-08-04T23:55:37.736756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T23:55:37.741635Z","title":"Retool: Reinforcement learning for strategic tool use in llms.arXiv preprint arXiv:2504.11536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.741635Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:25c673fad1b1c18bdb4275e14b6c5cc31179a3567303201d764e2dbb90c86964","observation_id":"4c532bec-d396-4af8-bca5-184e04e40f98","resolution":{"observed_at":"2026-08-04T23:55:37.741635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.703345Z","title":"Try deep research and our new experimental model in gemini, your ai assistant","venue":null,"work_id":"0bcf3112-b3cc-454e-b639-b074b4720445","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.746195Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:ba33ac605ed434c4b508aa821e4554e27c634f87949c730b1fa973386e5284af","observation_id":"1aecedd8-ebcb-427e-81ae-6d6372bca32f","resolution":{"observed_at":"2026-08-04T23:55:39.707988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T23:55:37.750975Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.750975Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:2c7cb83d9ef5da37862b34e01656886566bebb516330630642aaca71a39b0ea7","observation_id":"9fcbe86e-28a9-4ce7-ad97-b1ade57395c9","resolution":{"observed_at":"2026-08-04T23:55:37.750975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13180","last_updated":"2025-08-12T22:52:21Z","snapshot_observed_at":"2026-08-15T23:48:18.492614Z","submitted_at":"2025-08-12T22:52:21Z","title":"Search-Time Data Contamination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13180","snapshot_observed_at":"2026-08-04T23:55:37.759521Z","title":"Search-time data contamination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.759521Z"},"links":{"cited_paper":"/paper/2508.13180","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:a6fe9daf3274a421247bf8f2eac49ca70394bf097170c3c589f3220e99391e8c","observation_id":"1bc4a0e3-83bf-42e1-995e-9ea455e02077","resolution":{"observed_at":"2026-08-04T23:55:37.759521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:37.772619Z","title":"Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.772619Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:284033dfb5d68091c8c937526ac9dbb229b410af1e0ef7035cb394c9bb09af1f","observation_id":"47f0b15b-15eb-460c-bf54-2dae793b1fdc","resolution":{"observed_at":"2026-08-04T23:55:37.772619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-04T23:55:37.784908Z","title":"Characterizing deep research: A benchmark and formal definition.arXiv preprint arXiv:2508.04183, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.784908Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:ec7452ec0ba643e8e2edc45e9e2599b006b6b4436d69e2f96793355decbc6218","observation_id":"4dacb85f-9cdc-4029-913b-85458931071d","resolution":{"observed_at":"2026-08-04T23:55:37.784908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T23:55:37.798835Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.798835Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:b68fb657d46f94ae690c854d485f5fa25ad21295c19391b2a919f5eec111a61e","observation_id":"5f4610cf-c874-4f1b-bdf1-02dddb23c70d","resolution":{"observed_at":"2026-08-04T23:55:37.798835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-19T16:36:17.445569Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-08-04T23:55:37.813481Z","title":"Fact, fetch, and reason: A unified evaluation of retrieval-augmented generation.arXiv preprint arXiv:2409.12941, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.813481Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:34cb1da7737506ce3f1c03aaab289b679e99960737741ba69d1ecc39d9c0ca95","observation_id":"11cd8f17-d9da-4a14-93b0-28399a1e1dfe","resolution":{"observed_at":"2026-08-04T23:55:37.813481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.687838Z","title":"Open deep research github","venue":null,"work_id":"8a2c6056-0eac-4174-9909-7eaa336e5607","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.827017Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:0acfec0822bba73418551220f9dd439abf5112c2c4fc24ec489788e34b3c2f0e","observation_id":"f7dc80c9-2381-4982-a1c3-f58a47d0d2be","resolution":{"observed_at":"2026-08-04T23:55:39.692679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-04T23:55:37.844139Z","title":"Websailor: Navigating super-human reasoning for web agent.arXiv preprint arXiv:2507.02592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.844139Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:7be030a5f103d18548bc001fa2d4f47444a0328a3fc3e35c87d395207082b9b4","observation_id":"b0957b8b-f8e2-456b-8c82-272e135b53da","resolution":{"observed_at":"2026-08-04T23:55:37.844139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-08-19T23:01:43.904595Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13167","snapshot_observed_at":"2026-08-04T23:55:37.907213Z","title":"Chain-of-agents: End-to-end agent foundation models via multi-agent distillation and agentic rl.arXiv preprint arXiv:2508.13167, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.907213Z"},"links":{"cited_paper":"/paper/2508.13167","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:3b6c02654256daaea8d50c9347cadf480daffecd5444d71739398433964f3006","observation_id":"dcdc812e-5f22-4df7-b1b8-81b57d114aa0","resolution":{"observed_at":"2026-08-04T23:55:37.907213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-08-15T17:19:59.096854Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-04T23:55:37.973823Z","title":"Search-o1: Agentic search-enhanced large reasoning models.arXiv preprint arXiv:2501.05366, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.973823Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:0128d3a5a4e0dbb7db00fba83031aa1eb3285c16136d81f64c6da74eb723275c","observation_id":"2ae1fb89-5328-4d81-bb50-0f1726832d97","resolution":{"observed_at":"2026-08-04T23:55:37.973823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-04T23:55:38.035851Z","title":"Webthinker: Empowering large reasoning models with deep research capability.arXiv preprint arXiv:2504.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.035851Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:38f74059daaee331a5f5ccbd245cc4e74bd57ee613428ac5620442d5640016e1","observation_id":"27ec85fa-eb31-4f0e-a535-a8228a55399a","resolution":{"observed_at":"2026-08-04T23:55:38.035851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-18T07:08:35.277799Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:55:38.101554Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.101554Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:6d79257bbcf4ee299ef654c9ddf72809535390058ac1c3481fc0b7555ca343e5","observation_id":"e44d5100-5f37-478c-8a4d-474f38a0c806","resolution":{"observed_at":"2026-08-04T23:55:38.101554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:38.174005Z","title":"Openmanus: An open-source framework for building general ai agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.174005Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:4bcf89e0aef1af339186ba7f1efb83ae7354f61d11b11bd1d58c8fd6e6457a57","observation_id":"18f1d8da-4204-4d18-a5a1-75c1911ed184","resolution":{"observed_at":"2026-08-04T23:55:38.174005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18518","last_updated":"2024-06-26T17:49:11Z","snapshot_observed_at":"2026-08-18T11:07:01.553907Z","submitted_at":"2024-06-26T17:49:11Z","title":"APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18518","snapshot_observed_at":"2026-08-04T23:55:38.242749Z","title":"Apigen: Automated pipeline for generating verifiable and diverse function-calling datasets.arXiv preprint arXiv:2406.18518, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.242749Z"},"links":{"cited_paper":"/paper/2406.18518","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:5af1f15d58e49255c8db33eb1c5591bacb3935bab51080176e0825c661a99fe5","observation_id":"201cd6c1-3ec3-4890-b5e3-f4830eae074a","resolution":{"observed_at":"2026-08-04T23:55:38.242749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:38.372992Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.372992Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:162fa62206caf1c1e6ba333a9cc7efe20d33edbcc6986c7db07c42fd38ab3e21","observation_id":"b96554e1-13b7-4d1d-a4c2-1b88cbf1d2e1","resolution":{"observed_at":"2026-08-04T23:55:38.372992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.659357Z","title":"Miromind open deep research","venue":null,"work_id":"13807b5a-c170-472b-af48-a012bb3f10ed","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.439572Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:2c5318756e08d28e82391b5a20a0a6dc58fbbee371b58205a9f0757b7fc7dbc8","observation_id":"08a0fcf2-eee7-420a-a8e9-f4518f11d5e9","resolution":{"observed_at":"2026-08-04T23:55:39.663862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.641720Z","title":"Kimi-researcher: End-to-end rl training for emerging agentic capabilities","venue":null,"work_id":"c0572d73-072f-4e6b-bdee-4eb52e515489","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.511229Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:6d7594f22d454432ee11c68c6f135c4613632654c7b4acecc289627992e10e80","observation_id":"d193feae-a9c3-4020-b05e-9089673fefd0","resolution":{"observed_at":"2026-08-04T23:55:39.647652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09916","last_updated":"2024-09-16T01:08:18Z","snapshot_observed_at":"2026-08-16T13:18:21.348624Z","submitted_at":"2024-09-16T01:08:18Z","title":"SFR-RAG: Towards Contextually Faithful LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09916","snapshot_observed_at":"2026-08-04T23:55:38.553494Z","title":"Sfr-rag: Towards contextually faithful llms.arXiv preprint arXiv:2409.09916, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.553494Z"},"links":{"cited_paper":"/paper/2409.09916","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:ab0a58327a3a77241c258c48cd940a475206429c8d88c1044b2858603368b336","observation_id":"8c76193a-9380-4d52-96be-cc508fc38800","resolution":{"observed_at":"2026-08-04T23:55:38.553494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.624388Z","title":"Gpt-5 system card","venue":null,"work_id":"cb0b20a9-1c93-407e-8c7c-d858ba4c5072","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.619294Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:ab5dfa24fe97423bfc78e810d7c5c677ef463d51fab4a4a4d72675d953f9b83f","observation_id":"0a6288bf-87fe-4713-b27b-e4e87c40e12d","resolution":{"observed_at":"2026-08-04T23:55:39.629046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.606930Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"7c8bcf6b-9832-49d5-9ed5-efae185e6d04","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.623921Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:527af05b90a4e434abf7de90a58d0f4c414dc09842d6ca1a05a9514dbdb7105b","observation_id":"ab292b9c-057c-4cfb-93d9-485bc0db0d26","resolution":{"observed_at":"2026-08-04T23:55:39.612067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.591551Z","title":"Deep research system card","venue":null,"work_id":"edccf194-11e7-44fd-81e8-52581d29e8de","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.628320Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:647dea96c78dd171c844105b41cd0318076bc872c9d245daef8bdaa2b0dbea2c","observation_id":"0b7c8aca-cdcf-424d-a383-096e779aeb92","resolution":{"observed_at":"2026-08-04T23:55:39.595846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.576480Z","title":"Training powerful llm agents with end-to-end reinforcement learning, 2025","venue":null,"work_id":"4050fc07-8527-4b38-b5cd-ba22f35268ab","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.632746Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:adbed1d343b73edaa8db27d412d86af1e7b058b1316066d36a393219894ff9a9","observation_id":"39c9a6dd-caea-4804-8c19-dbb3e0fca7c2","resolution":{"observed_at":"2026-08-04T23:55:39.581295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.560584Z","title":"Introducing perplexity deep research","venue":null,"work_id":"a5098b21-79df-4f58-a499-0a382335a032","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.637193Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:beb74d9a17caa9c6a144d80d5929276a4d236cd189bdcff8951618509d9c63f7","observation_id":"6672358b-388b-4097-809c-69c1f972f419","resolution":{"observed_at":"2026-08-04T23:55:39.565235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-04T23:55:38.641664Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.641664Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:d985a0fbf04e2ecbf69a113c5ee128b61b7cf14055f598e9aaa24c324fdd5287","observation_id":"2ce42c27-37fa-4e47-b93d-f7bf0d47e88d","resolution":{"observed_at":"2026-08-04T23:55:38.641664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-04T23:55:38.646033Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.646033Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:8680a7723183819d99b4db2fc63a611f07320fc390b48299d0d2db783a38915d","observation_id":"01d27b3b-770e-44f8-901f-9e23d6022008","resolution":{"observed_at":"2026-08-04T23:55:38.646033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19054","last_updated":"2024-10-24T18:01:28Z","snapshot_observed_at":"2026-08-19T18:48:43.024285Z","submitted_at":"2024-10-24T18:01:28Z","title":"Infogent: An Agent-Based Framework for Web Information Aggregation","version":1},"cited_work":{"arxiv_id":"2410.19054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19054","snapshot_observed_at":"2026-08-04T23:55:39.062655Z","title":"Infogent: An Agent-Based Framework for Web Information Aggregation","venue":"cs.AI","work_id":"8fe4a097-3c67-4711-843d-58150308554e","year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.650650Z"},"links":{"cited_paper":"/paper/2410.19054","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:81792155c71a8be857059cdc6a57f998bcbc694a88d2b2825108ba57c5509d22","observation_id":"573eb4d8-919a-42b3-b9a7-f4a316fbadf8","resolution":{"observed_at":"2026-08-04T23:55:39.069219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16150","last_updated":"2026-03-27T07:41:10Z","snapshot_observed_at":"2026-08-21T00:51:55.013609Z","submitted_at":"2025-01-27T15:44:02Z","title":"A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16150","snapshot_observed_at":"2026-08-04T23:55:38.655374Z","title":"Ai agents for computer use: A review of instructionbased computer control, gui automation, and operator assistants.arXiv preprint arXiv:2501.16150, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.655374Z"},"links":{"cited_paper":"/paper/2501.16150","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:aec130c6c03a6171b832121609b43dc14cfb17b8cc309685f15c36050f7cec0a","observation_id":"cbc5e7d0-1a9f-4078-8ac9-0e73c1fea282","resolution":{"observed_at":"2026-08-04T23:55:38.655374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T23:55:38.659793Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.659793Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:9084f92295a0e27ddc9893e40e404f818584470e1da5bc228f74d6ed04f6fc25","observation_id":"accfd666-2cbb-45af-b544-ae9267e41775","resolution":{"observed_at":"2026-08-04T23:55:38.659793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T23:55:38.664357Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.664357Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:490cc0a9408a9760a2580e4afc1d39ebb6292c0dea333dca41cc3a6d6d163f80","observation_id":"d799053a-5fc0-4899-81d5-7c5721de4bfb","resolution":{"observed_at":"2026-08-04T23:55:38.664357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15061","last_updated":"2025-07-20T17:53:37Z","snapshot_observed_at":"2026-08-14T03:54:33.678437Z","submitted_at":"2025-07-20T17:53:37Z","title":"WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15061","snapshot_observed_at":"2026-08-04T23:55:38.669645Z","title":"Webshaper: Agentically data synthesizing via information-seeking formalization.arXiv preprint arXiv:2507.15061, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.669645Z"},"links":{"cited_paper":"/paper/2507.15061","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:1ae3368e5b9496bdd0c352f8f3c825365b536703c7406cb59df68e81f0435255","observation_id":"9a742768-3e2c-4bb6-847c-f3905eb78c54","resolution":{"observed_at":"2026-08-04T23:55:38.669645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-04T23:55:38.675605Z","title":"Kimi k2: Open agentic intelligence.arXiv preprint arXiv:2507.20534, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.675605Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:0576d70f1d10abe4f7ccc1c995b580c26da588e3b91e008e214f118d2c41814e","observation_id":"57ad2de3-9f12-4099-a269-a768eac06bed","resolution":{"observed_at":"2026-08-04T23:55:38.675605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:38.680494Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.680494Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:4db64b0bb73d1bfa52946417ef6dc957614763dee45afc49ca52a94596ba08e1","observation_id":"0aeb0479-c9c6-410d-a767-867b9125d94d","resolution":{"observed_at":"2026-08-04T23:55:38.680494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:38.684858Z","title":"Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning.arXiv preprint arXiv:2505.16421, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.684858Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:63078d22608979ec6692ffa87be34c5865c8e198841fed00dc0dbf99f01f2136","observation_id":"c67ed1eb-141d-4ab0-9e51-34aca1d61fd8","resolution":{"observed_at":"2026-08-04T23:55:38.684858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:38.689376Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning.Machine learning, 8(3):229–256, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.689376Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:247b35af30e6ddc195fccda8a710d802bd8f90b2c64203aa07969565cf7d4c89","observation_id":"0ff5359e-33df-468a-828f-c5c2c23a5954","resolution":{"observed_at":"2026-08-04T23:55:38.689376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-16T02:27:50.910548Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12594","snapshot_observed_at":"2026-08-04T23:55:38.693947Z","title":"A comprehensive survey of deep research: Systems, methodologies, and applications.arXiv preprint arXiv:2506.12594, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.693947Z"},"links":{"cited_paper":"/paper/2506.12594","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:841d990462ec24cb1f5796efa81f4630824d477b43575c9706a386a031a47f28","observation_id":"aa69e0b8-42bc-40d0-9a86-17b090bdf7d7","resolution":{"observed_at":"2026-08-04T23:55:38.693947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.523642Z","title":"Simpletir: End-to- end reinforcement learning for multi-turn tool-integrated reasoning","venue":null,"work_id":"1df0ca5f-b2a9-4dd6-ae6f-a5a59b8db660","year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.698479Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:a805cddfff05b4437ea40a278df166e1476e9c20622674f1e4a451334b348918","observation_id":"41d373ae-bc12-4996-aec3-9f18b32aa864","resolution":{"observed_at":"2026-08-04T23:55:39.528751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T23:55:38.702802Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.702802Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:1fb137d13a7fc4aebe6cd7aba284b16e08c43a7ef9e07b6bebe277dca145badd","observation_id":"2cce8f09-d5e8-4da4-991b-772f91bade9b","resolution":{"observed_at":"2026-08-04T23:55:38.702802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T23:55:38.707272Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.707272Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:93ae109d6a3ba4524a729042f28d9f129aada8e49dabcb4024091e726a060ed7","observation_id":"920c0cf4-e4c3-4c43-aad7-994578339158","resolution":{"observed_at":"2026-08-04T23:55:38.707272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:38.711820Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.711820Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:ab733670f24b1df936d488a8fa30568f5637767a2650f608ec1b8b7f00de823e","observation_id":"068c808d-451e-43f2-bf59-8bc47270f5b2","resolution":{"observed_at":"2026-08-04T23:55:38.711820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T23:55:38.716073Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.716073Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:60aad7a2cf8a7dd1430fbf8e14064f74b1f1c85382a0759070c322fc5cb066f6","observation_id":"5810b7ed-efcf-4f3d-893e-9a391375bf96","resolution":{"observed_at":"2026-08-04T23:55:38.716073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T23:55:38.720546Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.720546Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:57f8c6e2767ac71c3cb031ad1c5bbc2fe759c20ceea767d66c04611147f1aac9","observation_id":"b6bd401b-f6eb-4c37-9660-28cbd0042548","resolution":{"observed_at":"2026-08-04T23:55:38.720546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12508","last_updated":"2026-05-28T07:38:36Z","snapshot_observed_at":"2026-08-19T20:26:50.354808Z","submitted_at":"2025-06-14T13:45:37Z","title":"AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12508","snapshot_observed_at":"2026-08-04T23:55:38.725026Z","title":"Agentorchestra: A hierarchical multi-agent framework for general-purpose task solving.arXiv preprint arXiv:2506.12508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.725026Z"},"links":{"cited_paper":"/paper/2506.12508","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:a5f802e4d1dc67ce1e976af7ef4558390c7204f6bc2b4e6566abe229ce1e5b6f","observation_id":"0faf9576-456a-43bb-9b57-b8aeb3a084db","resolution":{"observed_at":"2026-08-04T23:55:38.725026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-04T23:55:38.730193Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.730193Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:eede3f40cae2dc6d65787f7583cce4ff4565587b8eff9891aac1f235e24242c4","observation_id":"3fa87bd3-b355-42fd-9290-6d99c0869844","resolution":{"observed_at":"2026-08-04T23:55:38.730193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:55:39.497067Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583, 2024","venue":null,"work_id":"d51c2a4b-5589-439e-8da8-0ba56c661925","year":2024},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.734605Z"},"links":{"citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:4c3721b68a04d9f5ca983536b4181f02bf01fd616d4cc4f793bb465e28406f46","observation_id":"ab21033a-882b-4c3c-8ad4-d2e676b3465b","resolution":{"observed_at":"2026-08-04T23:55:39.501969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 6 inbound Pith citation observations for arXiv:2509.06283."}