{"as_of":"2026-08-11T18:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ded77552a91fb23aeb5a8cc90fb2786b2ba7cf65ddda38d5d588569151e90fde","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:06:00.983061Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.10635/citation-record","integrity":"/paper/2602.10635/integrity","json":"/paper/2602.10635/citation-record.json","paper":"/paper/2602.10635"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-03T01:06:00.132667Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.132667Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:05506147ae7d2dd2bc3d12a989b70cbd7c1738007dc100f999ddc5018b36458b","observation_id":"f12bc8a5-3925-45ee-99b7-148ab2f59cc9","resolution":{"observed_at":"2026-08-03T01:06:00.132667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.272249Z","title":"Constrained dynamical neural ode for time se- ries modelling: A case study on continuous emotion prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.272249Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:cd525cef6ec11a95cf9f5cca35d9e1f9a74f3223e457938f4824e691923f82da","observation_id":"479cb759-e01d-4cdb-a087-77f07b5b330d","resolution":{"observed_at":"2026-08-03T01:06:00.272249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.797049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.797049Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:83c01499a938d90760450c985a1d43f8ed4752839e4ec9aa935da546c8580fb9","observation_id":"f912b035-a23f-4a17-a9c6-22bebdab6706","resolution":{"observed_at":"2026-08-03T01:06:00.797049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.897242Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.897242Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:3b9343d87e1d6669b832ed53ff5361ff26c0a84318feee1f988cd1754e3dedd3","observation_id":"f021cf14-1a22-43d5-a995-c7775c858822","resolution":{"observed_at":"2026-08-03T01:06:00.897242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02553","last_updated":"2020-05-25T16:24:26Z","snapshot_observed_at":"2026-08-11T02:16:51.471401Z","submitted_at":"2018-11-06T18:54:21Z","title":"A Closer Look at Deep Policy Gradients","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02553","snapshot_observed_at":"2026-08-03T01:06:00.370976Z","title":"A closer look at deep policy gradients.arXiv preprint arXiv:1811.02553,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.370976Z"},"links":{"cited_paper":"/paper/1811.02553","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:6dfbb53f67e784ca874be8aa5e965fba49b1327b2b56629ce661b96935c1c1f2","observation_id":"379506dd-ee90-4580-b518-7e1dde57f2bd","resolution":{"observed_at":"2026-08-03T01:06:00.370976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T01:06:00.420234Z","title":"and Ba, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.420234Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:db8d227d818075988003bc2e3387ae1371c5fab68f156d33a6c29c4555d44991","observation_id":"2f0e2477-2c29-4e4e-a905-03477808b965","resolution":{"observed_at":"2026-08-03T01:06:00.420234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.572376Z","title":"Avec 2016: Depression, mood, and emotion recognition workshop and challenge","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.572376Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:17f2af8dfc0b1a8e55a8368809213d254103bef8f13ce0bd31fc67361a27d5f1","observation_id":"31738d9a-f240-4e64-a665-29932d082eca","resolution":{"observed_at":"2026-08-03T01:06:00.572376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.598781Z","title":"A novel markovian framework for integrating absolute and rela- tive ordinal emotion information.IEEE Transactions on Affective Computing, 14(3):2089–2101,","venue":null,"work_id":null,"year":2089},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.598781Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:366dd802c18107f2fb8888703159df74859b91d322d96a5ed1af8103df454b69","observation_id":"4ea2e88a-9568-4ae7-a1c9-e41749e97fdc","resolution":{"observed_at":"2026-08-03T01:06:00.598781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T01:06:00.665870Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.665870Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:63646ec1a52bf1cd490fbba81ab3f55077f3d31686512c47c163531c95fdbb2c","observation_id":"60f870d4-7118-468c-b7ab-d2e2b501c9e1","resolution":{"observed_at":"2026-08-03T01:06:00.665870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.708752Z","title":"and Zuo, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.708752Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:f0b4c193ea9ead62f5edf53709cdd53a6d52110ccea21a3cd20d45e221f2f4cf","observation_id":"0d70d34c-4bea-46ba-a8b1-1b22923ce84b","resolution":{"observed_at":"2026-08-03T01:06:00.708752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.733883Z","title":"The weighted F1 is then computed as: Weighted-F1= X c∈C nc N ·F1 c, wheren c is the number of true instances in classc,Nis the total number of instances, andCis the set of classes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.733883Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:0f8cc12e4f5c1590e934b8561cce8268ad95a0d24474e5d02950951279bc8eab","observation_id":"4a83e5e2-bfa4-4e72-87d8-42e75a91dc1e","resolution":{"observed_at":"2026-08-03T01:06:00.733883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.769281Z","title":"On the other hand, we implement the reinforcement learning training algorithms in Tab","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.769281Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:9c0ffd3a5a1141ce20e714d993395442d0f423aa443bfb283637d25ddb3cbd9e","observation_id":"d736e1a9-c1f2-4504-b9da-c8ec1ec6e5de","resolution":{"observed_at":"2026-08-03T01:06:00.769281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.839355Z","title":"Finally, we provide a overlong length penalty, rlen which follows Zhang & Zuo (2025) to prevent excessive length and verbosity of responses","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.839355Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:e7f146b54dc2e99299a91ed5594243451fd6569323ea885e51b6451121111c4b","observation_id":"26704a28-d3ce-4bd9-9ca5-40ad58f9da15","resolution":{"observed_at":"2026-08-03T01:06:00.839355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.870555Z","title":"Each value is the arithmetic mean over datasets associated with the task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.870555Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:2ebe8025fb0be53204d93948390388f2e6bec2be5e8ef33ba2518dfe00b81ed9","observation_id":"606ef4aa-77bc-4e0d-80cf-774c5a9c8095","resolution":{"observed_at":"2026-08-03T01:06:00.870555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.951038Z","title":"Additional Training Plots We provide additional training plots to empirically illustrate the training dynamics in our experiments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.951038Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:f737fbb2c2fc9152b4dbaa04c0aed8f93a3a1fca21a8e66cc709ca87079a43c2","observation_id":"24f9f5cc-8648-48ac-aadd-3662e953c943","resolution":{"observed_at":"2026-08-03T01:06:00.951038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.983061Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.983061Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:30b31522f80222ba9d81627f37272bc94d9d0f88d806c7920163954b00b8a65d","observation_id":"afc19102-6fec-470d-80dc-ffcaa2801f03","resolution":{"observed_at":"2026-08-03T01:06:00.983061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T01:06:00.540337Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.540337Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:57e9ac7ed3952ca6a64da1178a1eac87737cd3e58adf78996e4aeb83d93fdd6b","observation_id":"b5260150-f11b-4100-836f-9de08d0bad6c","resolution":{"observed_at":"2026-08-03T01:06:00.540337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.452741Z","title":"R., Solar-Lezama, A., and Liang, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.452741Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:2390aee1a393f1d1a2174dc685fd817208f274a6d6fcdc4815e326aa84f1320e","observation_id":"7ec840dc-86cf-4f35-a63e-17064f35c7f0","resolution":{"observed_at":"2026-08-03T01:06:00.452741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T01:06:00.481906Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.481906Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:0f3a2a05eaaa0145c755695f7399173a9b38520cb12e96dbe70ba6105b56b90f","observation_id":"2c0b38e1-2239-435a-9567-a92735cf59a5","resolution":{"observed_at":"2026-08-03T01:06:00.481906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T01:06:00.512187Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.512187Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:c7d7b5782ba07bd48c347faf7788d319e2b6acf4bb18eb2571577575c1d1deda","observation_id":"139aee29-5406-4717-aa0b-f2237a0ee3a3","resolution":{"observed_at":"2026-08-03T01:06:00.512187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.315474Z","title":"K., Rahman, W., Zadeh, A","venue":null,"work_id":null,"year":2046},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.315474Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:629b34844e7b1c8c749930b17ce1d74d5f5c666dbe717a655978f83d188cce55","observation_id":"a5403f7c-d68e-468e-b1f9-7e8b52a930e6","resolution":{"observed_at":"2026-08-03T01:06:00.315474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-07-06T05:00:39.739374Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-03T01:06:00.688949Z","title":"MOSI: Multimodal corpus of sentiment intensity and subjectiv- ity analysis in online opinion videos.arXiv preprint arXiv:1606.06259,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.688949Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:5fc7c626cac77a1eb1efa2759fcdb48cc0ec538cd466f02d739a236a94b4733c","observation_id":"da63f133-7b5e-4a82-9817-c685d5efc9f1","resolution":{"observed_at":"2026-08-03T01:06:00.688949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-03T01:06:00.643555Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.643555Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:415fffa2db07ccdd63c08cac381ecc95ba11242901a5dd28fadcee4950957bca","observation_id":"79b87b2c-e996-4802-98ee-8c56dd83ec4b","resolution":{"observed_at":"2026-08-03T01:06:00.643555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-03T01:06:00.346002Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.346002Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:83df64df2235a2e2706297fc1f02723f0c4b32c24a3818673171472f10022560","observation_id":"e55070f8-c239-4661-bfa7-89f31f9a80a7","resolution":{"observed_at":"2026-08-03T01:06:00.346002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T01:06:00.156526Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.156526Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:17cea2b61cfad9d40630b977025ded4ec9bdc3e6501947f459bb95a634c9cf96","observation_id":"f402657a-3fd1-49cf-839a-7b9207d68587","resolution":{"observed_at":"2026-08-03T01:06:00.156526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:06:00.230808Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning.arXiv preprint arXiv:2504.02546,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T01:06:00.230808Z"},"links":{"citing_paper":"/paper/2602.10635"},"observation_digest":"sha256:600fcb9604a832887dde521fdc02e24ac614ca23d87be6c8de667354b8ec464c","observation_id":"4a07d16f-2563-4631-852d-7fbaf2949c9f","resolution":{"observed_at":"2026-08-03T01:06:00.230808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.10635","last_updated":"2026-06-16T07:35:16Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T01:05:58.798187Z","submitted_at":"2026-02-11T08:35:59Z","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2602.10635."}