{"as_of":"2026-08-12T23:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1143cd3220688f7bfe396e12f0925ca05759fd4522bab1b16ff582b09c2dac5","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T10:29:55.365544Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07314/citation-record","integrity":"/paper/2608.07314/integrity","json":"/paper/2608.07314/citation-record.json","paper":"/paper/2608.07314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.192258Z","title":"PaLM-E: An embodied multimodal language model,","venue":null,"work_id":"fb149c11-20e5-4a01-a4e1-2a33a59d39a0","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.231185Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:d123f67995f39925305b9e3c10639f3e6875ea00775ff8d6ffd7e75dc1709b3a","observation_id":"22fd29ac-b83c-409e-8d90-27297fe18a37","resolution":{"observed_at":"2026-08-10T10:29:56.195731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.182369Z","title":"RT-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":"1ff97dd6-39b6-4cae-892e-0d490e74cfd1","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.235069Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:d201c36922a958d9b8b95a8a724f83b45a501f99705d0a48a7eba8a91d580af8","observation_id":"3fa02969-224b-4744-a1ae-5da4257e0daa","resolution":{"observed_at":"2026-08-10T10:29:56.186044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.172134Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"b1ec1959-569c-48ef-8cdc-95158e0a44ab","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.238673Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:8160795229cd74e0faaa120d7dc87fe47c60922f85cd83ec49cde46f65585b34","observation_id":"29a27b32-044a-4c8a-903a-48e1d3ac7059","resolution":{"observed_at":"2026-08-10T10:29:56.175689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.162168Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models,","venue":null,"work_id":"759d1c11-01dc-47e3-a0ae-0f46d28f0bd2","year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.242091Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:29cadd8ffe29e8c2596f755221d7681a65800c2366deca5ae335fe211b3b7c50","observation_id":"ea4da3e9-37b1-4529-9654-dc7e9ac20716","resolution":{"observed_at":"2026-08-10T10:29:56.165594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.152925Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":"980f0d92-bd36-4948-b5bb-9862c24d9853","year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.245579Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:60698df60b9492938051be5995cd1e07de19b839406578786887a226d13c12a3","observation_id":"56230c39-9f3d-4b74-b647-a0e692aa832e","resolution":{"observed_at":"2026-08-10T10:29:56.155897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.144126Z","title":"OpenVLA: An open-source vision- language-action model,","venue":null,"work_id":"2c280345-990d-47a1-9cd6-7c0abdf479f0","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.248925Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:fbfdfe8eb7fe1c4a223815a4a60ca96e064cd7d997d0e997905475ed178f9f52","observation_id":"12848eb0-1192-4339-b31f-2d29fe98b861","resolution":{"observed_at":"2026-08-10T10:29:56.147186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.134190Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success,","venue":null,"work_id":"659571b9-2225-46cf-bdc3-da74449fea68","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.252088Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:bdd499da1f3e4ac8e31387da882ade7e3b1f76822f3713828834f437b7fbe106","observation_id":"bf801935-81ea-416f-8f26-aec8e029f257","resolution":{"observed_at":"2026-08-10T10:29:56.138028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.123524Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning,","venue":null,"work_id":"1d1f389d-2ae3-4af7-aea0-cee2f9cd76c2","year":2011},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.254959Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:6c9622a66e149cc2fca00930799627196ab8ba542a79ee9dd01735f3c6b14bca","observation_id":"0f01f29c-4545-49d7-95f6-b4fc8b577c71","resolution":{"observed_at":"2026-08-10T10:29:56.127108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-10T10:29:55.257629Z","title":"VLA-RL: Towards masterful and general robotic manipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.257629Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:aecd3e789bca430d8a05329f31e7c8d2d04d61a4d74cc2569c10b5e2606918d7","observation_id":"5476859f-65e1-4d2b-adcf-a043a72076f6","resolution":{"observed_at":"2026-08-10T10:29:55.257629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.113100Z","title":"SimpleVLA-RL: Scaling VLA training via reinforcement learning,","venue":null,"work_id":"a84e77ae-7a2a-4831-9085-de1151aa35c7","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.260771Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:f99dc952973b0dabf916e7ad90fced54ab29c608fbe19c54b78e6cbb77681446","observation_id":"f73d1b42-aa20-4d12-8ef7-f7e48bd7899f","resolution":{"observed_at":"2026-08-10T10:29:56.116999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23073","last_updated":"2026-04-30T20:04:38Z","snapshot_observed_at":"2026-07-31T07:02:53.376869Z","submitted_at":"2026-04-24T23:57:45Z","title":"RL Token: Bootstrapping Online RL with Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23073","snapshot_observed_at":"2026-08-10T10:29:55.263923Z","title":"Rl token: Bootstrapping online rl with vision-language- action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.263923Z"},"links":{"cited_paper":"/paper/2604.23073","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:2f6d95ab5ec7b423b958717ded0709ad00b6ce85f6fcfc101b00bee51099c6fd","observation_id":"34301185-637a-412e-ab6e-6c5c09477126","resolution":{"observed_at":"2026-08-10T10:29:55.263923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.102919Z","title":"Knowledge insulating vision-language-action models: Train fast, run fast, generalize better,","venue":null,"work_id":"823f3696-42ce-441d-931a-f653a591dda9","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.266959Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:19c4a3e39deba07c0d3d048d9546102c8da39d8653ddec351b345c457ab8394a","observation_id":"9f211459-f700-4493-a8cb-9098f4574656","resolution":{"observed_at":"2026-08-10T10:29:56.106712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-10T11:32:59.879407Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-10T10:29:55.270093Z","title":"Improving vision-language-action model with online reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.270093Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:48478f967820c6c9522dd999b4f821a370eb4ae3fd3cda878ffdd18c8c28f6cd","observation_id":"edfee9b4-2bab-447b-8495-e59005959870","resolution":{"observed_at":"2026-08-10T10:29:55.270093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.092690Z","title":"Addressing function approximation error in actor-critic methods,","venue":null,"work_id":"de0933f8-5701-4c9e-90ad-6256f35ef243","year":2018},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.273617Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:b0ccc9894ebe9c0134c224d60a1700a4158a11fede61e945569ae15404636a5a","observation_id":"a5f798a9-de3c-464c-b2f5-7123f70a7771","resolution":{"observed_at":"2026-08-10T10:29:56.096260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.082723Z","title":"BridgeData V2: A dataset for robot learning at scale,","venue":null,"work_id":"d22a58e1-f7fa-4a39-821a-56e89ee70e3f","year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.276679Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:85457a1b6b3fccb850b25d07a350b4c4de94354182e31ff421254b5aeed727c9","observation_id":"7668e1bc-5b3f-4710-82f3-f085ce17c84f","resolution":{"observed_at":"2026-08-10T10:29:56.086289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.279752Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.279752Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:70f2b4e80c9a74ae1f75e47758a2fb9514067dc773dd115244112d5863afc9e6","observation_id":"29ca5594-d6bd-4964-94df-c05bdf3801a0","resolution":{"observed_at":"2026-08-10T10:29:55.279752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.910710Z","title":"Visa-flow: Accelerating robot skill learning via large-scale video semantic action flow,","venue":null,"work_id":"1ee633e5-e06d-4164-a6fd-4b89b87fa619","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.283014Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:c84045cce84cdcb796b157cccacbc0c32bc8696dec1f5b24aabd093a9ee22e50","observation_id":"4b7bdbb6-6c16-4379-8ffe-24ff1d0f6af1","resolution":{"observed_at":"2026-08-10T10:29:55.915698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.066778Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":"079074ff-5f35-4c75-8cf5-851bac7b1d5c","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.286220Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:814cb28bfe92f9bd9da975a9deae5a7c28074d1728db7bd4e6fb3b5a23b8c0b0","observation_id":"6dadfcca-bde9-4ada-9e09-db4045287d65","resolution":{"observed_at":"2026-08-10T10:29:56.070341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.056834Z","title":"π0.5: A vision-language-action model with open-world generalization,","venue":null,"work_id":"880bc8bc-c49e-4cb7-966a-6add02c35c10","year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.289517Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:18508b0e1288dc80c94cac60155658aa578627573234ea359976c964fb6b9b56","observation_id":"26618d8a-a725-4ff9-845f-2dafac8509ee","resolution":{"observed_at":"2026-08-10T10:29:56.060558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-10T10:29:55.296092Z","title":"GR00T N1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.296092Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:b06e134cddd0638511dcd41b3896c2df895d17e3f775d54fcda09f96b46c52e8","observation_id":"87607237-d798-43ab-8d8a-065063327d4b","resolution":{"observed_at":"2026-08-10T10:29:55.296092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-08-10T10:29:55.299516Z","title":"Interactive post- training for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.299516Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:5023d6221a6e66b364a19749e3c08bad6a322487e0eca087f55507cf303ce247","observation_id":"3066997d-de2d-47fe-ade4-6bcea7246a0e","resolution":{"observed_at":"2026-08-10T10:29:55.299516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.036844Z","title":"VLA-RFT: Vision-language-action reinforcement fine-tuning with verified rewards in world simulators,","venue":null,"work_id":"bf80ce21-589d-45ac-afd6-0d7f05cda6df","year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.302904Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:f0c1b7f9a81ad048784e91aab362f395d64212ee394fb2e102f7a25932b6a371","observation_id":"eec1aa47-6d89-4fbe-bd06-e161450369d4","resolution":{"observed_at":"2026-08-10T10:29:56.040569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.027049Z","title":"ConRFT: A reinforced fine-tuning method for VLA models via consistency policy,","venue":null,"work_id":"a7d66289-1893-43a2-9f51-c06debd8e177","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.309572Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:b105eaa466a095bec1eb913d7720191c8dcd82dacd45ba23518f76aa9dd97ab2","observation_id":"8599fa7e-bda9-4196-9164-a095a7ad8298","resolution":{"observed_at":"2026-08-10T10:29:56.030298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-10T10:29:55.312519Z","title":"π ∗ 0.6: a VLA that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.312519Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:2b0d23ee8a73a5c33f7920b441b2864a34cbaee545688650403859e329a3d50b","observation_id":"ef126e3e-aeae-4b5e-8752-2cedf4b0b831","resolution":{"observed_at":"2026-08-10T10:29:55.312519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.15285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.653053Z","title":"Acting while understanding: Asynchronous semantic-action decoupling for real-time vision-language-action models,","venue":null,"work_id":"318616b3-cfca-44f8-a00d-991b9fbf68fc","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.316233Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:43799c4c4815536764290b2a389f1fa6b4b9c5bc2637ec6af6978173366eda19","observation_id":"6eb70623-a93a-45c2-8578-e2e368f4b264","resolution":{"observed_at":"2026-08-10T10:29:55.660050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12105","last_updated":"2026-06-10T13:59:07Z","snapshot_observed_at":"2026-08-02T10:21:49.594416Z","submitted_at":"2026-06-10T13:59:07Z","title":"DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12105","snapshot_observed_at":"2026-08-10T10:29:55.319520Z","title":"DAM-VLA: Decoupled asynchronous multimodal vision language action model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.319520Z"},"links":{"cited_paper":"/paper/2606.12105","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:449e4e37f93d1b87033599a580de21a54893236109e488fccb1a33bf76489d16","observation_id":"bff91253-b426-414e-92fa-ed83fc42e6f1","resolution":{"observed_at":"2026-08-10T10:29:55.319520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-08-11T08:09:32.846596Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05765","snapshot_observed_at":"2026-08-10T10:29:55.322806Z","title":"RL-VLA 3: A flexible and asynchronous reinforcement learning framework for VLA training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.322806Z"},"links":{"cited_paper":"/paper/2602.05765","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:0351ae07e6d243ae7a68d337a2415a8a367c9f8cfc2c998917fcca33a095547f","observation_id":"1595bda8-f98a-4546-a9fd-5b91cd3c17be","resolution":{"observed_at":"2026-08-10T10:29:55.322806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.017073Z","title":"FLOWER: Democratizing generalist robot policies with efficient vision-language-flow models,","venue":null,"work_id":"dc546f16-5543-4b8f-9c7f-0ce12da6f3da","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.326214Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:1990e4389dc85f3910b02b443bfc8bfb269ca797b6b62ad8f922df4e0463fbe7","observation_id":"c9190653-2b3a-4c89-be44-49d47b8d0d05","resolution":{"observed_at":"2026-08-10T10:29:56.020826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.006593Z","title":"CALVIN: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,","venue":null,"work_id":"b2e7e0c4-2f37-4ec6-b198-56aca47a73a9","year":2022},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.329247Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:947a1919146b004136915607ce19d8a4f713c31782d660c24df1c61e6058464e","observation_id":"df257f01-d68e-4020-86cb-20df0eadc475","resolution":{"observed_at":"2026-08-10T10:29:56.010337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-10T10:29:55.332304Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.332304Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:9853ed36bd0af0ce3d10d281b5ca1351f7a8df27ae6e60d27516e0775ea524b6","observation_id":"070e97bc-b8ca-414e-b4a4-7b62c0b62d05","resolution":{"observed_at":"2026-08-10T10:29:55.332304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-10T10:29:55.335648Z","title":"Unified vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.335648Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:0f46b1a89a077d1f3769ff01bfc6a2f606b88f7db1a013f4c27e7191fc93ac56","observation_id":"c0d5ca24-f249-4b16-aee9-1bbd471e85db","resolution":{"observed_at":"2026-08-10T10:29:55.335648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.995449Z","title":"Disentangled robot learning via separate forward and inverse dynamics pretraining,","venue":null,"work_id":"ddd49c0c-6efd-4bf6-8067-ed8851a83b01","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.339006Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:c59e43ebe0fe8dd090fedf820eccc841f7edfb7985db412d4d54c6f009acff8b","observation_id":"bcf3a1ed-5608-4cf1-85df-33d4ca959e10","resolution":{"observed_at":"2026-08-10T10:29:55.999192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-10T10:29:55.342197Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.342197Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:95e1013220430c457c6476e07cc0c8cf62ba7d2bee31e2b5f73d35127b5fb96d","observation_id":"494b723d-3fc4-4c09-be34-5b9b3e44242f","resolution":{"observed_at":"2026-08-10T10:29:55.342197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-10T10:29:55.345462Z","title":"3D diffuser actor: Policy diffusion with 3D scene representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.345462Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:4c3907590a5e321d6ca3624208e93333c053d1cff2d577c52637990f59c00faa","observation_id":"d3f1a906-5701-4748-890a-26e4d2cd3052","resolution":{"observed_at":"2026-08-10T10:29:55.345462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.984774Z","title":"Closed-loop visuomotor control with generative expectation for robotic manipulation,","venue":null,"work_id":"a3d0641b-a06c-4aea-8e91-ca43ee3aaa45","year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.348290Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:865aa47b7523e59ebbea1221b41d5c77e548b504953c2d414baf17c7eaa20eaa","observation_id":"151c7e52-33d6-4715-9660-055547a9ecc6","resolution":{"observed_at":"2026-08-10T10:29:55.988461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-12T22:26:15.509923Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-10T10:29:55.351046Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.351046Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:0e5a820e6e65668d410ae35837f262c3bbfef9b4f0ac54085ed859f8a2f076b6","observation_id":"57f9af1d-d3b1-49dc-8040-fe607b8cfead","resolution":{"observed_at":"2026-08-10T10:29:55.351046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.974091Z","title":"UP-VLA: A unified understanding and prediction model for embodied agent,","venue":null,"work_id":"37c065c5-bf8c-4e57-87c7-3e2d712d5ef4","year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.353821Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:f9716cea3295e241835ab55a7b2243e303a320a78370c7454182a7adde61056e","observation_id":"329ece0c-ce06-44bb-bb75-991b50ca45d5","resolution":{"observed_at":"2026-08-10T10:29:55.977851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.963048Z","title":"What matters in building vision-language- action models for generalist robots,","venue":null,"work_id":"98be8aa6-e98c-470b-8aa7-55bed03212cf","year":2026},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.359366Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:647a05237f892331fc5f71dae9cecbbc2e8d0ddf7a056c8cf8af9da709732605","observation_id":"995e8f22-1a8e-46e0-84bf-941c89e41238","resolution":{"observed_at":"2026-08-10T10:29:55.966734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-10T10:29:55.362007Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.362007Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:8bda3adcf48385c5558a273fffe0cc998029569574d3af124efd5b95c16ec566","observation_id":"b1c35929-4741-4869-a527-3e1902b19ff7","resolution":{"observed_at":"2026-08-10T10:29:55.362007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-10T10:29:55.356467Z","title":"Available: https://arxiv.org/abs/2501.18867","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.356467Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:43b6b9600619b0a6b2c9834048967d41905987f504135297f3140f8aabf58c36","observation_id":"76e909f4-f93f-4e90-991a-6a937ec19a6b","resolution":{"observed_at":"2026-08-10T10:29:55.356467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.951983Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations,","venue":null,"work_id":"5c77a503-39e6-4cd0-a67a-3659d030c1fe","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.365544Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:fada7752225d3d9146b87d28a2068f7c700f77eff2b758edc28e984e449d9ff3","observation_id":"07711bc4-1625-48fd-b1e5-c6201cd13b93","resolution":{"observed_at":"2026-08-10T10:29:55.955746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:56.046724Z","title":null,"venue":null,"work_id":"f0d8d85a-8c16-48e5-b11b-340c2cdc1b46","year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":305,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.292911Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:ea7e50852c925c6964d070300d7a71c00fc81f93ddae83c561ba47216e647b9d","observation_id":"7294401d-902b-4fdd-bf7c-f2e75b9fb205","resolution":{"observed_at":"2026-08-10T10:29:56.049969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T10:29:55.306328Z","title":"Available: https://arxiv.org/abs/2510.00406","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.306328Z"},"links":{"citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:955cc2ef68371581362dff0c7fd9f12091298d68c9286efd84e62cb1f9376861","observation_id":"c57bf128-f41f-4721-82f8-47351af4de48","resolution":{"observed_at":"2026-08-10T10:29:55.306328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.07314."}