{"as_of":"2026-08-06T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:507266ebfe282e7642a577cf19d9754231a5a604afd01423f2d3ea5e00c9bb00","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:16:53.178921Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14187/citation-record","integrity":"/paper/2607.14187/integrity","json":"/paper/2607.14187/citation-record.json","paper":"/paper/2607.14187"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-02T03:16:52.065229Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.065229Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:9dc69ee7e20d849629bf0258ec43cef30d86b31dca3d948ad5c359e545c75a8c","observation_id":"1483f19f-b5a1-418b-8d45-1f748282ee72","resolution":{"observed_at":"2026-08-02T03:16:52.065229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T03:16:52.411477Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.411477Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:377e2f86951eb1fd02af712d5d6dc650dd8aecd65602894446936124f6d30757","observation_id":"3fe4b1d2-fd68-4961-9478-07f5cdd54d21","resolution":{"observed_at":"2026-08-02T03:16:52.411477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-02T05:40:31.086014Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-02T03:16:52.624046Z","title":"Revisiting feature prediction for learning visual representations from video.arXiv:2404.08471,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.624046Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:a0e23893159731aa23de2aa26463df5bf8a100d5166fa306230d917870df7184","observation_id":"70ee18af-e177-4d1f-9c81-642953eb68a5","resolution":{"observed_at":"2026-08-02T03:16:52.624046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-02T03:16:52.829087Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.829087Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:537314897a2b511e36fdc11f4d26992739b7523cea8e2f19e27607aa7ad47f04","observation_id":"86b44128-0ad2-4f01-bd20-3da95425aaf3","resolution":{"observed_at":"2026-08-02T03:16:52.829087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-02T03:16:52.902835Z","title":"AgiBot World Colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.902835Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:7a03c0d2537b0f64df1c4e56ff0df184161021f4ca66f6e64b3956c6af75fc74","observation_id":"441af304-fadf-4ee3-b89e-8502d1c10f96","resolution":{"observed_at":"2026-08-02T03:16:52.902835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:52.966378Z","title":"Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.966378Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:6fc5808aaa8f33c6e7eb57be77ba5db4a877132d3cad192503fb9503a2ada320","observation_id":"8bb7f226-a638-4647-b3c9-cfb9cf2cc548","resolution":{"observed_at":"2026-08-02T03:16:52.966378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-02T03:16:52.984970Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.984970Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:feca8458c6d153e3d185d2cbb37520cffa26ff12ae7f95de2c0a3a9528f2b3d7","observation_id":"a61824be-2977-4df6-9356-7133a8dc1da0","resolution":{"observed_at":"2026-08-02T03:16:52.984970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13778","snapshot_observed_at":"2026-08-02T03:16:52.989658Z","title":"Internvla-m1: A spatially guided vision-language-action framework for generalist robot policy.arXiv preprint arXiv:2510.13778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.989658Z"},"links":{"cited_paper":"/paper/2510.13778","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:e10a07243a15a3db731d03c077c75e6a60bcd2dec7b1cb72a840d0489624aa5e","observation_id":"68faf5a4-ee68-4e77-89b1-77a87726cd0d","resolution":{"observed_at":"2026-08-02T03:16:52.989658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:52.993819Z","title":"Rynnec: Bringing mllms into embodied world.arXiv preprint arXiv:2508.14160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.993819Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:68e16f11798eade6e06fd5232597448a155e001bc9522272abb762bc133f21f0","observation_id":"6b8cd26f-09cc-4d5a-9b3c-577f5a6a43eb","resolution":{"observed_at":"2026-08-02T03:16:52.993819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:52.998413Z","title":"Rynnbrain: Open embodied foundation models.arXiv preprint arXiv:2602.14979,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.998413Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:348c28bb72d3f8e780fd263a7758afe65d69e41f62bb2fe0b2509e9f26298ff4","observation_id":"f293a8c0-a783-42f7-aead-801df76ed549","resolution":{"observed_at":"2026-08-02T03:16:52.998413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-02T03:16:53.002710Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.002710Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:0470d8b98498245621a7d6c236b2f5497e3fa9423ba9d61255cf9f37b19c0d21","observation_id":"1a2bd0dc-7117-4fdc-95d2-d04bc7d30eed","resolution":{"observed_at":"2026-08-02T03:16:53.002710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.007351Z","title":"Rethinking video generation model for the embodied world.arXiv preprint arXiv:2601.15282,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.007351Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:84daaeac3b8dd24e72c0e5317f264bf76bffc5e5025cd9d267f4c36e34e3e502","observation_id":"d2b96bf6-d4d6-4a6f-94f3-38a77bbca105","resolution":{"observed_at":"2026-08-02T03:16:53.007351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05756","last_updated":"2024-06-09T12:23:14Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T12:23:14Z","title":"EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05756","snapshot_observed_at":"2026-08-02T03:16:53.011642Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.011642Z"},"links":{"cited_paper":"/paper/2406.05756","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:cff532a845333c7622d77678c2b00c2489d61c0febd18d720c6c97dc11ca7b89","observation_id":"80c327f4-c8ec-48bb-b4fc-cc9e65c1ca7a","resolution":{"observed_at":"2026-08-02T03:16:53.011642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T03:16:53.016209Z","title":"Molmoact2: Action reasoning models for real-world deployment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.016209Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:912b4b325b0ac9db204ef4c82efe8ab40aaefcac33c4f27817ff884d73e265a7","observation_id":"ae0e4585-db95-4289-9304-68fa09bea061","resolution":{"observed_at":"2026-08-02T03:16:53.016209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-05T13:31:08.573875Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-08-02T03:16:53.020900Z","title":"Galaxea open-world dataset and G0 dual-system VLA model.arXiv preprint arXiv:2509.00576,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.020900Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:35109dc02e182493b3b6a236d4121453b8374b5593b096d705a63740febfd453","observation_id":"bdbeaf69-9a4f-4259-9131-c8080434fb10","resolution":{"observed_at":"2026-08-02T03:16:53.020900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-02T03:16:53.025061Z","title":"Dreamdojo: A generalist robot world model from large-scale human videos.arXiv preprint arXiv:2602.06949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.025061Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:45ed309df9017058ff38ff37802597444baf523e9b363958e8bece841cac254e","observation_id":"0a3fb7e9-2d9b-463f-8bcc-297c6f6a4f2a","resolution":{"observed_at":"2026-08-02T03:16:53.025061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-02T03:16:53.029372Z","title":"Google DeepMind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.029372Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:53f569c31a838e6d2a572bfe08014dffd3e2451e66ec9601602936ce6f7aa1eb","observation_id":"62f09888-3c15-4368-ad0b-20dc82fe5cfb","resolution":{"observed_at":"2026-08-02T03:16:53.029372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-08-02T03:16:53.033359Z","title":"Ctrl-world: A controllable generative world model for robot manipulation.arXiv preprint arXiv:2510.10125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.033359Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:e3095e69f235c627d40405f6ca1277509a307445bae471d43b3e2a183bf779c4","observation_id":"edd55c7f-8b3e-4ec8-8f42-5aa9b0665447","resolution":{"observed_at":"2026-08-02T03:16:53.033359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-02T03:16:53.041803Z","title":"Yoon, Mouli Sivapurapu, and Jian Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.041803Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:a579a0133f9936baad0c2321d165cd95c17953bfad91004015f733a01d57d345","observation_id":"f0a9d072-836c-442c-93ce-1a0ff3a5bab1","resolution":{"observed_at":"2026-08-02T03:16:53.041803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-02T03:16:53.046467Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint arXiv:2412.14803,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.046467Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:0ef0f4bfc0195e45e33a3c835e2b3aee1d90853ea09b845a8b903383ff4bac3d","observation_id":"b0aac4a1-4c52-4a07-8567-fe51c20ab1d0","resolution":{"observed_at":"2026-08-02T03:16:53.046467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.050538Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.050538Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:f23dbbe2ea33d4e0a04f9a1282ed017254d2fcea8ab0b88303f6cbfd01f2b070","observation_id":"99ef8783-cc27-4d87-884f-0ce71a4da012","resolution":{"observed_at":"2026-08-02T03:16:53.050538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-02T03:16:53.054573Z","title":"InternRobotics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.054573Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:a4e27fe8ea2c8e26bea1a1162e6e13e45b7c67ff2959b9d37be9c79db6b24763","observation_id":"3a66bdc8-57aa-487b-9a80-58a44eb08f65","resolution":{"observed_at":"2026-08-02T03:16:53.054573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-07-06T20:44:31.199648Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-02T03:16:53.058412Z","title":"RoboBrain: A unified brain model for robotic manipulation from abstract to concrete.arXiv preprint arXiv:2502.21257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.058412Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:ce8ab02eea8ed86c35f32e935382e791911084e0e30d39ce18f9dfe8949344b0","observation_id":"cbfd2e79-e0a3-4186-baae-1dd0db7044a4","resolution":{"observed_at":"2026-08-02T03:16:53.058412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T03:16:52.706197Z","title":"π0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.706197Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:675c9dfe73e9617a8150a482c088f5cdaa3705988c7801cb05ea24946a89be51","observation_id":"46844f05-3ffb-441e-b5fb-d811455e5487","resolution":{"observed_at":"2026-08-02T03:16:52.706197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-02T03:16:53.063299Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning.arXiv preprint arXiv:2601.16163,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.063299Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:fafec96a27bccfa3e0487b447ae2381acfd73d2e8fc27f681f329aab6509621a","observation_id":"532ddc54-a7fd-4dee-b38a-6a75134d972c","resolution":{"observed_at":"2026-08-02T03:16:53.063299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-02T03:16:53.067819Z","title":"Videopoet: A large language model for zero-shot video generation.arXiv preprint arXiv:2312.14125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.067819Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:23f4274ea8fff23e8d3cef66b953695409435ebfe0315b556862e9e914627f24","observation_id":"827494e7-2d97-42c6-a2e7-265c38e680a0","resolution":{"observed_at":"2026-08-02T03:16:53.067819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-02T03:16:53.072266Z","title":"MolmoAct: Action reasoning models that can reason in space.arXiv preprint arXiv:2508.07917,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.072266Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:1c86e8c14daa7be471ac1549ac6934996f3a350d0a4e93788b3bde1d6bc318c3","observation_id":"e67efccf-9c77-47e4-b0c7-f19c09994fc3","resolution":{"observed_at":"2026-08-02T03:16:53.072266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.077240Z","title":"Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models.arXiv preprint arXiv:2505.21500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.077240Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:d065684b1e94077a3656d6fc1bfa7cceb6b25c1ad267cd2377c157199287c527","observation_id":"bff5aa85-5343-4384-84ec-f98fa6fa5973","resolution":{"observed_at":"2026-08-02T03:16:53.077240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-02T03:16:53.081610Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.081610Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:e70408badc1d819fd7e41f8505931728cf2933789d167f8d0dc13330ca7c6d56","observation_id":"38d59eae-cda7-4910-88f3-e3c8c5314bd5","resolution":{"observed_at":"2026-08-02T03:16:53.081610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.086347Z","title":"Mm-act: Learn from multimodal parallel generation to act","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.086347Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:cc78b50b03203d28e1226c42dcadaa2fe18350be221f3c97b6f5d6331dc86ba5","observation_id":"b9ba8fe4-bfa8-403c-af0e-cca74d46f49d","resolution":{"observed_at":"2026-08-02T03:16:53.086347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-02T03:16:53.090389Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models.arXiv preprint arXiv:2411.04996,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.090389Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:4cb8dc2723bece51afa0e36878c9295f44247c3f65b6677259313b1164df366b","observation_id":"e4dd2bde-4167-4e29-b1dc-c66c53065d69","resolution":{"observed_at":"2026-08-02T03:16:53.090389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.094833Z","title":"URL https://www.biorxiv.org/content/10.64898/2026.05.01.722168v1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.094833Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:de7fbe7996a531d0240a8947c7203428a3b69ecf72f5882eb722d35cda6f85bf","observation_id":"6466870e-29bd-446b-90c4-0c726a26244c","resolution":{"observed_at":"2026-08-02T03:16:53.094833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.099478Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.099478Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:e0f94f8124c9877fb68c602d4edf2fd0f5a92081fe36e873bb488510eb8b6793","observation_id":"b23715cf-5277-4c16-9e62-edd407dc59f3","resolution":{"observed_at":"2026-08-02T03:16:53.099478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T03:16:53.103400Z","title":"GPT-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.103400Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:4acf3980507243fe783599e85650b4cd10929c5679f7e2e3428018db0f8a1135","observation_id":"8f63dfd1-1926-48cd-a770-f80e3f759670","resolution":{"observed_at":"2026-08-02T03:16:53.103400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T03:16:53.107420Z","title":"π0.5: A vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.107420Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:5ef1138b936c0bd23ba86d1df39e546b276ed0381a71a5c18a171a79a22532d0","observation_id":"f3ea2a64-7297-40c0-9390-389db261c6e5","resolution":{"observed_at":"2026-08-02T03:16:53.107420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19061","last_updated":"2025-03-30T02:44:43Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T11:48:22Z","title":"EgoMe: A New Dataset and Challenge for Following Me via Egocentric View in Real World","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19061","snapshot_observed_at":"2026-08-02T03:16:53.111912Z","title":"Heqian Qiu, Zhaofeng Shi, Lanxiao Wang, Huiyu Xiong, Xiang Li, and Hongliang Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.111912Z"},"links":{"cited_paper":"/paper/2501.19061","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:21c5bb6617a2916fc29887689a2bff7bee5f364e3a56f86cc87085fdeb1a78d1","observation_id":"37db1346-387e-4609-9120-c79a43eb0db7","resolution":{"observed_at":"2026-08-02T03:16:53.111912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17441","last_updated":"2026-04-13T12:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T17:39:22Z","title":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17441","snapshot_observed_at":"2026-08-02T03:16:53.120452Z","title":"RoboCOIN: An open-sourced bimanual robotic data collection for integrated ma- nipulation.arXiv preprint arXiv:2511.17441,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.120452Z"},"links":{"cited_paper":"/paper/2511.17441","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:21fa4252c3beb9a56a8cb0688ce617df72e8a2c722aea4c6f7b06f7c5363205c","observation_id":"d4dd7ce6-2cbd-4d6f-a17e-5507dff19f90","resolution":{"observed_at":"2026-08-02T03:16:53.120452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T03:16:53.124550Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.124550Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:879d8cb466b91193af5cbc5e2e64b1818bdcea18d70f86bb2f368e6cf1e88f8d","observation_id":"c86811f8-6d5f-427d-a644-7354c8e4db39","resolution":{"observed_at":"2026-08-02T03:16:53.124550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.128754Z","title":"BAAI RoboBrain Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.128754Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:0843f3bb0fcbc4f1e036faf902cd190b40544ae5ddfa75380a5b718daf037787","observation_id":"42c0d821-160d-4137-aaf4-e782ffa90d8d","resolution":{"observed_at":"2026-08-02T03:16:53.128754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T03:16:53.133015Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.133015Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:cd2b2a372f1665406725852917badb4e9fb6229eb9c7a65c20307ecd75b20c78","observation_id":"64d1afd2-ab83-4882-81a2-d358a7b7d2ad","resolution":{"observed_at":"2026-08-02T03:16:53.133015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07430","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-08-03T21:39:13.921814Z","submitted_at":"2026-04-08T17:59:48Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07430","snapshot_observed_at":"2026-08-02T03:16:53.137725Z","title":"Hy-embodied-0.5: Embodied foundation models for real-world agents.arXiv preprint arXiv:2604.07430, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.137725Z"},"links":{"cited_paper":"/paper/2604.07430","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:98af5c8b33c69ac30aa352531314f4815e65345d8c7b764f011244979f751aed","observation_id":"8b676f83-b117-40c3-ba69-e0484e85f341","resolution":{"observed_at":"2026-08-02T03:16:53.137725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T03:16:53.142236Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.142236Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:a8033115fffdb212db76ad92a870ee95bf5e7e42e9255ebe9a8495373d60a59b","observation_id":"2512f4c5-febf-4f33-917f-de470cb3ce5c","resolution":{"observed_at":"2026-08-02T03:16:53.142236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T03:16:53.146991Z","title":"HO-Cap: A capture system and dataset for 3d reconstruction and pose tracking of hand-object interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.146991Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:cc1a69201b1e04eb1335f78e2aabada8e7c3292687437779a73a894701951177","observation_id":"9378d785-8a77-4277-9a84-06c3b3a4c87f","resolution":{"observed_at":"2026-08-02T03:16:53.146991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-02T03:16:53.151662Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.151662Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:be39b3e04ffde7faf387bb7bd42892b2643fe7310e61e4f811c73b9bcd6e8fa7","observation_id":"d9cb534f-f35d-4b70-b06c-c97799f76cc4","resolution":{"observed_at":"2026-08-02T03:16:53.151662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-08-02T03:16:53.156408Z","title":"Jihan Yang, Shusheng Yang, Anjali Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.156408Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:ea010ac9528455059441fbd08f97b9e536b4867cbc1621513503cb25d4c1fd50","observation_id":"3d8f654d-eeb6-4763-bd63-eea21781b577","resolution":{"observed_at":"2026-08-02T03:16:53.156408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-02T03:16:53.160827Z","title":"Gigaworld- policy: An efficient action-centered world–action model, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.160827Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:29565693f3e30d32bdda8d459994e025addc5006e44f09aee58a951c6e701317","observation_id":"76dec642-57e2-4091-aa9d-cf732843a2e0","resolution":{"observed_at":"2026-08-02T03:16:53.160827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17846","snapshot_observed_at":"2026-08-02T03:16:53.165132Z","title":"Qwen-robotmanip technical report: Alignment unlocks scale for robotic manipulation foundation models.arXiv preprint arXiv:2606.17846,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.165132Z"},"links":{"cited_paper":"/paper/2606.17846","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:55a99fbee661ebb9bd671712908d5c214c04a5156ddf418cd682e73d952bf6e2","observation_id":"1eafb56b-242d-48e1-a279-b236400e7160","resolution":{"observed_at":"2026-08-02T03:16:53.165132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-02T03:16:53.169515Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.169515Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:b6f531dcff655b4130aaf61863c09a15c4b0ad60d5f70a973bee35b5141036b7","observation_id":"58d9205b-0127-4f60-bcdb-574a6b05700a","resolution":{"observed_at":"2026-08-02T03:16:53.169515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-05T17:41:55.223171Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-02T03:16:53.174546Z","title":"Hy-embodied-0.5-vla: From vision-language-action models to a real-world robot learning stack.arXiv preprint arXiv:2606.14409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.174546Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:0e480bcb87aad087752c72e97b69c8b32c542dfff70d41e98bdff2d548ec5f39","observation_id":"e6a6cb12-87f5-4a87-933f-14bf1666022c","resolution":{"observed_at":"2026-08-02T03:16:53.174546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08807","last_updated":"2026-07-04T03:31:36Z","snapshot_observed_at":"2026-08-04T10:44:29.379805Z","submitted_at":"2025-10-09T20:43:27Z","title":"Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08807","snapshot_observed_at":"2026-08-02T03:16:53.178921Z","title":"Hongxiang Zhao, Xingchen Liu, Mutian Xu, Yiming Hao, Weikai Chen, and Xiaoguang Han","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.178921Z"},"links":{"cited_paper":"/paper/2510.08807","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:7086d10008fe63db53ee2ec90a581f8a34379ebca7b508022cf8435d6a5e9868","observation_id":"db948e56-df8f-40b5-b381-53089309c917","resolution":{"observed_at":"2026-08-02T03:16:53.178921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:16:53.115877Z","title":"Sat: Spatial aptitude training for multimodal language models.arXiv preprint arXiv:2412.07755, 3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.115877Z"},"links":{"citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:5930af090dbc1896ae24fc186f58e75ce4c4e73e2d6d5b68e5b4d84dcbec8ecd","observation_id":"6eeba8aa-c59b-42dd-b91c-2fd9e9c3d1bb","resolution":{"observed_at":"2026-08-02T03:16:53.115877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-02T03:16:52.168989Z","title":"V-jepa 2: Self-supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.168989Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:2c0b7a4c94a59e7f3976f8df052551f7a72782d63a70d06cc0f35e6933b59ccc","observation_id":"037afa4d-f0de-4652-86ed-d45f604371b3","resolution":{"observed_at":"2026-08-02T03:16:52.168989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T03:16:52.544902Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.544902Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:1541f1883b86bd8fadeb27e682d3775a2521bfae1a0eef7f25289cc680d60b13","observation_id":"0af90b43-9b58-4c5a-bcc3-e10ae3acd14c","resolution":{"observed_at":"2026-08-02T03:16:52.544902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-02T03:16:52.770586Z","title":"FLUX.1 kontext: Flow matching for in-context image generation and editing in latent space.arXiv preprint arXiv:2506.15742,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.770586Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:9322547cecd463627bf5985b03964758f59860746f9f4a533213e08ec7e6180e","observation_id":"73623032-e266-4c79-a3e4-206c17193e77","resolution":{"observed_at":"2026-08-02T03:16:52.770586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-02T03:16:52.277478Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.277478Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:060f22f09064bb0394f613b1c2f6ff0b69a6372eb2ea580f934e2a5a653635f6","observation_id":"d2d0bc79-c207-4f12-ab3d-3e6fbcf929af","resolution":{"observed_at":"2026-08-02T03:16:52.277478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-08-02T03:16:52.980185Z","title":"Rynnvla-002: A unified vision-language-action and world model.arXiv preprint arXiv:2511.17502,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:52.980185Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:234d6c4997b5b1599b5cda5e4a296c953f7443f820a46097429f7f087af44291","observation_id":"44690fa4-1f37-466d-95ad-61a70d875c4f","resolution":{"observed_at":"2026-08-02T03:16:52.980185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T07:59:53.415395Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.14187."}