{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afe4126eb30b913377d0ecbde0a6f7d9c72c767c5f30f8b8e0fb316689c83c50","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:33:08.828828Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:32:20.329963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:07:29.924092Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":"2507.10548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-07-03T01:07:29.924092Z","title":"arXiv preprint arXiv:2507.10548 , year =","venue":null,"work_id":"b35b46e8-38a5-47b2-bf84-2f31cba2bfbe","year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-06T23:31:01.339828Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:59:48.877783Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:70b3158f222bcbe6279cd6a463369dc04373db884105eda503a659fff062ac35","observation_id":"c3db1d34-85d5-429c-b3e7-b45a573fc056","resolution":{"observed_at":"2026-05-11T05:41:00.514331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-08-04T05:32:20.329963Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-06T23:31:01.339828Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:32:20.329963Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:04525d3b1af19a80d38a9e0abcf52701e60ca5bcc64fc90a788c0bc0752eb085","observation_id":"474d3147-b2e0-437d-8fad-eb5aaee82149","resolution":{"observed_at":"2026-08-04T05:32:20.329963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":"2507.10548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-07-03T01:07:29.924092Z","title":"arXiv preprint arXiv:2507.10548 , year =","venue":null,"work_id":"b35b46e8-38a5-47b2-bf84-2f31cba2bfbe","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:2d60bab78c70f8b8ee647d350228ffbc293657b4d104d9004b0e740f076c9fa5","observation_id":"19b519cc-1444-42b3-acc1-86ea87d95944","resolution":{"observed_at":"2026-07-01T20:56:13.540119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":"2507.10548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-07-03T01:07:29.924092Z","title":"arXiv preprint arXiv:2507.10548 , year =","venue":null,"work_id":"b35b46e8-38a5-47b2-bf84-2f31cba2bfbe","year":2025},"citing_paper":{"arxiv_id":"2606.09826","last_updated":"2026-06-08T17:59:43Z","snapshot_observed_at":"2026-08-02T20:00:31.322130Z","submitted_at":"2026-06-08T17:59:43Z","title":"OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T16:50:36.194650Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2606.09826"},"observation_digest":"sha256:ea0a769f44e63f01bddffda6c1c25547883a68eba7bf7303bee8579a34e512d9","observation_id":"24ed8e0d-ec1d-4daa-8fb1-3892450e43e9","resolution":{"observed_at":"2026-07-03T01:07:29.926146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10548/citation-record","integrity":"/paper/2507.10548/integrity","json":"/paper/2507.10548/citation-record.json","paper":"/paper/2507.10548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T17:33:08.619857Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.619857Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:f65e96b602c08ac1c327d19c859c97f087b825ad8f6c5f43454015d23f6374fa","observation_id":"46378b16-f397-4ab3-af37-14895ebb95c7","resolution":{"observed_at":"2026-08-06T17:33:08.619857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.711275Z","title":"Introducing claude 3.5 sonnet","venue":null,"work_id":"f2fb1ab3-54b2-4476-bea9-4094a566bd9a","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.627506Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:e7518c44644a89a6d81b2241a2b91b55e838f50bd4ef93a8dce239e3521f9158","observation_id":"da50ed54-716a-43b1-84b1-89724a63c72c","resolution":{"observed_at":"2026-08-06T17:33:09.717874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T17:33:08.637710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.637710Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:7baf5b6af36dcf1037f89e727619174f858dd9fb9d89cd2f9f5d2192e28f7f85","observation_id":"08f766b1-8b0c-43f2-9aaf-16718cfafb80","resolution":{"observed_at":"2026-08-06T17:33:08.637710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.692802Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":"d392918d-97cc-4fd0-9133-883c8851fb50","year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.643260Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:baccca1ae7486c6bfbbe4694207625f3b716abc034ed64a5475d3c0f04f31967","observation_id":"6f3e9aa1-f052-4e18-a8fc-e104a9d2d931","resolution":{"observed_at":"2026-08-06T17:33:09.699255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T17:33:08.649485Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.649485Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:3c28db0b95eab966fd54d3b8f6a390355ed16ef40e2102e6ec6b5f2a04600fd9","observation_id":"1a6cdeb1-03f9-4203-8b30-d80f04486d72","resolution":{"observed_at":"2026-08-06T17:33:08.649485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-06T17:33:08.655006Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.655006Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:0b69a66edcd417df6645313afe09f171545ef39e057f12c09611a3ac73ee3dc6","observation_id":"53487227-9737-4886-840e-e4ac9e077dd8","resolution":{"observed_at":"2026-08-06T17:33:08.655006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T17:33:08.670517Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.670517Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:c55d9fc33c5ff4189d9d0a7293f5b4a0c5846cf59d475436724af4b5f32115cf","observation_id":"2490e63c-60e4-40c7-9cf1-618ada301320","resolution":{"observed_at":"2026-08-06T17:33:08.670517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T17:33:08.677166Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.677166Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:33554990b4c3c215b4a949e472a54f42b28eba2043588d5b03b075951f7f6f9d","observation_id":"094a421a-22cf-4e02-b0fe-cf79646217cc","resolution":{"observed_at":"2026-08-06T17:33:08.677166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.684941Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.684941Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:8a1b25e212e09d72ab7e5de5a2e9441e54fc060c8f0f3da7e39bd1eab79b2fc1","observation_id":"4c3c8838-b714-4254-b62d-227dd0a104d6","resolution":{"observed_at":"2026-08-06T17:33:08.684941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T17:33:08.689995Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.689995Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:5d4f51ede18cfbb73d0d837ca364663a60317b0ab56376f6afd59785e1c14152","observation_id":"e82c6838-a2e7-47e0-88be-9dee59a8149b","resolution":{"observed_at":"2026-08-06T17:33:08.689995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13082","last_updated":"2025-07-28T08:53:04Z","snapshot_observed_at":"2026-08-07T16:58:12.982109Z","submitted_at":"2025-03-17T11:41:16Z","title":"Free-form language-based robotic reasoning and grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13082","snapshot_observed_at":"2026-08-06T17:33:08.696039Z","title":"Free-form language-based robotic reasoning and grasping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.696039Z"},"links":{"cited_paper":"/paper/2503.13082","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:f6f107937854bbdc732c05aa09e70274e80c3fe4eea27be54a2f80af3bdaf1ef","observation_id":"91906397-6dcc-4f16-bb65-8ea49e0ed4ba","resolution":{"observed_at":"2026-08-06T17:33:08.696039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T17:33:08.701584Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.701584Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:796b23b3aa1ef9d7f4133a4ef167f69f484b0f36d2b96e536f59cb8883e9484c","observation_id":"bd0eb5d5-fa32-4fef-acba-dafcc8801ab9","resolution":{"observed_at":"2026-08-06T17:33:08.701584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08367","last_updated":"2025-06-03T02:30:05Z","snapshot_observed_at":"2026-07-06T16:31:56.083710Z","submitted_at":"2023-10-12T14:38:25Z","title":"MCU: An Evaluation Framework for Open-Ended Game Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08367","snapshot_observed_at":"2026-08-06T17:33:08.707380Z","title":"Mcu: A task-centric framework for open-ended agent evaluation in minecraft","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.707380Z"},"links":{"cited_paper":"/paper/2310.08367","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:10a77a7a43460af06d30f693ad003e9c183c12f114c730cc270c6a9eceb0adf5","observation_id":"f2ff3adc-6c33-4008-898d-9b9af75e831c","resolution":{"observed_at":"2026-08-06T17:33:08.707380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09664","last_updated":"2026-04-07T05:36:18Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T02:24:46Z","title":"CodeMind: Evaluating Large Language Models for Code Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09664","snapshot_observed_at":"2026-08-06T17:33:08.713873Z","title":"Codemind: A framework to challenge large language models for code reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.713873Z"},"links":{"cited_paper":"/paper/2402.09664","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:47494023fa7e3416dcddd1b5647961e2269275149d592770bac2b344c6d78841","observation_id":"4c76849e-1478-4b32-8272-ddeb2595deba","resolution":{"observed_at":"2026-08-06T17:33:08.713873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:33:08.720758Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.720758Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:a3669014ca7c519c367a3f451034fd2a310fd617a945d2d97c0f48879689c7e8","observation_id":"087496d3-0f16-40a0-920f-b389606af598","resolution":{"observed_at":"2026-08-06T17:33:08.720758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.660941Z","title":null,"venue":null,"work_id":"d0425057-4039-42f1-a300-94135ff6f693","year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.726086Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:9d0c30820131832416c4afa85f0ed5c9a7818a08c782c578c114fde0a1684352","observation_id":"7cda116f-b036-4a7e-92b8-9e636e3b0912","resolution":{"observed_at":"2026-08-06T17:33:09.667450Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.642526Z","title":"Teach: Task-driven embodied agents that chat","venue":null,"work_id":"5917e270-34b5-4681-ba96-7c4ed72dfac9","year":2017},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.731150Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:c03a570e98f8ab50cf7cb58cd418b1475eef444c20cb36272b1a509fa0ba8267","observation_id":"677f655c-3df9-43eb-95cf-d29a5f213f31","resolution":{"observed_at":"2026-08-06T17:33:09.648047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-06T17:33:08.735989Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.735989Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:11eef87139524eead59ab7696cc122d6508f3c8926319989c615bb59c1682fcb","observation_id":"bf5f9643-57a1-4e93-898d-b11a2a285470","resolution":{"observed_at":"2026-08-06T17:33:08.735989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.623875Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"a2368c2e-989c-49df-9ced-16413452b4a2","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.741506Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:3120c9ca2cf9d49f2f45768b6964068a53b18aa0d11eea0ef7c24c5323807ddc","observation_id":"094279c3-9360-43c0-9977-a81b1e53d74c","resolution":{"observed_at":"2026-08-06T17:33:09.629626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T17:33:08.748938Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.748938Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:3afed9ef578d014570705598c1ca96225304cc3244d719648ffe36ec891ce7d3","observation_id":"f6848359-ef85-4a32-9839-d0dcb3ead83b","resolution":{"observed_at":"2026-08-06T17:33:08.748938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.601630Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"f03c39cd-f477-49a7-9a3a-df84bd9552a0","year":2020},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.754934Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:5e78d013ab2a7689970df150586b5c7cfbdd7f1b4cfab8dd7f390c05778c363d","observation_id":"c661d797-3816-4a7b-9ca9-3bd6b5c11a7b","resolution":{"observed_at":"2026-08-06T17:33:09.607559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:33:08.760810Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.760810Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:c8dc29efcd108edcbcb6b4ae56c760b8ebf010da504d3519c44c0f47ed9dd65b","observation_id":"ca15523a-4bf6-4c3c-8134-d322834766c3","resolution":{"observed_at":"2026-08-06T17:33:08.760810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.583011Z","title":"Habitat challenge 2023","venue":null,"work_id":"e816cdd2-f4b8-4ce8-b9e3-238c9bee9043","year":2023},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.766159Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:b10b6200a5010483380c6dbc7e6157c770e4dedd05bb265e8acf1db2280f4a82","observation_id":"9d8ac26e-27cf-462e-9cec-ee4f1fb597ee","resolution":{"observed_at":"2026-08-06T17:33:09.588977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:33:08.771790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.771790Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:76dd074a97a39e261066f6935d312108deb4ad3cac1ed118e242bdd9ef527897","observation_id":"96f37c6a-cd14-46bd-919b-34510e23d11c","resolution":{"observed_at":"2026-08-06T17:33:08.771790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.560924Z","title":"V-irl: Grounding virtual intelligence in real life","venue":null,"work_id":"231dbafb-e443-421c-853b-de48851c0812","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.778067Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:4a2d04bddfec008cb3c43e706f15331ec195afd2ee979459183644aabd966ed4","observation_id":"539dda9d-1f4f-42f0-aaed-a2e5fa5f5267","resolution":{"observed_at":"2026-08-06T17:33:09.569380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.782886Z","title":"Octopus: Embodied vision-language programmer from environmental feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.782886Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:b645eee9e518f0502150c7a6c6512cabecabedf6e479ab7c9d1f781f4b6665cb","observation_id":"a7cf1ac0-7938-4e9b-a0da-4b34cb6824db","resolution":{"observed_at":"2026-08-06T17:33:08.782886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.789147Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.789147Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:f7d8be34b167a9cdb97f833d1bf1cae417916f8bbfa80874ef549b1c67365ce8","observation_id":"f6fbc88c-a4a0-4c99-a35c-8e055d535bca","resolution":{"observed_at":"2026-08-06T17:33:08.789147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.794973Z","title":"Spatial mental modeling from limited views","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.794973Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:0b2796da62ccd4367123180ef60e7458e5a528fd0dcdc03cbcfa2f401cc67c49","observation_id":"ee284598-612a-4ba5-a613-3814787e3471","resolution":{"observed_at":"2026-08-06T17:33:08.794973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02794","last_updated":"2024-06-05T01:40:36Z","snapshot_observed_at":"2026-07-06T18:09:55.249620Z","submitted_at":"2024-05-05T02:22:11Z","title":"Octopi: Object Property Reasoning with Large Tactile-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02794","snapshot_observed_at":"2026-08-06T17:33:08.800658Z","title":"Octopi: Object property reasoning with large tactile-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.800658Z"},"links":{"cited_paper":"/paper/2405.02794","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:099fca4b413dad184fdaea91fcba549bd6ca2134ba8a6138307ddf196fd1c0b4","observation_id":"35972a38-b13f-4d22-9832-cab5a2861fb6","resolution":{"observed_at":"2026-08-06T17:33:08.800658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.497857Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":"9150fad1-5fb7-41e0-96f0-b5464f72313b","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.808668Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:6131d2ce5f612f48dc987befc52c3533c0cca1fc3b85f37f8b28cbfb772a3bb0","observation_id":"c6bd36ee-51bd-4d8c-86b7-3ba64fdee896","resolution":{"observed_at":"2026-08-06T17:33:09.506348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20977","last_updated":"2025-08-12T11:56:32Z","snapshot_observed_at":"2026-07-06T20:14:40.579474Z","submitted_at":"2024-12-30T14:31:01Z","title":"UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20977","snapshot_observed_at":"2026-08-06T17:33:08.814006Z","title":"Unrealzoo: Enriching photo-realistic virtual worlds for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.814006Z"},"links":{"cited_paper":"/paper/2412.20977","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:d5902758ae450c8919af44548a0af36ed5275372a9fd8c7d3d2d26a294528876","observation_id":"3135e1a6-66ae-4159-8e5c-e6b8cdab12e4","resolution":{"observed_at":"2026-08-06T17:33:08.814006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T17:33:08.828828Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.828828Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:bb01c50dbb29fbaf66d1d60679f84b8c3218f721590233f825a69e645f163bfb","observation_id":"41e6173d-34ad-4678-9757-4994dabd0c72","resolution":{"observed_at":"2026-08-06T17:33:08.828828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:25:50.439035Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":23,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2507.10548."}