{"as_of":"2026-08-14T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:340a56beaf442daacff5773fa40a21501edba8e647a0ad1a66eb1f0634b793bf","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:55:03.686435Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:39:25.303896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T13:47:57.512626Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-08-03T17:06:54.531502Z","title":"Being-m0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-14T08:34:27.596886Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.531502Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:b32278e7f0164ba38ce49a8b886b64ac4466cba5d6a0f441ea4a5bf74a64df0c","observation_id":"f3f0f2b1-ba20-4233-91d7-cb8d54d2cfd2","resolution":{"observed_at":"2026-08-03T17:06:54.531502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":"2508.07863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Being-m0","venue":null,"work_id":"42fd4146-0990-40ec-b381-15079338824a","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-10T21:01:10.829067Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:7925f417c659f0a61ab32523a5630f11f936933fe95037982e844649b501e5ba","observation_id":"76dac94f-3c6c-4fa7-b748-124078c28352","resolution":{"observed_at":"2026-05-16T13:47:57.514056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-08-12T00:39:25.303896Z","title":"5: A real-time controllable vision-language-motion model , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07993","last_updated":"2026-08-08T08:02:37Z","snapshot_observed_at":"2026-08-14T05:44:00.631770Z","submitted_at":"2026-08-08T08:02:37Z","title":"MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T00:39:25.303896Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2608.07993"},"observation_digest":"sha256:b562fbc21b3e039111941e31ff414a8c89dc7aa0840356c647d220e851f340db","observation_id":"5fa7384a-329a-43d7-9e3c-f6db91017093","resolution":{"observed_at":"2026-08-12T00:39:25.303896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07863/citation-record","integrity":"/paper/2508.07863/integrity","json":"/paper/2508.07863/citation-record.json","paper":"/paper/2508.07863"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.061147Z","title":"Momask: Generative masked modeling of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.061147Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:be8767ec8cb9fe58e6d1ea3abf1330d1f97afb81997471291d88a7da43475526","observation_id":"dece0443-f9d0-4aed-8a4b-fb9ee5b6a50c","resolution":{"observed_at":"2026-08-05T21:54:57.061147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.194279Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.194279Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:c8bbc3992a93407d8a02015594c8ebf8386cf65895735f146e34ad597342d8ca","observation_id":"e7f6a5fe-b310-4021-88d5-e9b0c9f65b11","resolution":{"observed_at":"2026-08-05T21:54:57.194279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.356942Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.356942Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:6440256f6be43e2f34edaf1a7a83390099c87b1fee340c64fca34902ae511ee5","observation_id":"dff48fa4-f852-4f2c-843c-a6a25f92051e","resolution":{"observed_at":"2026-08-05T21:54:57.356942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:11.023145Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset.Advancesin Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"0980e49f-42c1-4d24-900c-4e0fa715ad23","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.480981Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:0b6c8b5217cf54308e87a313ab68455736d9eb247d80ce989d25323f2042ab22","observation_id":"fa0611e9-d169-49ac-8e34-ebb202c2a7a7","resolution":{"observed_at":"2026-08-05T21:55:11.071203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.627224Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.627224Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:21db331bf46fc8142b98ef662d30d3eafd0a560be148d490fae113a57375d9c0","observation_id":"8b3db17c-7c61-421d-81f4-80040385add2","resolution":{"observed_at":"2026-08-05T21:54:57.627224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.739675Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.739675Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:8d8804ef2b8b982c3b2397a721491587e5bf0dc79569c5ba81f0e063de8aafd4","observation_id":"1c21bda0-ecc1-410b-b15d-9684fde545d4","resolution":{"observed_at":"2026-08-05T21:54:57.739675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:10.755104Z","title":"A large-scale rgb-d database for arbitrary-view human action recognition","venue":null,"work_id":"9306ff84-7fee-4fd8-a72d-0782af1dac03","year":2018},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.899801Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:a11729b5dbdc86e4d99ca945afd8d68b36d6a6c9b5784c30c26b93951490a8e9","observation_id":"be59e44c-9ed1-4551-8228-2bee0d92fc49","resolution":{"observed_at":"2026-08-05T21:55:10.900308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16273","last_updated":"2024-11-02T04:39:28Z","snapshot_observed_at":"2026-08-12T23:58:05.996476Z","submitted_at":"2024-05-25T15:21:59Z","title":"M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation","version":5},"cited_work":{"arxiv_id":"2405.16273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16273","snapshot_observed_at":"2026-08-05T21:55:04.461224Z","title":"M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation","venue":"cs.CV","work_id":"56cf877f-819c-479c-b9b9-1289329896ff","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.024126Z"},"links":{"cited_paper":"/paper/2405.16273","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:de0af844ad2002ea00cc8498d13d545e134fdffb779c7b790afa151795a20848","observation_id":"5113d07b-6e8d-48e6-b842-1a78fd74b251","resolution":{"observed_at":"2026-08-05T21:55:04.531949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:10.393111Z","title":"Scaling large motion models with million-level human motions","venue":null,"work_id":"64e0ca1a-8385-49cd-aef4-6c50b071773a","year":2025},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.170476Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:98e6c1f04509629c042c09dbff8e281d4c067e6365b13afb4e96ef9fae372e27","observation_id":"74225f25-b5f1-48d9-a88a-24eecdcaf43f","resolution":{"observed_at":"2026-08-05T21:55:10.589979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:58.286611Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.286611Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:62c66d615a93c36bf0aa4642c52d8448a4df67d098da6da8a0ce0d9748015bd7","observation_id":"2fe7aa93-f7bd-4160-a6be-71415b12f3f5","resolution":{"observed_at":"2026-08-05T21:54:58.286611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.977213Z","title":"Temos: Generating diverse human motions from textual descriptions","venue":null,"work_id":"8bead382-61d9-406a-a120-64815148a547","year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.404718Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:7ee228399a78def4c10b6b09b73b92df305985d270aa2cdb4d4835d0fc779fb5","observation_id":"01277ddf-1995-4ea3-b713-52a20ec98685","resolution":{"observed_at":"2026-08-05T21:55:10.171990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.697258Z","title":"Language2pose: Natural language grounded pose forecasting","venue":null,"work_id":"15292b36-d021-42c3-9844-77427c19b6ef","year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.488840Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3d5953876e354129c18d5fa4321806f99e900243d145e0cc81c011af0247a5c1","observation_id":"c7e44568-127d-4782-b635-1021a5a3175c","resolution":{"observed_at":"2026-08-05T21:55:09.830066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.381310Z","title":"Motiongpt: Finetuned llms are general-purpose motion generators","venue":null,"work_id":"3a605480-55a9-4165-8e11-f4468c73fc23","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.572722Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:f304b8eb1556df7e8b55e7fbe65a0f3f257a332ba7e13a679b0bc55b266060c3","observation_id":"41af36a7-045a-4bf5-b95d-ddffd17f0d17","resolution":{"observed_at":"2026-08-05T21:55:09.518557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-12T22:13:07.514751Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-05T21:54:58.674215Z","title":"Motiongpt-2: A general-purpose motion-language model for motion generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.674215Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:83ebdca2e45c4250e4a6ff9cdb5960e82958d39d1affa3b0e4a5b8fff482da14","observation_id":"6f82544c-813a-4c9c-b787-9e4c43a67498","resolution":{"observed_at":"2026-08-05T21:54:58.674215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.069824Z","title":"Recurrent network models for human dynamics","venue":null,"work_id":"e91d78bc-1512-4d38-97fa-70b337f150ea","year":2015},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.788216Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:16b1309478eef2a43dd341558adf926468f406d15251443f8bbf2f860940eaa4","observation_id":"b5109d80-5552-4ce4-8338-eef799e9e219","resolution":{"observed_at":"2026-08-05T21:55:09.209540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:08.727845Z","title":"A neural temporal model for human motion prediction","venue":null,"work_id":"bc5a27c8-de83-4ad2-a18c-c8d4f92a3da5","year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.901849Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:364504e9b750630dca0378cf4b504ca02a76f13cec9239ca1a03a166f745eed0","observation_id":"34812253-a8e0-43bf-ad8c-09a39ec1b6b2","resolution":{"observed_at":"2026-08-05T21:55:08.899001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:08.345193Z","title":"A stochastic conditioning scheme for diverse human motion prediction","venue":null,"work_id":"17669fd1-bf3e-4ec6-9592-bee0d81c6f68","year":2020},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.988702Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:a51faf070edbd8f8e834d73ccdafdbe318eda2b06af8b3701013ddfe258f2ca8","observation_id":"add6134e-aa7e-4f2e-996d-651df9ac534f","resolution":{"observed_at":"2026-08-05T21:55:08.524160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:08.022035Z","title":"Learning diverse stochastic human-action generators by learning smooth latent transitions","venue":null,"work_id":"3848eba4-0b78-4a3e-b865-8c642559198c","year":2020},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.102481Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:42e7a8ea673d1aa332721adad61cc2c13028aa6d19501933db6c7cc93540d869","observation_id":"f2a32cee-4d38-4827-9e1b-3a6acd8c1de7","resolution":{"observed_at":"2026-08-05T21:55:08.190878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01700","last_updated":"2024-04-03T06:40:46Z","snapshot_observed_at":"2026-08-14T09:16:19.240721Z","submitted_at":"2024-04-02T07:09:29Z","title":"MotionChain: Conversational Motion Controllers via Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2404.01700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01700","snapshot_observed_at":"2026-08-05T21:55:04.315765Z","title":"MotionChain: Conversational Motion Controllers via Multimodal Prompts","venue":"cs.CV","work_id":"5e3248be-2079-4447-9adb-f9d24cc1222d","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.216321Z"},"links":{"cited_paper":"/paper/2404.01700","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2a38f97cc22e49f17ce667d8b81ff1c59634e9bf67411aa9c5bb9b28260053ef","observation_id":"3a35875b-133f-408f-856e-523ea6a1330b","resolution":{"observed_at":"2026-08-05T21:55:04.395699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-14T00:54:56.814837Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-05T21:54:59.349922Z","title":"Motionllm: Understanding human behaviors from human motions and videos.arXiv preprint arXiv:2405.20340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.349922Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d746aed15a0b7a5d0c4d3c3f71a3fd371cb429c3e8aed172291c43ebafeb6bfb","observation_id":"c0d45bf0-6888-4ddc-82c2-125238f37983","resolution":{"observed_at":"2026-08-05T21:54:59.349922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:07.791583Z","title":"Large motion model for unified multi-modal motion generation","venue":null,"work_id":"0af26456-33ae-4506-a46a-6a28d3e53dbf","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.472583Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:9035f1915d3dd831643558f57b83ffe9ccf8b7f5c462d59da832d3d6514f2c58","observation_id":"e8293c10-4cb8-43e5-b917-088f5d8a3fb0","resolution":{"observed_at":"2026-08-05T21:55:07.920463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:59.555702Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.555702Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:225302b500bf8283ed44c706fdef237e994877450b6b333f23e8e9313d79ad60","observation_id":"1dda8c6c-d1f5-4128-9e8f-1cc6bfa07b58","resolution":{"observed_at":"2026-08-05T21:54:59.555702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:59.654282Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.654282Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:067cac0bfa7d1b590654ae0d988b580b3ac56b37a59db0bc6999f932ff1c348f","observation_id":"341ddcb9-d858-4868-aabf-0b7c45401c19","resolution":{"observed_at":"2026-08-05T21:54:59.654282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T21:54:59.795393Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.795393Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:b42b9af7c74ff7ec83e29bbd89c4d486d64ac671fadb4c555f7ecc1fb513f160","observation_id":"1b49001d-75f1-408a-997f-aed91bd5b1ed","resolution":{"observed_at":"2026-08-05T21:54:59.795393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T21:54:59.894391Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.894391Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:75a51d61ae360db58505379fae2e6a4156c662934234bfe11b3cc9767c22fa10","observation_id":"20663abe-3cae-4f82-a4be-36d4943a4bcd","resolution":{"observed_at":"2026-08-05T21:54:59.894391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:59.990725Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.990725Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:9560b2023954b8fe8be3e511a13a708ffb77cbad5b856224d0e783bc0ce2f334","observation_id":"e480fb9c-08b8-4a63-ac25-0bbcf0bddad0","resolution":{"observed_at":"2026-08-05T21:54:59.990725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:00.076186Z","title":"Neural discrete representation learning.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.076186Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:14776ee786be204ad35ea3646c2ccab061cdc417e57f58d36296e709b4623d28","observation_id":"efa3ce64-3ad0-41e3-b8c0-f154ae49a476","resolution":{"observed_at":"2026-08-05T21:55:00.076186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:07.549527Z","title":"Locally hierarchical auto-regressive modeling for image generation.Advances in Neural Information Processing Systems, 35:16360–16372, 2022","venue":null,"work_id":"57d2e6e3-c315-4feb-b10f-5c17f5d97438","year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.164563Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:ce1190cbdb53ba51325df0ffd32ad61507a42752492baed46fd41cc594d60e30","observation_id":"ce96e7aa-98de-4a25-b0fe-a707dd9a63cf","resolution":{"observed_at":"2026-08-05T21:55:07.655546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T21:55:00.299651Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.299651Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:6502781fe278cdff6fbb43e4ca705d89eeba324fb9a6fbb3c074594393a3a470","observation_id":"085c8fec-7879-4d83-9ba4-3c5a4fa9332b","resolution":{"observed_at":"2026-08-05T21:55:00.299651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-05T21:55:00.438317Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.438317Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:69900c143651ccea6157ad1f5ca389558491ea7d9ad10e401c095f8d601eb63c","observation_id":"a7c21b9c-1ed6-46bd-a882-91d9cc60f152","resolution":{"observed_at":"2026-08-05T21:55:00.438317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10523","last_updated":"2024-12-13T19:33:48Z","snapshot_observed_at":"2026-08-11T15:50:50.414341Z","submitted_at":"2024-12-13T19:33:48Z","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","version":1},"cited_work":{"arxiv_id":"2412.10523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10523","snapshot_observed_at":"2026-08-05T21:55:04.154322Z","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","venue":"cs.CV","work_id":"4a0f7dc5-cb38-473d-85fc-28ee26244449","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.545792Z"},"links":{"cited_paper":"/paper/2412.10523","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:afeb2841df962405af3d29e49e0dad9effa3d926acb85edf0d401b3afc91362b","observation_id":"19116fe6-42eb-4ba8-9981-4744899a9c44","resolution":{"observed_at":"2026-08-05T21:55:04.212186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12978","last_updated":"2023-10-19T17:59:46Z","snapshot_observed_at":"2026-08-13T11:56:19.737423Z","submitted_at":"2023-10-19T17:59:46Z","title":"HumanTOMATO: Text-aligned Whole-body Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12978","snapshot_observed_at":"2026-08-05T21:55:00.655357Z","title":"Human- tomato: Text-aligned whole-body motion generation.arXiv preprint arXiv:2310.12978, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.655357Z"},"links":{"cited_paper":"/paper/2310.12978","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:ae039266670221a5d6432509dcf3cbe1ac68d4eb44cfdeeab7db6545bb779efa","observation_id":"37024144-556a-4f56-b275-8c5f52378f5e","resolution":{"observed_at":"2026-08-05T21:55:00.655357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-05T21:55:00.759463Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.759463Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2d2b3dfdcbddd1c398fa7f0a5b8fc0d23cf67fbd284287f9120db52c004c7d42","observation_id":"3ed91865-da65-4d6e-a1db-a804263ec9bb","resolution":{"observed_at":"2026-08-05T21:55:00.759463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:00.851447Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.851447Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:76d08f27719975d0b8e613020f0f9f0de4bd2bc9dea4feb3effc6306fc6d13fb","observation_id":"d1bf1a21-a541-42d9-9561-b1a77cfae242","resolution":{"observed_at":"2026-08-05T21:55:00.851447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:00.957517Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.957517Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:f5a7b9511d97b2ae7a9b9a992daf0508ab185b1db24cbfda00126f078546cf49","observation_id":"0dd5e36c-bab4-44e7-aca4-8ca3ae7de1e4","resolution":{"observed_at":"2026-08-05T21:55:00.957517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.067511Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.067511Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:12e277b7b59208dafbee1a56b367e6644bb12a5fd76cbbbff3d427c95e61750a","observation_id":"07474f84-7df4-418b-832d-84842521fee3","resolution":{"observed_at":"2026-08-05T21:55:01.067511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T21:55:01.153815Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.153815Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:965156665f80b8d1f6af9711adb8a1261fc9ae800e33965d3aba1ad4929b9e79","observation_id":"d0cc928d-8f53-4146-9b96-1e97f4d9a744","resolution":{"observed_at":"2026-08-05T21:55:01.153815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:07.223086Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":"4c06b1f4-7e87-4644-899d-88cb6432c97c","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.246734Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:23e892bf2993a729bda5fa4cd997de090a2f84d6c74a5f9f9382c2e6adaf3828","observation_id":"831fad93-aa76-4d93-82c8-7cf4f39ea056","resolution":{"observed_at":"2026-08-05T21:55:07.365209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14559","last_updated":"2024-12-19T06:22:19Z","snapshot_observed_at":"2026-08-14T05:03:41.909371Z","submitted_at":"2024-12-19T06:22:19Z","title":"ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model","version":1},"cited_work":{"arxiv_id":"2412.14559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14559","snapshot_observed_at":"2026-08-05T21:55:03.978993Z","title":"ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model","venue":"cs.CV","work_id":"00325b11-1e6c-45fc-938c-0263b8291837","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.311777Z"},"links":{"cited_paper":"/paper/2412.14559","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:39c8c63d1897adc66e2ce8f3153a03e098eb923b0716c056bde5a1711dc86bfe","observation_id":"4ae44264-f948-4cca-937d-02e8bf0a804b","resolution":{"observed_at":"2026-08-05T21:55:04.023236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.439383Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.439383Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3cdac57b80273771da0b16d8b53b08f9d03c837748922bbc868990b6259a93cb","observation_id":"d9f424e3-a602-4eb6-bb9f-bff04676e6e3","resolution":{"observed_at":"2026-08-05T21:55:01.439383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.545093Z","title":"Wham: Reconstructing world-grounded humans with accurate 3d motion","venue":null,"work_id":null,"year":2070},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.545093Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:1df79b1ae94ead8b45cd4aca530b9a9df7d17ba87cb65400b822e2a29d2c4881","observation_id":"16abd518-9938-4017-989e-04af108538c1","resolution":{"observed_at":"2026-08-05T21:55:01.545093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.629310Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.629310Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:51320b36a841eb6bd9302e455813b338f1a01c7d9b1d2074956400a9a67785f6","observation_id":"1ef57ef7-c289-471c-9781-0d3376cbafff","resolution":{"observed_at":"2026-08-05T21:55:01.629310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13790","last_updated":"2024-10-17T17:31:24Z","snapshot_observed_at":"2026-08-12T22:20:43.170420Z","submitted_at":"2024-10-17T17:31:24Z","title":"MotionBank: A Large-scale Video Motion Benchmark with Disentangled Rule-based Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13790","snapshot_observed_at":"2026-08-05T21:55:01.735535Z","title":"Motionbank: A large-scale video motion benchmark with disentangled rule-based annotations.arXiv preprint arXiv:2410.13790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.735535Z"},"links":{"cited_paper":"/paper/2410.13790","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:1f376494e5480291fb49caf3b7506e54b7bdb2044e91a0f065184b4fff4b9db5","observation_id":"a4e663f2-0d61-4a5d-acaf-797a31be13c3","resolution":{"observed_at":"2026-08-05T21:55:01.735535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T21:55:01.847632Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.847632Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d9cc0ec0a3f2bf0c489727864ccb1d6879c7ae85953712ae693030c737307404","observation_id":"519ee99e-1e62-4771-9393-ceb389115477","resolution":{"observed_at":"2026-08-05T21:55:01.847632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.956698Z","title":"Posescript: Linking 3d human poses and natural language.IEEE transactions on pattern analysis and machine intelligence, 2024","venue":null,"work_id":"5f14951c-8c75-4c39-b415-af1e67c5e46e","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.922185Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:1d9992e3ac76d4aae5ac210438695ce28b9b1e11f2aeb6dec843651dd1b8d222","observation_id":"8e52c3ca-4481-48e3-b569-1d8350ff632b","resolution":{"observed_at":"2026-08-05T21:55:07.069823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16781","last_updated":"2025-03-29T03:35:20Z","snapshot_observed_at":"2026-08-12T13:22:49.924005Z","submitted_at":"2024-11-25T08:06:30Z","title":"UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing","version":2},"cited_work":{"arxiv_id":"2411.16781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16781","snapshot_observed_at":"2026-08-05T21:55:03.803275Z","title":"UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing","venue":"cs.CV","work_id":"d26bddf2-af31-4e56-a001-7fc08c7b9161","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.001344Z"},"links":{"cited_paper":"/paper/2411.16781","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:4ec98a9624926aec665e5cb05fc401407faf10674d47fa34da94a2b58998b695","observation_id":"f031606a-9685-4d35-967b-9da7383f2d0e","resolution":{"observed_at":"2026-08-05T21:55:03.873453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.765776Z","title":"The kit motion-language dataset.Big data, 4(4):236– 252, 2016","venue":null,"work_id":"2efd5fb6-f394-4307-95d7-ae17d4ac23bd","year":2016},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.083256Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:915dee4023cdfec3bd878afd5e74c99b6c23168784b49371aaa757f552f8017a","observation_id":"26d89571-6974-453b-96e8-826bd48f83a2","resolution":{"observed_at":"2026-08-05T21:55:06.837633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:02.186443Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.186443Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:425faaac739241fc3aab7f0d1f16d4ad395b97d8543adb6895bd5b9c94df370a","observation_id":"c88c3d4d-616c-42ec-b458-2c6cfc015bd6","resolution":{"observed_at":"2026-08-05T21:55:02.186443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.650814Z","title":"Recovering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":"571a6533-97fa-4467-936b-89dd0491b151","year":2018},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.270194Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:af8de43d7875dec81c68b45b9a9280111361a24278d318f5067a50c4d85317b6","observation_id":"e600edf6-3a56-4126-bdd1-9dcb55995bc4","resolution":{"observed_at":"2026-08-05T21:55:06.713662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.540097Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset.Advancesin Neural Information Processing Systems, 36:25268–25280, 2023","venue":null,"work_id":"d31b73ab-5a7a-4a15-b74b-6dd74d3a4f62","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.345136Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3538e91936b97f10243b4b0ae4d8df13cc8a83ae6a0565e96dfe8824def6a884","observation_id":"95a54321-6915-4f40-b11e-4f536679466a","resolution":{"observed_at":"2026-08-05T21:55:06.590197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T21:55:02.419755Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.419755Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3a1eaf6447bba5e940370d5901d642aba3a7195ff547e7e624b80d069da19c01","observation_id":"ac2b0286-e91c-4598-8878-12aa803647ed","resolution":{"observed_at":"2026-08-05T21:55:02.419755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.382842Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":"514d816f-2e4b-460d-bf5f-f9943cb74a7f","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.501633Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:a698796f0674ea9f782575a34a98fa428b74970e04da543a699e9f30fd6ada4e","observation_id":"4b1eb614-d23a-4f42-9002-67d3e549c225","resolution":{"observed_at":"2026-08-05T21:55:06.463606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-13T14:35:06.773752Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-05T21:55:02.580215Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model.arXiv preprint arXiv:2208.15001, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.580215Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2fbb9431f418966cc21682b1f7ffb673ebadbbf5b6861e00bfa6d3076deb86c4","observation_id":"2938cc62-ac40-4c9e-b2d1-53d03875db61","resolution":{"observed_at":"2026-08-05T21:55:02.580215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.229834Z","title":"Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":"86b231d0-3ad3-4174-9955-b203b2e256b7","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.747962Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:277ce4295aeecba098a279431582b7e9e51140adeac56329a162a8f3e3477abd","observation_id":"159b2500-41a7-49cc-ac83-ec77fdb8669a","resolution":{"observed_at":"2026-08-05T21:55:06.313231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17013","last_updated":"2024-10-06T13:46:47Z","snapshot_observed_at":"2026-08-12T23:57:17.922885Z","submitted_at":"2024-05-27T09:57:51Z","title":"Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17013","snapshot_observed_at":"2026-08-05T21:55:02.826806Z","title":"Motionllm: Multimodal motion-language learning with large language models.arXiv preprint arXiv:2405.17013, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.826806Z"},"links":{"cited_paper":"/paper/2405.17013","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:444c31b9069110ea97bc47a9c113c9f6f197ac7f713b2ff1a59f011236216ae3","observation_id":"63b8103f-e63b-4970-bbd4-3bcc41f92c0e","resolution":{"observed_at":"2026-08-05T21:55:02.826806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.038987Z","title":"Avatargpt: All-in-one framework for motion understanding planning generation and beyond","venue":null,"work_id":"a52c3f4f-5bcf-4dd1-ac14-470632e6751e","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.910283Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3215bcdb90d70f94f436b6492902d107411fc3dca6bde001816a73b97506831f","observation_id":"5c5c879b-afdd-482a-875b-d6ae4e2c782f","resolution":{"observed_at":"2026-08-05T21:55:06.135640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.808781Z","title":"llamacpp.https://github.com/ggml-org/llama.cpp, 2024","venue":null,"work_id":"7838cf53-7cc6-4382-a3db-c8b6a65857ff","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.982817Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:ada453fd65ae9987a56754b41b5325907abb67704aff164ba5c435b265a61d22","observation_id":"63da06a9-a3db-4858-89f5-3acdbde51454","resolution":{"observed_at":"2026-08-05T21:55:05.927027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.633090Z","title":"Parco: Part- coordinating text-to-motion synthesis","venue":null,"work_id":"e4d7b9bd-f291-4584-9e1a-0ec142fd38b1","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.075835Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:760f619cacd002f44acbb1dc804c307735a3a74c429eccfb63dd48265d6fa131","observation_id":"60cd66d7-ba14-42f0-8102-68c5edc2b3df","resolution":{"observed_at":"2026-08-05T21:55:05.745015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.491995Z","title":"Fg-t2m++: Llms-augmented fine-grained text driven human motion generation.International Journal of Computer Vision, pages 1–17, 2025","venue":null,"work_id":"77486527-64d5-49ff-91d7-2d162b11514f","year":2025},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.191406Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:04a1ba047ef8121fab8d28a9349e06ef2ff16a5ee38cb34cd51c66d8826b5cf1","observation_id":"b5ff2380-7174-4532-9f71-1442afa78375","resolution":{"observed_at":"2026-08-05T21:55:05.563158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.322594Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model.IEEE transactions on pattern analysis and machine intelligence, 46(6):4115–4128, 2024","venue":null,"work_id":"9154da34-24b4-4e1a-8330-52a21150f01d","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.264774Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:ee546bd520ad8efc3baa86b7b7227475725f861340e0d211d08d866f33b3d197","observation_id":"f4fe6324-23d1-49cd-8c34-8ab627fa4359","resolution":{"observed_at":"2026-08-05T21:55:05.397712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:03.339648Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.339648Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:de329e77cffce7256d47fefcec9653d955922ed332f9259261c9ed2772924456","observation_id":"e8dd1cb8-d25d-4708-83cc-06817a31f57f","resolution":{"observed_at":"2026-08-05T21:55:03.339648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.145129Z","title":"Posetrack: A benchmark for human pose estimation and tracking","venue":null,"work_id":"05f29955-1901-41c0-bfc3-6c02f8d280b0","year":2018},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.411500Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:7b07aea1bb22f8c1e3aa8482b57a790baa2bfcdd54ba1fa6a0e92f852205b5e1","observation_id":"359e48f1-c9e6-47d1-8b3e-316920fdb2b0","resolution":{"observed_at":"2026-08-05T21:55:05.229691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:04.965717Z","title":"Resolving 3d human pose ambiguities with 3d scene constraints","venue":null,"work_id":"b46bab63-d752-40ba-9c8c-2806839a3037","year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.476511Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:17ad1d79c61de77cfec158ea1482d3ec4a5d50ea43b675b75519c5653550bb6a","observation_id":"4d4680ae-0b05-493f-b552-7d70fa057295","resolution":{"observed_at":"2026-08-05T21:55:05.051157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:04.795320Z","title":"Behave: Dataset and method for tracking human object interactions","venue":null,"work_id":"ffb3281d-1275-4809-a712-2d19a6c7ad45","year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.555056Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:c69ea72b707b46ca5534e1aa107addeb1543178186a2bd6dc84b213b08389a0c","observation_id":"a18f99fb-b686-4ff0-9033-a97193bf97dd","resolution":{"observed_at":"2026-08-05T21:55:04.881522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:04.635965Z","title":"the left hand is positioned below the right hand","venue":null,"work_id":"3ea2ae6c-23bb-4619-92c8-f5ad16957599","year":2021},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.686435Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:7b127c68cf6cfb493130061c82cd0192dd52f6ab3e5a3d9c523d2e96cfbf8dfe","observation_id":"a0088ee7-8b45-4f9a-9ff4-ac15d6d8754c","resolution":{"observed_at":"2026-08-05T21:55:04.677201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":5,"verified_fuzzy":28},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2508.07863."}