{"as_of":"2026-08-08T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd3357ffb2002be232306a3028bd9e0bd9a71fa2af79740e889c63288532914d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:35.417654Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23465/citation-record","integrity":"/paper/2505.23465/integrity","json":"/paper/2505.23465/citation-record.json","paper":"/paper/2505.23465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:45.803970Z","title":"Face and Gesture submission ID 324","venue":null,"work_id":"99086962-f653-4066-9afc-2e1e6daeb3bf","year":2012},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.475958Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:43ebe88a4d13c9ac8da863196b4806b95997e6a72c00af55c852d859bcb05cfb","observation_id":"32ea3c2d-1d4b-4f78-b709-33f7b942f9ce","resolution":{"observed_at":"2026-08-07T12:48:45.895879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:45.507905Z","title":"Supplied as additional material tr.pdf","venue":null,"work_id":"a4752921-4eed-4c8b-86b4-87b550935819","year":2012},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.622104Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:d1060e7681976d95535306e3e41459c23a29e393f6cf3cc9ac4b9a34446d90a0","observation_id":"09eb3869-5cf9-42c9-a6df-73b56eb0397c","resolution":{"observed_at":"2026-08-07T12:48:45.645751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:45.183956Z","title":"Alpher, Frobnication, Journal of Foo 12 (2002) 234–778","venue":null,"work_id":"5f14a99f-2c3b-4791-ab79-4810647ce386","year":2002},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.801236Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ef6726b105270752c10814d7d8d33d0e2ddaae745f729f7906279baaa158fc0f","observation_id":"5f6d70bb-3eaf-4491-a527-19bdba68b390","resolution":{"observed_at":"2026-08-07T12:48:45.357202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.936078Z","title":"Alpher, J","venue":null,"work_id":"ae74fc6b-8f64-4fdc-ac8a-6156cc5d0320","year":2003},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.987467Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:de24715a61f8fde9082ac7d8e917b774dd9280eade3c1d87ad5157e3d7fccdea","observation_id":"9add43e0-9bdd-46c8-ab45-c8294a5369ea","resolution":{"observed_at":"2026-08-07T12:48:45.055520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.674672Z","title":"Alpher, J","venue":null,"work_id":"c7fb2696-630e-40e2-8e10-b4f4aab0f140","year":2004},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.160133Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:774b881c7308ad4dec13282325d6920bb70b46d6c9f288a7c826e6fd63aa6deb","observation_id":"571630ed-5f75-43c7-9d0a-4862a61d1683","resolution":{"observed_at":"2026-08-07T12:48:44.802769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.442302Z","title":"Goodfellow, J","venue":null,"work_id":"cf9679ef-59a8-442a-aaa0-6691362b4608","year":2020},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.328990Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ab84f2ab4134953c072893750f0a05824471f74ee2c6c14a37db7cf1f2ed2330","observation_id":"91abb601-e67e-4932-b726-f11d03afde80","resolution":{"observed_at":"2026-08-07T12:48:44.538082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T12:48:29.492325Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.492325Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:32e881d2117c1bfdc8d588cf17ac4c01330e13cf42387c3f631fada203c69506","observation_id":"1053191c-b1ee-4616-95c0-30ba3d8960cb","resolution":{"observed_at":"2026-08-07T12:48:29.492325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.243317Z","title":"Papamakarios, E","venue":null,"work_id":"7112d434-77df-4d80-9a35-113fa7e915d7","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.648535Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:c60dcc0aa661daeb89a00fbe8f15378514d43b1542fe9c01ec201e3566120f01","observation_id":"3087725e-f0ec-4e11-81f7-3a4044a47527","resolution":{"observed_at":"2026-08-07T12:48:44.330433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:29.800564Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.800564Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:a92fb448c864601aabfec94736efc9fa470a9ddbfe11a0f968588fdeb069a065","observation_id":"54fcf793-6162-4546-ba8c-b3f21e134268","resolution":{"observed_at":"2026-08-07T12:48:29.800564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.022369Z","title":"Chang, H","venue":null,"work_id":"8cd10127-49c0-4bbe-af81-a9f3678a5c12","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.954331Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:eed18089d6043ce940febf15a3093ce39965ee64fb45625bafd25e1cdd6f6865","observation_id":"6942e70e-1ed5-40f8-bcc3-bd89581804a1","resolution":{"observed_at":"2026-08-07T12:48:44.118328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.738137Z","title":null,"venue":null,"work_id":"b969ff81-8fda-469d-af13-cdeac8ebe148","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.088460Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:f50cebd9b25fa80eb5a8031bd0e3f81bec3048fba79b93080d4cc801364ce529","observation_id":"4248e582-5fea-43b9-b3a5-0fd9272746b0","resolution":{"observed_at":"2026-08-07T12:48:43.875932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:48:30.160886Z","title":"D ´efossez, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.160886Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0765e581bef9161884f4b8168dc463a97613f0d44a7aad98ab1ff2593658ed09","observation_id":"6a9cd3cd-e234-42a6-9acf-1c8e595d7127","resolution":{"observed_at":"2026-08-07T12:48:30.160886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:30.266521Z","title":"Radford, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.266521Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:01a9dd6c422355ac8854b54e303a380a7ee1ebd2edf0a7b0274de526eba3521b","observation_id":"1aa6e636-9e9a-4f57-b861-655d40731fbe","resolution":{"observed_at":"2026-08-07T12:48:30.266521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.540445Z","title":"Girdhar, A","venue":null,"work_id":"39f96f9c-e264-4861-8f1e-b12928e8c702","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.361411Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:46c81bb5903cbabafbcf51703fd176c57b08906b51f076b808a7773e50c94521","observation_id":"eae2489a-f3c1-4092-a69d-dee82b6cacb6","resolution":{"observed_at":"2026-08-07T12:48:43.630504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.258218Z","title":"Ahuja, L.-P","venue":null,"work_id":"5e41d2e1-f5cb-4cd9-8835-63f69b104d67","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.466051Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:e5396abc7b74deff303d17c25f8ef7b1441c56e36d16ed63536ee3b5464cf67b","observation_id":"d5478827-6875-4243-9fc4-d3a6fe27dfcb","resolution":{"observed_at":"2026-08-07T12:48:43.404961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.056639Z","title":"Ghosh, N","venue":null,"work_id":"ace7d65f-841e-4fc7-9612-be53d48cef52","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.566101Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0d30b1bfcca38cd9f717a978f13e011e61a4950d7f46f62981f9bfe71b6e99b3","observation_id":"06c43946-dbff-451c-8bdd-c76a56a7007a","resolution":{"observed_at":"2026-08-07T12:48:43.128688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.889442Z","title":null,"venue":null,"work_id":"407cff81-254f-4fdb-a21b-101ec529643d","year":2018},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.698912Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:af707380e8e67c7111e129197c7b3e7930f2882c62051dcb82c29edccf346913","observation_id":"d2f488c2-7cdc-4250-8b11-bfcfc665a08c","resolution":{"observed_at":"2026-08-07T12:48:42.989154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.668391Z","title":"Tevet, B","venue":null,"work_id":"5981c2b0-c1b1-4f45-963c-491e9a3cd438","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.798418Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:a0930cd91cc6ccb93e3fca4f8162e336b6cd249845007327098cc6a2bb48c796","observation_id":"af585d36-9fe9-46fc-8bbe-dc78a6ffd446","resolution":{"observed_at":"2026-08-07T12:48:42.762837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:30.897496Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.897496Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:1e8c97fa33c7fd294e37090c1f929cad616cb39bfbcfe6f213d0b399efba9066","observation_id":"482d63e1-fde6-4753-8e85-cdae8d56b253","resolution":{"observed_at":"2026-08-07T12:48:30.897496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.434489Z","title":"Petrovich, M","venue":null,"work_id":"fe53feba-59ff-4190-bd8b-27bd1f86d3b3","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.987703Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:e892a8f8ef126486cfcb76a58d102116c04a5485d6ca8bb4e915e0a74aad3df5","observation_id":"d2c80da4-0b32-4e74-a9b5-a579fbf2b6dc","resolution":{"observed_at":"2026-08-07T12:48:42.561607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.112979Z","title":null,"venue":null,"work_id":"dab31dcd-a3b3-4611-afe5-b90f5a2208da","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.061745Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ba126ac9e7b280ac9399227b3bd782840738a8506ad1847f2d3be822876fa22f","observation_id":"5644ff68-8094-484a-9fc0-758237eb7400","resolution":{"observed_at":"2026-08-07T12:48:42.275713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.793615Z","title":"Van Den Oord, O","venue":null,"work_id":"067bc1a8-3b84-47ad-86df-55ca7a482a6f","year":2017},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.180120Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:563ff9af43b7108b2590b67d472c770a4f0bddbe337304de8853f4178dd746a0","observation_id":"ee16f271-7365-421c-a09b-a91473a812b5","resolution":{"observed_at":"2026-08-07T12:48:41.936835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.515608Z","title":"Zhang, Y","venue":null,"work_id":"0122185c-13c4-4dc6-a02c-298441ec485b","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.325999Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:323460d24bc8832c7a9e5c729a04fdc8c4452c1df8de09f17cfbdfd0ddeadea8","observation_id":"2824cac4-861a-4fb1-9ec8-5487c4d6068e","resolution":{"observed_at":"2026-08-07T12:48:41.666554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.289026Z","title":null,"venue":null,"work_id":"e957ec12-de7d-4840-b7d1-5e1278074ff4","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.434958Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:e5f8c6276613889ac01a3420691db536bc3e0728e1653e86d7329464f698bb92","observation_id":"baa0919b-2b35-4071-98b9-fac8c4b39bc6","resolution":{"observed_at":"2026-08-07T12:48:41.425016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.100909Z","title":null,"venue":null,"work_id":"3387727b-832a-4988-b37d-a69132418ddb","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.550668Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:7441b147dfe090aaa223908380bdbf9544853324fc71b2b0a74c0886af4ba200","observation_id":"b57385e3-066f-474e-b9c2-18fcd60d4e48","resolution":{"observed_at":"2026-08-07T12:48:41.185407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.808153Z","title":"Tevet, S","venue":null,"work_id":"c8642e10-3a8d-40e5-a46e-5d20512fca6b","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.634605Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:fe52197af668dd2441644462a5a2adc229ba6aa5b0a4e79b48f55892a333f6a8","observation_id":"4d4d9b23-19f7-4a6f-8fdc-39aa9a80b8cf","resolution":{"observed_at":"2026-08-07T12:48:40.884976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.590183Z","title":null,"venue":null,"work_id":"375cf241-cd25-4515-9b27-d791fb6bb4fb","year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.718916Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:1d091fe974583a1e2a81569c883681615e5083f7dbdc3056c57060f95d0fa3b8","observation_id":"8e14ddc8-8658-4dc6-9160-fe9d75bb9825","resolution":{"observed_at":"2026-08-07T12:48:40.709463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.426471Z","title":null,"venue":null,"work_id":"bbd4293f-0524-423b-8ac3-d1505019870c","year":2018},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.809836Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:67c2d324770153aee78c05ae0a64952844c94908768b8078385542fbd8e0a8f3","observation_id":"1069b9bd-058c-481e-8a86-5634ed7d0af0","resolution":{"observed_at":"2026-08-07T12:48:40.488448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:31.883626Z","title":"Graves, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.883626Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:2029d50133d49315c6d75238c657aedf72a47f382a015f3a59c8dfeb950346dc","observation_id":"a9ffa00d-bce2-4edf-b00c-60196d91084a","resolution":{"observed_at":"2026-08-07T12:48:31.883626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.173650Z","title":null,"venue":null,"work_id":"f403aa6b-2380-4333-b8bc-fce3d6f0763f","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.971558Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:338dd6f84aca24a61844c85d26dd20b353bf0ef6832292667a8c5106945a04d9","observation_id":"258f33b0-1b12-4cb0-8463-8e8c337d3e64","resolution":{"observed_at":"2026-08-07T12:48:40.302430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.959850Z","title":null,"venue":null,"work_id":"d9584b53-45db-467e-9a67-5ea462839bc4","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.068432Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:839490ddd91d25b0df3f0ff79a00268cfc67a78239cf0801a7d197ff77a9fa67","observation_id":"522548e9-1524-4174-b9d9-d0ea74f62182","resolution":{"observed_at":"2026-08-07T12:48:40.059721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.677052Z","title":"Ginosar, A","venue":null,"work_id":"bd614055-996c-4350-aef4-97d630aece80","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.160091Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0f354a65b2ffb5f21ab1d23701210dcc5ec244b832ba98ac1a13e88fbb1ec869","observation_id":"6b8da444-74b6-4f75-a988-22f71f73cf3b","resolution":{"observed_at":"2026-08-07T12:48:39.863747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.425397Z","title":"Kucherenko, D","venue":null,"work_id":"8e1a529c-9117-46fa-9040-5106e635a575","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.270079Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:d6cc9a5483fe7085a5a094ac134280c3144d529e2bad49a8ea82d9b7a2a5b8f6","observation_id":"1519f6cb-080a-48e5-b5e1-67c166db0ba9","resolution":{"observed_at":"2026-08-07T12:48:39.574575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.043231Z","title":null,"venue":null,"work_id":"94725fa1-55b7-491e-84fb-e08afaaa71a3","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.425973Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:6d108dfe2ed42de1927df02ac8f723f77f681b04ba8c28399072dd52c320584b","observation_id":"07e75fe4-3023-44a0-9e9b-898b939246a3","resolution":{"observed_at":"2026-08-07T12:48:39.215381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.869521Z","title":null,"venue":null,"work_id":"d53d2bc8-aa27-42ae-bcd0-9698a01b2c67","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.540551Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:b17ecff1157799df9544f6e61a77ba9972d06e293b5b18589e4d3aa4b5da696b","observation_id":"7f0b348c-4e5d-414a-a9dc-1c698408088d","resolution":{"observed_at":"2026-08-07T12:48:38.951268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.666789Z","title":"Borsos, R","venue":null,"work_id":"14ba0e8f-ebe2-4a82-9a26-1afb3f4c42c0","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.704523Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:fe69127745a5f18983fe2e41df8ce1b3af16f8a906f2ebb4d3cc7539fa0e905a","observation_id":"e7c08a5b-d4ce-4f01-96c2-a1114365cc99","resolution":{"observed_at":"2026-08-07T12:48:38.770763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:48:32.844410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.844410Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:2a416d1e5b5fff494902f2e75fe18ead51ec1d9ab3cd0b269ec582404ecb5e79","observation_id":"5d732dd6-0347-4f66-9bb3-9698cf1fa76d","resolution":{"observed_at":"2026-08-07T12:48:32.844410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-07T12:48:33.068807Z","title":"Betker, Better speech synthesis through scaling, arXiv preprint arXiv:2305.07243 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.068807Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:a8fd083fc7847acfca0b18d2262145a01396de85a4c35b30bd7a6bf8d4a4ebb1","observation_id":"9951754c-b7b0-4e2a-9983-da0f89676296","resolution":{"observed_at":"2026-08-07T12:48:33.068807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.501481Z","title":"Plappert, C","venue":null,"work_id":"657a78ec-fff4-4005-ad86-7e870e32de47","year":2016},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.301703Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:3b1310521b0bb9b82b079d7dcf6f84ffd8e81624e4732a13e75330ae9ba0835f","observation_id":"7f156e53-90cd-40df-979c-ebd5d1ef1455","resolution":{"observed_at":"2026-08-07T12:48:38.590821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:33.462793Z","title":"Vaswani, Attention is all you need, Advances in Neural Information Processing Systems (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.462793Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ee67247dc0b72bd8f7c1b34bd96a24d6eaa0d72aaab12d83554a1884743654b9","observation_id":"0fc1d520-aae1-4238-8358-a83a245b3a88","resolution":{"observed_at":"2026-08-07T12:48:33.462793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T12:48:33.623830Z","title":"Jiang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.623830Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:facedc731560f816f0df1489494a044d8893ee91199a35728dcf7bf936246959","observation_id":"80a0caee-1176-4f7a-9ba9-c988ee5e6f94","resolution":{"observed_at":"2026-08-07T12:48:33.623830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-08T11:30:10.105282Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-07T12:48:33.768138Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.768138Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:fedd70e5a18be388a2a27e41f1ce1a71266b5270277d8a68d45cdefa3dc5f1bf","observation_id":"64a5c0d7-4d35-44c3-a43e-fa2a2e0ab991","resolution":{"observed_at":"2026-08-07T12:48:33.768138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.324776Z","title":null,"venue":null,"work_id":"b7ba1865-0d4f-482b-92e8-5432e010a03a","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.936843Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:cb862fb862c6a766af854016424e13f286efc40ab6bfbabccfacf4226cbdc071","observation_id":"24371080-31e8-4dda-bd68-7f4ddeba936e","resolution":{"observed_at":"2026-08-07T12:48:38.396233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.170843Z","title":null,"venue":null,"work_id":"7b8e95e3-9236-4e4d-aa17-42d1b01a74ea","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.087078Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ef40030089443d196cd5dc339d5f54369585da2bb7d7b8c40ca10ffe70b7ce08","observation_id":"94042ffc-8e29-4b14-bfb8-297c32c71635","resolution":{"observed_at":"2026-08-07T12:48:38.245274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.009787Z","title":"Zhang, X","venue":null,"work_id":"e2755b31-7b42-4fd5-bf01-1269791dea23","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.192711Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ab2fef94b2f259d01ff6595c40acae49583f94e7ce85313f5c8f14621e0b259f","observation_id":"604e0350-9459-494a-92e2-eda1eacc011b","resolution":{"observed_at":"2026-08-07T12:48:38.088696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:37.708278Z","title":null,"venue":null,"work_id":"519992a7-27f8-428d-91b2-7f4821e0a503","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.278339Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:a54e16ec85c9659881db16d2443165eb7125dbd41c2f66821eba835bdb92b322","observation_id":"2676b814-a22c-4953-9389-e0c63c9537f4","resolution":{"observed_at":"2026-08-07T12:48:37.855229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:37.386402Z","title":null,"venue":null,"work_id":"30d53d34-4b36-45da-9c42-ba22c74bb1cf","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.456483Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:9655c8241b4277ca8d0caccce5b1e1e449b3eb0ecd41c32bf57231c4c057895d","observation_id":"ffc36118-95dd-49b1-b241-3d57952f7dfa","resolution":{"observed_at":"2026-08-07T12:48:37.500603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:37.082519Z","title":"Dabral, M","venue":null,"work_id":"da545fd2-92e6-413b-9810-1b79b4cfd4dd","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.611123Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:ac5bbb52a30f8289be7e348a933e824e9eea2e4dd57afaf669fbaf28af801255","observation_id":"9ebbe528-828b-4028-b70f-ff871db71a68","resolution":{"observed_at":"2026-08-07T12:48:37.226424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.790974Z","title":null,"venue":null,"work_id":"34c81768-d6b6-499c-93c2-eb871e49fd09","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.684759Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:e805819a8d72f6f187c25c99e01ab9e71978452f7f3ca8bc5ad2f99280a426cd","observation_id":"296db859-b2e7-49df-9a39-1b8b8f92e549","resolution":{"observed_at":"2026-08-07T12:48:36.932038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.540260Z","title":null,"venue":null,"work_id":"91f7fd41-a4e3-49a1-bd79-065afa11eedd","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.786104Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:9ba39882bba566cea577b7e2b0ec89df1ccc51d41ffe364e572bf50750a34a04","observation_id":"a044f2f2-a95e-47aa-a8a6-957c1c9e9e49","resolution":{"observed_at":"2026-08-07T12:48:36.625489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.375387Z","title":"Zhang, T","venue":null,"work_id":"f5d18907-f001-457e-8280-90c69d9f3953","year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.870144Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:edc2a77b71fde9557e835920cf54e4a2893dbf320c74cd418d4290e86dc13c28","observation_id":"07626d1b-0423-4bbc-9ab3-aabdb5e0afa8","resolution":{"observed_at":"2026-08-07T12:48:36.456265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T12:48:34.974938Z","title":"Devlin, Bert: Pre-training of deep bidirectional transformers for lan- guage understanding, arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.974938Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:b3543d83782c94a51f2fc6accde668b6acc6211b961417af88329ca95194dc4c","observation_id":"ab6206b1-2297-4c0a-b10d-8448da4298e8","resolution":{"observed_at":"2026-08-07T12:48:34.974938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T12:48:35.069080Z","title":"Chang, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.069080Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:71a09ebe21104d673aee958c4b5195c005de3218a9f2ab4ca3d39b13cf8c1d33","observation_id":"f51b3af5-c512-4de2-977c-a437fe25ccf4","resolution":{"observed_at":"2026-08-07T12:48:35.069080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:35.160866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.160866Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:817206efd920d1e4c1b8e4b6f09b55a4733cd1600dcb8ed059a188d27e006d68","observation_id":"32aeb13b-a4f7-4ef5-b82d-b793e9dca5e7","resolution":{"observed_at":"2026-08-07T12:48:35.160866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.178677Z","title":null,"venue":null,"work_id":"c898fcf2-1192-4147-b21d-add303c2415b","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.228773Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:c5d6a8f5ed8921a28e2a5bb2a64b34f93630c94375ac07f232c8623c48961170","observation_id":"e589bee9-b1e2-47af-93ce-f14663d2fff6","resolution":{"observed_at":"2026-08-07T12:48:36.274151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.008799Z","title":null,"venue":null,"work_id":"cc40cd8e-a3b2-42be-8f69-885c6954a210","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.315875Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:76044f8286ae731df0609c4525c27bcb4fddee6e6160ebc285eb7fa0800477fa","observation_id":"6b04e5b3-6223-4ba1-bab1-cbec05d3fff3","resolution":{"observed_at":"2026-08-07T12:48:36.095689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:35.808401Z","title":null,"venue":null,"work_id":"eb737aa0-5df1-411d-b774-fb40c34e22d2","year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.417654Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:eb945907b897a7b9b3036252f4681e79c449cb05c529afe4bb204eb62816efaa","observation_id":"eb6641f5-fd8b-49db-91b9-88f21d3b7ba4","resolution":{"observed_at":"2026-08-07T12:48:35.904153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2505.23465."}