{"as_of":"2026-08-07T05:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b1870a2a9a96e90506965bb1e6787efca2b6bb46504e90bc944f3169c6a0351","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:18:26.355829Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21945/citation-record","integrity":"/paper/2507.21945/integrity","json":"/paper/2507.21945/citation-record.json","paper":"/paper/2507.21945"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.033902Z","title":"Finediving: A fine-grained dataset for procedure-aware action quality assessment","venue":null,"work_id":"199aeade-c72a-4af3-902b-5bf7979a3c64","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:21.844647Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:f9165bb706cd025368f0f16f6b5c733b181419c49499de476eb2fdf8627467db","observation_id":"293d6fb2-0392-45ce-9586-c84c1a239967","resolution":{"observed_at":"2026-08-06T12:18:35.144656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.799329Z","title":"Fine-grained spatio-temporal parsing network for action quality assess- ment.IEEE Transactions on Image Processing, 32:6386–6400, 2023","venue":null,"work_id":"3f8a2208-e331-4300-bd6e-7ed32cedf1a5","year":2023},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:21.954456Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:2d0d8d05b29482055e0b3822ce38110146c79ab2acb40f4fcbe6668589ba888f","observation_id":"e9c96844-2699-418e-9bf9-aea2a583ef50","resolution":{"observed_at":"2026-08-06T12:18:34.898184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.543848Z","title":"Learning to score figure skating sport videos.IEEE transactions on circuits and systems for video technology, 30(12):4578– 4590, 2019","venue":null,"work_id":"c6e30fa0-752d-4f1c-b7f0-09f795c74650","year":2019},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.098946Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:599af9b92ee965e2e0bc8763f0d11fd8b02be020ef7051c89af7ab642b5fc7b9","observation_id":"bce7b54f-aafb-4f97-b38d-1f2e3ad1d1ca","resolution":{"observed_at":"2026-08-06T12:18:34.671458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.299087Z","title":"Hybrid dynamic-static context-aware attention network for action assessment in long videos","venue":null,"work_id":"1809f683-76ca-471c-ae1d-a95c4bdf8813","year":2020},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.178255Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:ad82f9aa85dff9be5e8ffed590001ded575451e8f93101f7fa01c5385ff1e867","observation_id":"b9c9d0af-3ffd-43c5-bfa0-60fba00ce5e0","resolution":{"observed_at":"2026-08-06T12:18:34.388543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:22.271513Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.271513Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:57219ef4cbc2f28559f5c6e3b4fea52c757de257900c3d18664eb64682df04bd","observation_id":"f703451b-5f11-4694-a114-ee6f3d629405","resolution":{"observed_at":"2026-08-06T12:18:22.271513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:34.029050Z","title":"Likert scoring with grade decoupling for long-term action assessment","venue":null,"work_id":"64d46bb5-326d-45c4-aa56-8e663475353d","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.358013Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:7d37618dd4ab40f0edef66431968d646891ba1aa06a8d4c26647a8a723c1bb51","observation_id":"fae1c94c-ff63-46bd-b38d-4890b04186f0","resolution":{"observed_at":"2026-08-06T12:18:34.116411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.756285Z","title":"Localization-assisted uncertainty score disentanglement net- work for action quality assessment","venue":null,"work_id":"6aba282e-77ac-4c29-845f-c50599da5f05","year":2023},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.478760Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:3db39bbe7236b2d92c52aeca9e4190e6520ff60cfd337b82f89f1732f1c89c23","observation_id":"0355ddde-df52-4237-93d8-7814f517d19c","resolution":{"observed_at":"2026-08-06T12:18:33.861720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.454448Z","title":"Skating-mixer: Long-term sport audio- visual modeling with mlps","venue":null,"work_id":"53e506bf-53a8-41f9-a40f-5837fa4c0eda","year":2023},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.611670Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:2ba959f8b57661a1c8d8e97d31f0c7ae01d1023804337a6dd457752afaf68217","observation_id":"10f02535-4362-44a8-a5d1-6e4330fe6d0a","resolution":{"observed_at":"2026-08-06T12:18:33.569918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.189439Z","title":"Multimodal action quality assess- ment.IEEE Transactions on Image Processing, 2024","venue":null,"work_id":"cc812d63-278a-4a81-bc3a-0901bb5baa7c","year":2024},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.702717Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:a64c427eeb171108fbcdaa6f452e38afcd81f6aff2d5cb6ca03c022c3b200e6a","observation_id":"a137ae47-4f6a-4496-a78a-dbd49b3bc654","resolution":{"observed_at":"2026-08-06T12:18:33.296808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.975837Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"8deebdde-31bc-4675-9949-f53bf9e487d9","year":2018},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.758132Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:9ae2dc2937c70230b2193a51cccee29a7f6c733cf9ead8df91b2bc3fd64f20bc","observation_id":"42c0b6d9-8172-420e-9538-900c4e13dc03","resolution":{"observed_at":"2026-08-06T12:18:33.080761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.739603Z","title":"Dual attention matching for audio-visual event localization","venue":null,"work_id":"6545a7a2-3ea3-4b58-b7bd-d74ff38ec9c2","year":2019},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:22.823789Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:d9134b055b9b09587223d8e91cfec834c797aaa28e6ba7b91ceae80119a08f70","observation_id":"3aa4d9d9-625d-42c8-8ca1-a744569cd76a","resolution":{"observed_at":"2026-08-06T12:18:32.859041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.276165Z","title":"Egocentric deep multi-channel audio-visual active speaker localization","venue":null,"work_id":"ca88d39a-5611-493e-80b9-19ec23110a92","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.069552Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:bcbf53b1e325b4c9d8d1dcac02191eda58a62e9a4f4b352082ce058431d297f7","observation_id":"c5da39c2-3d3a-4cef-98d2-fadf74989a0b","resolution":{"observed_at":"2026-08-06T12:18:32.408078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.999381Z","title":"Assessing the quality of actions","venue":null,"work_id":"7b014774-1071-4e53-afd0-04c99ad78073","year":2014},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.128630Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:9ee24cce6431575a2c6e121c1d9f993f7cfbbafa2040246c65e2dd441939e78e","observation_id":"d69bf16c-1e26-4758-83d9-628fe87471fd","resolution":{"observed_at":"2026-08-06T12:18:32.134002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.852597Z","title":"Learning to score olympic events","venue":null,"work_id":"544b35f8-2759-4484-ba17-58ce0c1c0145","year":2017},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.200363Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:eeaecd9855db3614ca07e4fd921c2969d0298a358f37c3539f78d5ac7e2f1368","observation_id":"ee7b2f01-1aec-417b-b3bb-efc9d3d894c1","resolution":{"observed_at":"2026-08-06T12:18:31.939914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.632204Z","title":"Scoringnet: Learning key fragmentforactionqualityassessmentwithrankinglossinskilledsports","venue":null,"work_id":"9ab9970b-bbf2-4ce7-b59e-587bf45545a2","year":2018},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.255859Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:093f78c23ab063643b9354b2773c2fb73e3b29ede2e6e0c5dcadee26d763088b","observation_id":"6133f46d-31a4-4a7e-b90b-a5545b9c8fb3","resolution":{"observed_at":"2026-08-06T12:18:31.780758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.360326Z","title":"S3d: Stacking segmental p3d for action quality assessment","venue":null,"work_id":"13d7cd5f-5ddb-4186-9d53-2b0fe8218d42","year":2018},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.326548Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:03d5604077a0011a516af29617dad7688b1436b32988103cd10c629772031db4","observation_id":"2c24ff34-4a45-44be-8408-6740c5944ac1","resolution":{"observed_at":"2026-08-06T12:18:31.471727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.054396Z","title":"What and how well you performed? a multitask learning approach to action quality assessment","venue":null,"work_id":"68b250cf-33d5-4d8a-9a6a-d79091b6f8a4","year":2019},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.377327Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:b2b1237612483aa960ae3bf061a4f4bd8c956d3b64a2653392dc57c1341af59b","observation_id":"cbc69f9b-b598-4031-884c-9857ee33c4da","resolution":{"observed_at":"2026-08-06T12:18:31.211318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:30.845659Z","title":"Action quality assess- ment using siamese network-based deep metric learning.IEEE Trans- actions on Circuits and Systems for Video Technology, 31(6):2260–2273, 2020","venue":null,"work_id":"632c92be-cf60-4ac6-8b17-f2b330942e8e","year":2020},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.455277Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:5fbce9efcceb806566ce705cd221b7c6b818b6c2b779d7b6fc65b8133e8f819e","observation_id":"86725ee6-d879-47df-aea2-21bae0051371","resolution":{"observed_at":"2026-08-06T12:18:30.927185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:30.694368Z","title":"Group-aware contrastive regression for action quality assessment","venue":null,"work_id":"0e5f26f8-6ea9-4d7f-a3e7-f033c7ee2020","year":2021},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.594595Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:5a977c1ced069568f706d89c0ffecc2afe757801b44cdf408c021baacb778356","observation_id":"05c56ede-cb32-4a2a-9325-622501bcd876","resolution":{"observed_at":"2026-08-06T12:18:30.770604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:30.514641Z","title":"Tsa-net: Tube self-attention network for action quality assess- ment","venue":null,"work_id":"dee75583-d369-47ff-aead-248b34e64d19","year":2021},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.704637Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:bb1fbcc6e348669876f35f7405c59e800065a056277994ff9c446b269fd7bc1e","observation_id":"1bf7300b-4013-408e-8638-66c6b208df1e","resolution":{"observed_at":"2026-08-06T12:18:30.587767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:30.268974Z","title":"The pros and cons: Rank-aware temporal attention for skill determination in long videos","venue":null,"work_id":"8d6187c9-6257-4821-bd62-07d32959da66","year":2019},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.751508Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:f66d4d0f2579ddce931d7416069ac2e450707075db766f4e89b46b4320d29727","observation_id":"5b1f2cf4-99be-4007-b2fa-335733409e54","resolution":{"observed_at":"2026-08-06T12:18:30.370377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:30.111955Z","title":"Logo: A long-form video dataset for group action quality assessment","venue":null,"work_id":"54c9f660-868b-4c96-94e3-64175d2ec04b","year":2023},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.882275Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:8ed77c9e5c948e675c2cf5801ea97f0bc715ee286f4f95196901eb53f23b3fb7","observation_id":"ce7576cd-de75-4a86-b20d-eff8782e34aa","resolution":{"observed_at":"2026-08-06T12:18:30.174716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-07-06T08:52:26.716343Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-06T12:18:23.939472Z","title":"Audiovisual slowfast networks for video recog- nition.arXiv preprint arXiv:2001.08740, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:23.939472Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:65db1b3072848156cf1e33924e9e906e5f323b19f47a45a7e9e5f28f64307628","observation_id":"54681c95-aeda-4cf9-aca8-04ec0f6c8b98","resolution":{"observed_at":"2026-08-06T12:18:23.939472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.924543Z","title":"Listentolook: Actionrecognitionbypreviewingaudio","venue":null,"work_id":"451420e6-ed31-40d1-ae8b-80aac4b3e33e","year":2020},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.019897Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:eb8a8f0a4bf51e9c5e6167a26739c7b7d2f339f735959648cd505c08da56434c","observation_id":"81734ab5-1ad0-4503-83d4-00709ab74d6b","resolution":{"observed_at":"2026-08-06T12:18:30.005897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.512705Z","title":"Cross- attentional audio-visual fusion for weakly-supervised action localization","venue":null,"work_id":"05d9a9db-5507-4542-a3f7-8dd5df935ef5","year":2020},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.162198Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:e52285ec490505f455c56b0f6596aaa0b81a26387845c4ce1138961e7627bcc8","observation_id":"565f5d5d-8e86-4cb2-9ba0-be13bcebb5d9","resolution":{"observed_at":"2026-08-06T12:18:32.617834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.775798Z","title":"Cross-modal background suppression for audio- visual event localization","venue":null,"work_id":"0e3c60a7-4dfa-4e23-a1b9-264eabb33cf7","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.275209Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:8b6410fceecf0a71fd43dcb20597a3ef54e167a2c4b1ddaf243086b31814c321","observation_id":"e52dcf7d-07b4-465c-be09-7cb7d4688d30","resolution":{"observed_at":"2026-08-06T12:18:29.857858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.680310Z","title":"Mmw-aqa: Multimodal in-the-wild dataset for action quality assess- ment.IEEE Access, 2024","venue":null,"work_id":"cf09917e-9eb9-4313-a34a-8621008f5617","year":2024},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.438832Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:937c3509311a44495ca03d41e1571dd2a96b8eb9800ba413b62e185b9f3472aa","observation_id":"b365b3dc-c437-428e-b17f-2b8798d840de","resolution":{"observed_at":"2026-08-06T12:18:29.724551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.540652Z","title":"Vision-language action knowledge learning for semantic-aware action quality assessment","venue":null,"work_id":"e8720427-942c-4cb5-ac15-40159384f233","year":2024},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.554309Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:243184dae89fddcaf858ce531bcd11f216748d306220bd3ad454995e38dd1b6a","observation_id":"5316e41a-8695-4090-a504-b1b094029013","resolution":{"observed_at":"2026-08-06T12:18:29.608867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.417321Z","title":"Learning semantics- guided representations for scoring figure skating.IEEE Transactions on Multimedia, 26:4987–4997, 2023","venue":null,"work_id":"d0f94fed-d572-4120-89b3-39d33ded11f1","year":2023},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.665443Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:7d113ead18e1e3b794efd43921f293634a11b812ee867d816123d807cac08da4","observation_id":"373a5f44-f617-4a56-826b-dcf0f2b3c98a","resolution":{"observed_at":"2026-08-06T12:18:29.453029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.300264Z","title":"Temporal and cross-modal attention for audio-visual zero-shot learning","venue":null,"work_id":"0c682276-af80-4caf-97eb-bb8b6930692c","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.812348Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:731a899878afd42da458ce4e1d1d0359393b0f5f495b93ef98496033974de67e","observation_id":"6466f5bb-3bea-4602-976b-3fd74bde4804","resolution":{"observed_at":"2026-08-06T12:18:29.348648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:29.124262Z","title":"Cross-attention is not always needed: Dynamic cross-attention for audio-visual dimensional emotion recognition","venue":null,"work_id":"1603c02f-82d9-4fb3-9e0b-572b2ab1f5bb","year":2024},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:24.981888Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:1192fda118a2cc5508ad79fad0bc3ee7b8435c3239a089aed3b8087d4f5b5c51","observation_id":"28f464e8-07a7-4ac6-af2c-8f45d0800f4e","resolution":{"observed_at":"2026-08-06T12:18:29.201321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16438","last_updated":"2024-10-21T19:02:13Z","snapshot_observed_at":"2026-07-06T19:37:24.895623Z","submitted_at":"2024-10-21T19:02:13Z","title":"AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":"2410.16438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16438","snapshot_observed_at":"2026-08-06T12:18:26.626332Z","title":"AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition","venue":"cs.SD","work_id":"600299b6-bf5e-4070-8db7-589c61902e96","year":2024},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.094671Z"},"links":{"cited_paper":"/paper/2410.16438","citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:ec62eaa9452c5bc91e9f05320b5a9d2fd8068eb4b47fc1f237617b2d21220787","observation_id":"dc635a20-9a1d-41c8-b400-95e65f7d9f20","resolution":{"observed_at":"2026-08-06T12:18:26.702155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09212","last_updated":"2023-05-16T06:41:25Z","snapshot_observed_at":"2026-07-06T15:27:53.070867Z","submitted_at":"2023-05-16T06:41:25Z","title":"Cross-Modal Global Interaction and Local Alignment for Audio-Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09212","snapshot_observed_at":"2026-08-06T12:18:25.205516Z","title":"Cross-modal global interaction and local alignment for audio-visual speech recognition.arXiv preprint arXiv:2305.09212, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.205516Z"},"links":{"cited_paper":"/paper/2305.09212","citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:69d2a66318462b214e444c1d34792ac7c5978c6fd8e95e46963e93950a9aa388","observation_id":"81151f82-1911-418a-9873-2a844699de31","resolution":{"observed_at":"2026-08-06T12:18:25.205516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:28.849560Z","title":"Temporal alignment networks for long-term video","venue":null,"work_id":"670e1212-50ad-426d-aca6-116669cf9155","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.294446Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:7620494c71e18e08502abea4a00a3fff692f47a57339c7c9cda643e7518575fc","observation_id":"9a091c2c-f28a-4b37-a51e-d7c82d18db2c","resolution":{"observed_at":"2026-08-06T12:18:28.997529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:28.615287Z","title":"Temporal and cross-modal attention for audio-visual zero-shot learning.Advances in neural information processing systems, 35:38032–38045, 2022","venue":null,"work_id":"5eac7c58-3d20-49f2-ba1a-0e9f98a2fd39","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.400298Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:783a223ee1cefb482009c0377cd567c5996a15ba7b4f2ec1c5a7588490808c53","observation_id":"0cce93b2-4bc4-4ec1-b98c-a11a30d0c358","resolution":{"observed_at":"2026-08-06T12:18:28.715831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:28.423098Z","title":"Video and accelerometer-based motion analysis for automated surgical skills assessment.International journal of computer assisted radiology and surgery, 13:443–455, 2018","venue":null,"work_id":"8c18b495-2bb8-4b26-9de4-dc3248093071","year":2018},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.469481Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:e56a64f7f50f31a8aa6bf48d28275950f7d5a109b904aeb4209a0c6c8739302e","observation_id":"371a4223-90b5-496a-ad60-888a71e4af2e","resolution":{"observed_at":"2026-08-06T12:18:28.491535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:27.902788Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"2baf8e6c-a829-4e86-ac7b-bdfea555eaa4","year":2017},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.735323Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:46206fffb530d5c0a6e673f8f46478ade46560f3b3329372d018dc9700846339","observation_id":"be99137b-cb2b-4394-9f9e-23c44703000e","resolution":{"observed_at":"2026-08-06T12:18:28.040623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:27.792091Z","title":"Action quality assessment with temporal parsing transformer","venue":null,"work_id":"90ad07e4-06ba-41c9-a41c-d60380d3ab30","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.826751Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:41358e4ea130142d6b90c5bdfa8aaf279effe719a43a02f6a74169b4ef887e74","observation_id":"cae90976-fcc6-48fb-9880-545d7827f2bc","resolution":{"observed_at":"2026-08-06T12:18:27.837087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:27.609999Z","title":"Learning spatiotemporal features with 3d convolu- tional networks","venue":null,"work_id":"bc8ccaff-e13e-4d7e-8d99-6e70dafb61af","year":2015},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.887329Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:965020529f326971a537813a1df3575c7fe48170901e222f4aca3c121652fd54","observation_id":"47c93c07-361c-486a-bf55-ee1634b7f01a","resolution":{"observed_at":"2026-08-06T12:18:27.690611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:27.414113Z","title":"Video and accelerometer-based motion analysis for automated 43 surgical skills assessment.International journal of computer assisted radiology and surgery, 13:443–455, 2018","venue":null,"work_id":"79b04c0b-8e46-46d2-b175-954a32fc8dc8","year":2018},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:25.948741Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:4200641d7703338dc6629d8ce39e7981971c133af06490facbc332e224767ed5","observation_id":"a7d2812a-e2a4-4ec1-bf60-f120a2df2321","resolution":{"observed_at":"2026-08-06T12:18:27.509449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:27.213436Z","title":"Deep resid- uallearningforimagerecognition","venue":null,"work_id":"387862d8-508e-40f1-8556-1d610a9d7f37","year":2016},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.008721Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:4bcd197ef8605bcf324812d088a08025e61e2b2ed5e07c2175d60e77b03d8e91","observation_id":"be607b59-d4b6-4031-b12e-9f75cf801bc5","resolution":{"observed_at":"2026-08-06T12:18:27.296707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:28.196806Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"b79baae6-920f-43dd-ad5b-cfd42c5e4de1","year":2017},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.071958Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:9208e5a03dc25a00fc32c1f1ab41b35738fcdb996b8b94ed4adb6e8e0a6ac045","observation_id":"b63b5445-ccb8-4bc5-b274-386495198d89","resolution":{"observed_at":"2026-08-06T12:18:28.289591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-03T23:00:35.904734Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T12:18:26.116606Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.116606Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:56187f19b0c27138c8fffb4d5c342cdd0c9c5aa878af46c55ca40e305b14fca3","observation_id":"187f7f20-0af3-4e6f-a632-27b512db3adc","resolution":{"observed_at":"2026-08-06T12:18:26.116606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:27.006745Z","title":"Joint visual and audio learning for video highlight detection","venue":null,"work_id":"b025ce36-41b9-47b4-8362-021110e5fc9b","year":2021},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.176463Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:c3988e8a08d4a04e788dead38a07242e90bdb911c74097a1cf3a97c892fcad36","observation_id":"7f0a990d-0458-4ace-99a2-e20b3a350c74","resolution":{"observed_at":"2026-08-06T12:18:27.086584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07175","last_updated":"2021-06-26T14:24:23Z","snapshot_observed_at":"2026-08-07T00:06:40.885195Z","submitted_at":"2020-12-13T22:42:41Z","title":"MSAF: Multimodal Split Attention Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07175","snapshot_observed_at":"2026-08-06T12:18:26.255413Z","title":"Msaf: Multimodal split attention fusion.arXiv preprint arXiv:2012.07175, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.255413Z"},"links":{"cited_paper":"/paper/2012.07175","citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:7dd5262834e7702e253dbc69b9e5215c479a30e7b2348e407d2b74e1e1fdc2a0","observation_id":"da49cd3c-3a8c-444d-a127-ce5d3ba5b860","resolution":{"observed_at":"2026-08-06T12:18:26.255413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:26.827247Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"139a5a45-528f-4716-b354-d2ff7e07e020","year":2022},"citing_paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:26.355829Z"},"links":{"citing_paper":"/paper/2507.21945"},"observation_digest":"sha256:58c6d1dcc9b49f22820a5bc7894faee8e96ff7ae0817201a5b8694fca5bd0b31","observation_id":"be1ce44f-b478-4363-9b88-7c5c7f62d816","resolution":{"observed_at":"2026-08-06T12:18:26.885434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21945","last_updated":"2025-07-29T15:58:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:18:17.390006Z","submitted_at":"2025-07-29T15:58:39Z","title":"Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.21945."}