{"as_of":"2026-08-09T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:836127ef0564c42cee15007046dc596894bb9e10fc1a153eaf900419aa8ba78f","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:53:05.419742Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:53:05.419742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03657","snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Prior work ad- dresses this throughtemporal and semantic modelingand cross-modal alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"cited_paper":"/paper/2607.03657","citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:fd78f940247b343b80ad7a130eb5d8ae2fb183cee560ee9075727f9a69c72a26","observation_id":"904aa2ba-8e55-437c-8f3a-8f9c91a4b9e6","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03657/citation-record","integrity":"/paper/2607.03657/integrity","json":"/paper/2607.03657/citation-record.json","paper":"/paper/2607.03657"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Sign Language Trans- lation (SLT) aims to bridge communication gaps by trans- lating sign-language videos into spoken sentences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:f996e27c0bb715b28cab51e8f916131dd1bf143fbb49107f7969db53fc51e546","observation_id":"44f31bfa-a977-4f26-af64-c025b218ebd9","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03657","snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Prior work ad- dresses this throughtemporal and semantic modelingand cross-modal alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"cited_paper":"/paper/2607.03657","citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:fd78f940247b343b80ad7a130eb5d8ae2fb183cee560ee9075727f9a69c72a26","observation_id":"904aa2ba-8e55-437c-8f3a-8f9c91a4b9e6","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"SignLLM [5] maps sign videos to discrete tokens aligned with LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:596156f2f2eea14a795f78e7dc9aadd49e9b2e41f4c0a1d99852c07b3b681f05","observation_id":"eeddb7e1-89c9-4e83-82c4-fe481fe0d951","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Re- cent work leverageslarge-scale pretraining and multimodal LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:0325ee1f3521680bdaae23df3739c07f7c29c6451db74862e2de0c0557182bb5","observation_id":"9d36b98f-90a7-47a3-bc64-605afec9d8ea","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Translate the given sentence into<language>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:7af972c534cc16641e35b3196028f46ce3ac274a13969eb8954a4bea6c769e24","observation_id":"2d32709d-b02d-45a6-b90b-42852d90b0fb","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Experimental Setup Datasets.We evaluate on two benchmark SLT datasets: PHOENIX14T [25] and CSL-Daily [26]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:bd1b09ff171a8b6ef6ef9957f548261c3a171f957ab3bcf5a9397fd72d4729ce","observation_id":"df985ce5-4bd3-4222-9df0-a871dd45dd92","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:715a4b2ebc6a4979ec1c7de98c6c3026a251e947703fe61ea67359d9622b21f9","observation_id":"c81409e8-09fd-4e08-a012-c74491eedae3","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:8f48b24325556ec57a5581d66ecef4e0790676b8ad68c2f42980d0a2897982c6","observation_id":"642b8bcb-b2c0-4ebe-aef9-20b67b7de116","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Sign language transformers: Joint end-to-end sign language recognition and translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:35207ffb6fc4016287e7ed2492fc4aeb45666419767f0a7b1a42a7c16d1d75c1","observation_id":"45e7175b-e3e7-4d58-8488-ebfc66214358","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12556","last_updated":"2024-03-19T09:00:23Z","snapshot_observed_at":"2026-07-06T17:46:54.639222Z","submitted_at":"2024-03-19T09:00:23Z","title":"Factorized Learning Assisted with Large Language Model for Gloss-free Sign Language Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12556","snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Factorized learning assisted with large language model for gloss-free sign language translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"cited_paper":"/paper/2403.12556","citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:5f9f376b4f2da20345ec1b8a072a209af9d2bca5300b6efec420fe16124751ae","observation_id":"1266af36-d757-4300-b91f-8f7aa15ddb6a","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Gloss-free sign language translation: Improving from visual-language pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:166ae8d3bf014ac580623926588cae24aab71b738ea6f4186d52b04eb1d1e1cd","observation_id":"21f54591-24a9-4b3b-9817-13aa0b883718","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Leveraging the power of mllms for gloss-free sign language transla- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:5c2566bf21dfcd96255c222b28381be1190a285350ce6370c7d023ac4c926a5a","observation_id":"abf0959e-9119-4624-ad2f-a1b7f504f03c","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Llms are good sign language translators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:aaba063f99b194d3d76552bfff74febd920335a74451c6bf00c1cd28baa0d518","observation_id":"53095427-6741-48d3-8723-c0745c10db7b","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Lost in translation, found in context: Sign language translation with contextual cues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:fd79a3f2ec6f8d5ba11a51029950980160c69b93b390b3e85b4391702404d2bd","observation_id":"dbfc33fa-6e84-47ad-9f2a-ec8cdfbf987c","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04164","last_updated":"2024-05-07T10:00:38Z","snapshot_observed_at":"2026-07-06T18:10:53.622248Z","submitted_at":"2024-05-07T10:00:38Z","title":"Sign2GPT: Leveraging Large Language Models for Gloss-Free Sign Language Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04164","snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Sign2gpt: Leveraging large language models for gloss-free sign language translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"cited_paper":"/paper/2405.04164","citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:e12432c1f2085e253f35ce31db5033a4f24edf97eba7c6e41ba41f4f7f48f25c","observation_id":"f5e1c48a-cb80-4ae4-bc19-befe5bae6ba5","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Tspnet: Hierarchical feature learning via temporal semantic pyramid for sign language translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:4d1b0196cb29c6c18c56bd81f8d6c02f69b406fcdb4c85a387e0e8fd3f4a9ce7","observation_id":"e9d58d38-1a59-4ecb-b248-bf0117adca00","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Conditional sen- tence generation and cross-modal reranking for sign lan- guage translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:2cd62af604dff21d24f9f71d998b1d0985273a92f2343fb5a7c8762045106bb2","observation_id":"4b58aec4-71d2-41e9-aac2-f72c8c68e281","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"A token-level contrastive framework for sign language translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:bd6984fa46eab1f92906c7eb83e70328c7b19446811a3e5a7877243444ca4bfe","observation_id":"0b2a8b37-1673-4aeb-b5e4-3ae2e8ec5e11","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Gloss attention for gloss-free sign language translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:26b2c038df526d9499b8dd9a279e391be7799b4a1c00214316936662eba13b03","observation_id":"0dc7d26f-fe5a-474f-a41b-5cd7620aeb47","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Visual alignment pre- training for sign language translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:bf3e3bc256d4603c8f5d87e461852bca9a7c923c6e4d344d2a1ffbcc449235e9","observation_id":"ca9a3f79-3091-4547-9b77-5bad231a13da","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10593","last_updated":"2025-02-24T06:04:45Z","snapshot_observed_at":"2026-07-06T19:03:18.242943Z","submitted_at":"2024-08-20T07:10:40Z","title":"An Efficient Sign Language Translation Using Spatial Configuration and Motion Dynamics with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10593","snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"An ef- ficient sign language translation using spatial configu- ration and motion dynamics with llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"cited_paper":"/paper/2408.10593","citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:02261cd06db084f6aef38a3b68e177136ba88ac3e9f8000f45a24e0e3f603c62","observation_id":"4b541d6c-79b4-4367-a7d8-495388c5ac6d","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Better sign language translation with stmc-transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:08677c0bc3e3af2348805ac27db55ec7d6d3fa7493cccf003e5fee4379105670","observation_id":"58457a83-56e3-413b-9060-9485926f7cc6","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Lost in translation, found in embeddings: Sign language translation and alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:2ebaa5b3fa48d900f73211bb3c0a1e72811426341f0932c76e93747609468b04","observation_id":"e2d25ca2-ac59-4de3-9a14-e6329f930d5d","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Multimodal sign language recognition via temporal deformable convolu- tional sequence learning.,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:76ae332dbbb7e00bc6d39c81c1b79cc3f987d87f9006d1e8a9e4d978c85b7408","observation_id":"56c40903-7d60-4aff-8480-32c7eba70a65","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Multi-channel transformers for multi-articulatory sign language translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:b550517b9cd9b422fadd27f10f567200730870cd4b5ab59aedc09e4de45a7551","observation_id":"2468cb21-2394-467c-9cb3-81cdd806bb20","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Spatial- temporal multi-cue network for sign language recogni- tion and translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:fa7abbe2643b25d4a34d5a57b855acf24e201a90af4b124b336dc84b0f7460f7","observation_id":"5d8d1f0f-2055-45ea-8387-e00c117fe462","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Graph- based multimodal sequential embedding for sign lan- guage translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:8490f9e5143ba05862d03530a3302fd2cca728807e6faa67f522dd421dc02557","observation_id":"61c3a763-a5c2-4172-86aa-1f2ef5fe52c9","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Skeleton-aware neural sign language translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:c3c1fdc68cb8d1d7f9ce34ce266b9068beb55a204722e5c72da6e649bcf085c3","observation_id":"565ab00d-b204-4af9-9c4b-e5fdf8c5744c","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Two-stream net- work for sign language recognition and translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:c403ac079373fa8304761445891c8f5a1f1ca47cf552dd9d9f71413833041d7c","observation_id":"5c2752ac-d1c2-4699-a948-3259f7b9a05f","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Ustm: Unified spa- tial and temporal modeling for continuous sign language recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:ea2a6cb5b20651bd5b11ac325f0fb051a62952723b548da4249323f5881387e9","observation_id":"0bf15414-6b57-4033-9535-3d91fd91406d","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Openpose: Re- altime multi-person 2d pose estimation using part affin- ity fields,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:1c3df23180ef1490de8421ec0dbd96d4f454f497da3e6f74bd37c8a2ddc26843","observation_id":"d51bd3aa-e5ff-4acf-8d1d-e14eebc5a5e9","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Temporal convolutional networks for action segmentation and de- tection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:01a37fb055b4e7c65c2e071ef774f9c47a00e58b900df64664f5a883f74bb070","observation_id":"005b2082-0c03-48e2-8127-b7701bc67a87","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Neural sign language translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:746cf90dbdd05ab65cd20eb1091caa840cd578aee8bd7a561b91482d85f89a95","observation_id":"4cc18bda-1be3-4653-8566-decea2ce0c1b","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Improving sign language translation with monolingual data by sign back-translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:c39188d613519004d467853984eec0542218fd1a0451208268ea88a00ab22ce3","observation_id":"d932677a-5331-4ba5-a516-5f5aced9e2ed","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Stochastic transformer networks with linear compet- ing units: Application to end-to-end sl translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:d538c24cf89e987d2295758cf849b35bc95d6e2ab95ae7a62a7f14977db2f434","observation_id":"ab9a8202-c176-4fa8-9314-30088f71a9c9","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Mska: Multi- stream keypoint attention network for sign language recognition and translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:a9e2eb15a8fbba5948cfc4e49b6b6ed1120a2c409840854d1b49ffa811fb7e82","observation_id":"4e631fb4-d64c-49c8-b802-af43b1aed53f","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11096","last_updated":"2024-06-04T08:27:40Z","snapshot_observed_at":"2026-08-07T21:38:22.897566Z","submitted_at":"2023-05-18T16:34:18Z","title":"Cross-modality Data Augmentation for End-to-End Sign Language Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11096","snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Cross-modality data augmentation for end-to-end sign language translation. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"cited_paper":"/paper/2305.11096","citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:a8a8af095b45c6f49255d26fe3adcdb20da0f20bd55c3634d741cc2071263aa9","observation_id":"789c2d50-9bc0-45b0-925c-bdb1339e3292","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Crosslingual generalization through multitask finetun- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:f1bc2e316a3b2fbfe6fb8b7f7656fcbf204a09c1492937095e4e896afc3c6c17","observation_id":"490c6297-7a99-4be4-a976-c157a1ff7f45","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:c08f0950f19b01b0a95560f9b057a6b5f77e01e7d4a78f338905c9b5562526ee","observation_id":"c4114bb0-25e7-41a2-9793-96604dbc18e1","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:7db8581d069aa87fcc048d5b22db8e5f2db87727bafb5871e806f2dedff9be49","observation_id":"9ae2e96d-8417-4cd5-b12c-19048fb1af02","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Multilingual denois- ing pre-training for neural machine translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:ed8665692dcc51c406e713d4331434452ac226c6e64d21ff989b18d7832481e2","observation_id":"82606eee-2de5-4d61-bb27-1329984ec715","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:53:05.419742Z","title":"Ararea- soner: Evaluating reasoning-based llms for arabic nlp,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T00:53:05.419742Z"},"links":{"citing_paper":"/paper/2607.03657"},"observation_digest":"sha256:175062cf92905ff294172bd8155cd4b737bf7a920051c8cf60b7b2c53259010b","observation_id":"9795a18a-e8a6-4886-b498-f3686aa20b6c","resolution":{"observed_at":"2026-07-12T00:53:05.419742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03657","last_updated":"2026-07-04T01:17:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T22:54:37.430115Z","submitted_at":"2026-07-04T01:17:48Z","title":"ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2607.03657."}