{"as_of":"2026-08-14T06:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37ddad6a3ff9b9ad35665b99023a019c85d8c709d9d4df06f9c7d42d6036e4e2","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:27:18.614377Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:00:28.350003Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.161769Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.12231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12231","snapshot_observed_at":"2026-07-02T17:27:15.161769Z","title":"Install: Context-aware instructional task assistance with multi-modal large language models","venue":null,"work_id":"a201cef5-73f6-4932-b72a-a808a598a761","year":2025},"citing_paper":{"arxiv_id":"2511.18127","last_updated":"2026-05-15T06:06:57Z","snapshot_observed_at":"2026-08-12T00:34:54.573058Z","submitted_at":"2025-11-22T17:22:24Z","title":"SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T17:53:19.002603Z"},"links":{"cited_paper":"/paper/2501.12231","citing_paper":"/paper/2511.18127"},"observation_digest":"sha256:ca118445b47030e6248af1a6192e8eca1d3bb12b0173915a70cdd749c9d40dbe","observation_id":"1a817673-2a56-4d5d-916d-4a9b06e41a2b","resolution":{"observed_at":"2026-05-21T17:54:18.278334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.12231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12231","snapshot_observed_at":"2026-07-02T17:27:15.161769Z","title":"Install: Context-aware instructional task assistance with multi-modal large language models","venue":null,"work_id":"a201cef5-73f6-4932-b72a-a808a598a761","year":2025},"citing_paper":{"arxiv_id":"2604.03486","last_updated":"2026-04-08T04:29:20Z","snapshot_observed_at":"2026-08-11T04:39:37.187316Z","submitted_at":"2026-04-03T22:17:10Z","title":"VisionClaw: Always-On AI Agents through Smart Glasses","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T18:12:34.183092Z"},"links":{"cited_paper":"/paper/2501.12231","citing_paper":"/paper/2604.03486"},"observation_digest":"sha256:d868ae45f1f1b3dc2136c9b4cb1bdbd0102c5e1386683eb629ba2e4b9dfe4db2","observation_id":"94abaaac-ea99-486a-89b4-b240171202ed","resolution":{"observed_at":"2026-05-13T18:13:05.498964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.12231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12231","snapshot_observed_at":"2026-07-02T17:27:15.161769Z","title":"Install: Context-aware instructional task assistance with multi-modal large language models","venue":null,"work_id":"a201cef5-73f6-4932-b72a-a808a598a761","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2501.12231","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:a681bdc5a83e1cbd3727a3e35ce1ec23f47f51f58f907bf260ba42bbafa28b08","observation_id":"3b18f4b1-b9d9-41b9-9fb7-55667d3f9008","resolution":{"observed_at":"2026-07-02T17:27:15.163371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12231/citation-record","integrity":"/paper/2501.12231/integrity","json":"/paper/2501.12231/citation-record.json","paper":"/paper/2501.12231"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T17:27:18.147094Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.147094Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:8e44e475eb38fca335aad72e51d8afaf4f538743dbc211ea00cda5de2c6e32e7","observation_id":"0f054d61-0dba-499f-bdf7-2471f4a6d132","resolution":{"observed_at":"2026-08-10T17:27:18.147094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.153382Z","title":"Ht-step: Aligning instructional articles with how-to videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.153382Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d7f14e65d12e88fb59fd388b6eaf33acd015a09657775fe3f5b517fa4ed4a70c","observation_id":"bbc7e294-1f2e-42a4-baa8-c94c11f1c69b","resolution":{"observed_at":"2026-08-10T17:27:18.153382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.159361Z","title":"Unsuper- vised learning from narrated instruction videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.159361Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d2538af250a0535a6e839ef95bb7401a06c38f0424e083f8fc419fcb4af292bb","observation_id":"0fd5688d-92c4-439c-9b05-de697e4f6142","resolution":{"observed_at":"2026-08-10T17:27:18.159361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.164584Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.164584Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:a68440bbf39f7a9e09f7641be3d09b32158ee19b08139938b5d9a09fb5a97fd8","observation_id":"3a441990-3e0c-4b3b-9787-2254fbc2ab74","resolution":{"observed_at":"2026-08-10T17:27:18.164584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.169866Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.169866Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:64470f433c46c5d857552a27c52fbba0c5da9be1f87765d000c45e0d64cb396e","observation_id":"c9fb148e-45cb-41a0-b77a-feb5ee36bcc4","resolution":{"observed_at":"2026-08-10T17:27:18.169866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.175183Z","title":"https://www.anthropic.com/news/developing- computer-use, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.175183Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9d1ed092eab768a78596a468b1cfbbd63fe5b79aa1a442ad064620f2f1a29d7f","observation_id":"f91d33f1-4595-4952-b0cb-f65cf552446a","resolution":{"observed_at":"2026-08-10T17:27:18.175183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.180832Z","title":"Video-mined task graphs for keystep recognition in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.180832Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:ec5741e3cb85a9327a0a83c53cb33b14926fd7fc4514b1825f149ddea388f2d4","observation_id":"f612e43d-53cd-4fbc-b5f4-4c457b0e5899","resolution":{"observed_at":"2026-08-10T17:27:18.180832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.186508Z","title":"Detours for navigating instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.186508Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e7299770add36721f6c1517e00a2a846110dad209b521314c146c9c6f388036d","observation_id":"bd3ec09d-363e-4712-a532-65b93d9943f6","resolution":{"observed_at":"2026-08-10T17:27:18.186508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.191609Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.191609Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:0c3010d2edd1a46dfe8cf6cbd9fbca7e5b48027f88e8c59ba894e1e979475512","observation_id":"6a74ed87-5bf5-4e06-b027-655d79e4f239","resolution":{"observed_at":"2026-08-10T17:27:18.191609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.196739Z","title":"Procedure planning in instructional videos via contextual modeling and model-based policy learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.196739Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:518329387aaa7fecaa7c1907d3bdeba86c66fd27bf16b0b66cc319bd87548f1c","observation_id":"5a9d14d8-935c-4e9b-a745-08498ce1091a","resolution":{"observed_at":"2026-08-10T17:27:18.196739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.201677Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.201677Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:621affe1d8432e057612ba8e0d9a698b068374cf666c93262c6876ad7daead0f","observation_id":"fe6c2e33-9f1f-4e96-bbd2-b2531c6b019d","resolution":{"observed_at":"2026-08-10T17:27:18.201677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.206432Z","title":"Procedure planning in instructional videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.206432Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:a41b9eeba4fb3f7112ae48298b3a46710ce82924dc97012ea1fc5f8a82c85f8c","observation_id":"ef2fe9c7-d606-4e31-9992-1f3a3d34a5f7","resolution":{"observed_at":"2026-08-10T17:27:18.206432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.071259Z","title":"Temporally grounding natural sentence in video","venue":null,"work_id":"06c8c049-c40b-45d0-999a-35457d73f7a8","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.211601Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:6e71f6f58128fb1d27d852e6b55cf6367ff1d68e959c20c40cc9b69ba08b92df","observation_id":"9c129299-5f51-4509-88bb-069ccd546940","resolution":{"observed_at":"2026-08-10T17:27:20.077125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.045583Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"420c7c23-e247-4ae4-b48c-fce63f459b0e","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.216331Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e02fc32a08a3e82c481af523bffe15c626a2c2517b61d9b0a01a09c2bbb616ec","observation_id":"0564b7c4-b66d-427d-b20f-8925c9539acf","resolution":{"observed_at":"2026-08-10T17:27:20.051969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.026993Z","title":"Semantic proposal for activity localization in videos via sentence query","venue":null,"work_id":"aaa689ff-39e0-4fb0-8db7-0c6f2fe83acc","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.221166Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c6371d7200fda83c11c365da88f9277eba8ac5efc983c1486fa83709a7956f56","observation_id":"86bbecf3-2c85-4636-a1de-28804f6ceac4","resolution":{"observed_at":"2026-08-10T17:27:20.032877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.008102Z","title":"KGPT: Knowledge-grounded pre-training for data-to-text generation","venue":null,"work_id":"f932bb4a-f0ec-42bd-9fde-a2a0bfbc9139","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.226036Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c16a14382864f4cebcf1c92308c44225c209e95670a70e4471a0ec506d037b80","observation_id":"f00acf7c-0e9b-4e87-bb24-a4de1732b50c","resolution":{"observed_at":"2026-08-10T17:27:20.014111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.990126Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a99f5571-f657-4873-b8ec-5a426ebabb9d","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.230690Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b956596cb7586c444fbe252c4d1b2da0b624c146fc85af43fd3da438ef096b5b","observation_id":"c78474aa-08c1-4bfe-9001-d22221ae367e","resolution":{"observed_at":"2026-08-10T17:27:19.995691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-07-06T18:05:11.700127Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-10T17:27:18.235459Z","title":"From local to global: A graph rag approach to query-focused summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.235459Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c45cdc43dce0b1803f26766dc6f13deb0f0e394b11e069853b491f31b55ae7e3","observation_id":"2ed87957-4a6a-47db-acb3-e2d79d793410","resolution":{"observed_at":"2026-08-10T17:27:18.235459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07409","last_updated":"2023-09-14T03:25:37Z","snapshot_observed_at":"2026-08-13T10:14:00.856545Z","submitted_at":"2023-09-14T03:25:37Z","title":"Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":"2309.07409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07409","snapshot_observed_at":"2026-08-10T17:27:18.789177Z","title":"Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos","venue":"cs.CV","work_id":"e0659bfa-e332-41d1-b501-4ed03522e36e","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.240608Z"},"links":{"cited_paper":"/paper/2309.07409","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b28a04aab7e108013dc79ae688e39df4b362f02ad7746e9f7591c994a055a78c","observation_id":"d04cc3f4-08c4-41c6-bd1a-7323530553ce","resolution":{"observed_at":"2026-08-10T17:27:18.797148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.972639Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"cbe0a6fe-0f94-4f5b-9d31-15373c892436","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.246444Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f2a3ec80abcf763d332e2f307ddecf1b1e6caa7e2f3af6a6e311bcdfeb3be626","observation_id":"b72e409f-5eea-483d-8074-0b85a7d1c6be","resolution":{"observed_at":"2026-08-10T17:27:19.977834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.251469Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.251469Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e7b55d84812c27ca5d44bfd271451fb6c8de4abc866baeaf86b6fe3ff42c997f","observation_id":"248d6cc9-cd8e-4fe7-aeb6-f54c9509f8ed","resolution":{"observed_at":"2026-08-10T17:27:18.251469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-10T17:27:18.256148Z","title":"Retrieval- augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.256148Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d13804c0cc43dd959da9c9bdfe7c048e7398317ef1bbe0891554cabd1911b915","observation_id":"629d54ac-d2a0-4cf0-a721-22f9663b7c5e","resolution":{"observed_at":"2026-08-10T17:27:18.256148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.261755Z","title":"Mac: Mining activity concepts for language-based temporal local- ization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.261755Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:eb2c605346b7d327d185c8bd08b018e3db50b1701eb1a2c8d7e26fb71e2c5b05","observation_id":"cc755edc-ea2f-4e1c-8cd0-93431f93e330","resolution":{"observed_at":"2026-08-10T17:27:18.261755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.266660Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.266660Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7abd8ec96b9edb6655688820ef44cecb74d394d89cf71fc9754e7c93fc797f23","observation_id":"537d9060-b12a-4da7-8cec-e84dec96dfc6","resolution":{"observed_at":"2026-08-10T17:27:18.266660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.923160Z","title":"Radar: automated task planning for proactive decision support","venue":null,"work_id":"e5a7f6db-81bc-489b-9b3f-46bbda0e5a55","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.271492Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7d893c280c260c6aa6d6d878458aeeadc337c77bf34951490bf8b0361e87e73c","observation_id":"81d1ae0f-f85d-46d6-b357-d1cc5c09400d","resolution":{"observed_at":"2026-08-10T17:27:19.928432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.904028Z","title":"Retrieval augmented language model pre- training","venue":null,"work_id":"ca232471-604f-489d-aae2-584225a724cd","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.276299Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:078d87e3f49ea4435e36078aa06ea14901d92dcf231c0c983beae8fe9363ef64","observation_id":"170d0ab5-d947-44b1-9229-e48d410d753d","resolution":{"observed_at":"2026-08-10T17:27:19.911731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.886427Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"e1a27699-2a00-4bfc-b02f-3596b3ebb3b5","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.281075Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:76759ef0cdcaee8a571fc6214982927810b84804605ff2e68c992d1e62b4dbea","observation_id":"246d6b37-dad7-46cf-83e6-2d983773ddd9","resolution":{"observed_at":"2026-08-10T17:27:19.892002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.286179Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.286179Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7a17dba6f471b2eeea0820d8804d68fc3e46b8b30ee5f54a36092cc234749b19","observation_id":"fd43daab-b8d6-491e-b28b-8a999a1cfcae","resolution":{"observed_at":"2026-08-10T17:27:18.286179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.858515Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"84f8c44f-cb66-4585-bb26-30b4cae87e12","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.291143Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3c5871a5dfdebe417a7411a5ef629d3355250dc5c22c97d3f584b39be9ede06a","observation_id":"2d50f50e-e48c-4099-b735-611dcdb025ad","resolution":{"observed_at":"2026-08-10T17:27:19.864426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.840818Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"630a7b36-5e30-4767-83cb-05fa1cfa52d5","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.296118Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:a2c8e300e2db95d419f9db663b85bcaac9c5826137c1cbab1b55809bafd891c8","observation_id":"048154c4-394f-48b6-a5e4-456912107e24","resolution":{"observed_at":"2026-08-10T17:27:19.846787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.824316Z","title":"Language is not all you need: Aligning perception with language models","venue":null,"work_id":"757f2d1f-e700-489f-b83e-741f8302efea","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.301317Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:86f54890e2f2ec62889bf3af4d8dd5d35f5ba5f22d948316d9662caf8c005bc6","observation_id":"b5ed1157-9431-4931-a58e-1f8b0c20658a","resolution":{"observed_at":"2026-08-10T17:27:19.829639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.807266Z","title":"Leveraging passage retrieval with generative models for open domain question answering","venue":null,"work_id":"f94bc3e1-f6d4-4466-bc36-e433ad182201","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.306835Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:63998221660f9ff014dfa04718a115c4b905e1ba195cf349c78bf3e8ea333c81","observation_id":"300761ce-e88f-4c10-981d-959ac6b77067","resolution":{"observed_at":"2026-08-10T17:27:19.813004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T17:27:18.311567Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.311567Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:db93df32559562eeacd7fa6372e5068a7373e7d3b62da56623345e2efddaa48c","observation_id":"3ef6a6de-5536-4722-b939-7b113c4ef4fa","resolution":{"observed_at":"2026-08-10T17:27:18.311567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.317157Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.317157Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c74de3f03b29c0135fc9b8ba77771fb6c1d702314b76edd5956e1cb6adbf7a87","observation_id":"a0310a70-554e-4f9b-9f44-de75ffca7a9a","resolution":{"observed_at":"2026-08-10T17:27:18.317157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09305","last_updated":"2018-10-18T05:29:41Z","snapshot_observed_at":"2026-08-12T08:14:30.190326Z","submitted_at":"2018-10-18T05:29:41Z","title":"WikiHow: A Large Scale Text Summarization Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09305","snapshot_observed_at":"2026-08-10T17:27:18.322049Z","title":"Wikihow: A large scale text summarization dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.322049Z"},"links":{"cited_paper":"/paper/1810.09305","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:0e3de341f9764c59ff47f3207e9eb680e61b41ce92d14fdfebc77533759b2d24","observation_id":"1aa40df6-34c4-4764-9a09-ecfe61dc25a9","resolution":{"observed_at":"2026-08-10T17:27:18.322049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.779599Z","title":"A survey on temporal sentence grounding in videos","venue":null,"work_id":"eb386220-d646-488a-b958-28b819034b20","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.328096Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:663b476ff773900d6167433769a7da9ad3023e70f710849f31136936fcbbeae9","observation_id":"9bad06d2-7f42-44ae-96b8-95d227ef9d82","resolution":{"observed_at":"2026-08-10T17:27:19.785086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.761795Z","title":"Tvr: A large-scale dataset for video-subtitle moment retrieval","venue":null,"work_id":"ea8607d0-98b4-46ae-8ffe-7b2b770e19bf","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.333044Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:358abe77bea313d5da86e9f5c4dfb5c67fe6eb30db2b8519a6c8a299aeaa3af3","observation_id":"4f859fb8-ec1e-47e5-bdac-e4c9aa136e71","resolution":{"observed_at":"2026-08-10T17:27:19.767356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.743848Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"6f091ae0-13fe-4df5-86fe-18d844b6af0b","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.338050Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3f4e1eb7643547130fbde825848652f1d5ff0be394fa74cc83400d9d9a3eccb0","observation_id":"b3dabebf-3f94-4b74-a5b4-6ec0448383ea","resolution":{"observed_at":"2026-08-10T17:27:19.749524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.343420Z","title":"Chatting makes perfect: Chat-based image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.343420Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:df4c3923208235de5e3e13d0785ac89fa447815b8034243628ddc9a5c4a79143","observation_id":"596d4a41-5f75-49d6-be14-de21ac0339ef","resolution":{"observed_at":"2026-08-10T17:27:18.343420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.714730Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"dce349d5-391b-4661-b58e-79234d659af5","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.348350Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:0aa7c9070460511088f65668269ff43f0b1da94d91d56d45e94bea03defb95dc","observation_id":"c7e9112a-b8ab-44e2-92bf-84a31838eade","resolution":{"observed_at":"2026-08-10T17:27:19.721183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.353346Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.353346Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b6ce1d9408b9c0d0ce73e9f61cf8d42464a546f632494364876294f5a7e814de","observation_id":"e8f42b6c-0d31-470d-8001-d8f90161d8e3","resolution":{"observed_at":"2026-08-10T17:27:18.353346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.684507Z","title":"Skip-plan: Procedure planning in instructional videos via condensed action space learning","venue":null,"work_id":"1a030462-8933-4a8d-b993-9d354d0d0c3f","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.358932Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f24b1adf2af91c4fcc647f85138aef815fbea038d353840d53d628c9c2f37842","observation_id":"07b40416-83e2-4efc-bbd4-0a23843c2bbb","resolution":{"observed_at":"2026-08-10T17:27:19.690149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.659420Z","title":"Cohn, and Janet B","venue":null,"work_id":"44d7e473-bad9-4434-9d65-97a10c21d545","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.363704Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:2ac87f3c0fa2a22ae0954c590d4629795cb9f8f7bddf9ae78efd3da7fb777c41","observation_id":"a7f9a262-5fb1-419d-b595-0fca782911c5","resolution":{"observed_at":"2026-08-10T17:27:19.665546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.635271Z","title":"Learning to recognize procedural activities with distant supervision","venue":null,"work_id":"899dbdcc-7df2-4d34-a3cd-9590e5f95400","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.368912Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3fd6d78e0f64c6ad4beae1623f8eea7bba794afeae5f8664374917bd88102a8f","observation_id":"40b457fb-a7cd-44a8-a55b-8708313d02b8","resolution":{"observed_at":"2026-08-10T17:27:19.643121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.609051Z","title":"Jointly cross-and self-modal graph attention network for query-based moment localization","venue":null,"work_id":"43b83f51-0869-4bc3-b203-35aed0c95c2c","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.374456Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:70d05dfe04a472a24addd8bcfc2e5712bc752b72ca56cb36fc80c889eebffe1c","observation_id":"4713edc8-2e9f-4a33-acec-590ae14c0c9d","resolution":{"observed_at":"2026-08-10T17:27:19.617330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.380143Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.380143Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3ca06069781f7e937b8b360917deb378ec260fc96c8cd67852ab07c2edbb09dc","observation_id":"d8bfad8e-0392-4876-af25-c9613c35bd01","resolution":{"observed_at":"2026-08-10T17:27:18.380143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.385014Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.385014Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:eb394aa75459143947eb6d9fb8dd6598a18303203eda92fd20240510977a0fc7","observation_id":"b8aec459-d859-4fbd-9f72-631649fb012d","resolution":{"observed_at":"2026-08-10T17:27:18.385014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.562407Z","title":"Attentive moment retrieval in videos","venue":null,"work_id":"5dfe6c88-4486-4935-82e7-2ceced61b079","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.390493Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d5cc7caec7f8ddf3ab6051926273843e1c53646b567b67e9fcf53b4f2b4c653b","observation_id":"46da08f4-c521-47d8-8139-6a60145d8163","resolution":{"observed_at":"2026-08-10T17:27:19.569112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.538096Z","title":"Language models of code are few-shot commonsense learners","venue":null,"work_id":"ccfa4033-32c2-415c-907e-36f4a26aba80","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.395669Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c6274c2affe7690b341e4e6064b04d28493fa655cc233c2ecad8f91e2c4d3b82","observation_id":"26decaed-decf-42f3-85d4-e172b0f4d7a6","resolution":{"observed_at":"2026-08-10T17:27:19.545580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.510874Z","title":"What’s cookin’? interpreting cooking videos using text, speech and vision","venue":null,"work_id":"49fd8656-67f1-4518-a372-04d48548951b","year":2015},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.400639Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:43ca06036020378c7702aad03746f97dd3e1a9414fb09f3b50b052c634d43fab","observation_id":"ebe4190f-1994-4be1-b33b-a277349828bf","resolution":{"observed_at":"2026-08-10T17:27:19.517289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.489144Z","title":"Howto100m: Learning a text-video embedding by watching hundred mil- lion narrated video clips","venue":null,"work_id":"b9e6ed97-e636-4f8c-907d-dbe73bcd2c3d","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.405575Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:60ec6a4600c8c8af4df9e120e2b89b66fe0e5e0835864fed38535ba4c93ad24e","observation_id":"8abe8ae2-99f4-4a9e-8f58-fab46928dc7c","resolution":{"observed_at":"2026-08-10T17:27:19.496609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.464028Z","title":"End-to-end learn- ing of visual representations from uncurated instructional videos","venue":null,"work_id":"af1409e7-91ee-40cf-b677-d0445f08b9cf","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.410996Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3a4384dd6003d4fb82efb30eb867995f029f205de41708beb844e50cb40d0f5c","observation_id":"0f3350a2-a0a3-4501-ad92-c2c0d25d5f24","resolution":{"observed_at":"2026-08-10T17:27:19.470230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13519","last_updated":"2023-03-23T17:59:54Z","snapshot_observed_at":"2026-08-13T12:18:11.173458Z","submitted_at":"2023-03-23T17:59:54Z","title":"Learning and Verification of Task Structure in Instructional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13519","snapshot_observed_at":"2026-08-10T17:27:18.415992Z","title":"Learning and verification of task structure in instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.415992Z"},"links":{"cited_paper":"/paper/2303.13519","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f6ddc330e1b18fe1c744e8ed0a81b96954e3ff1619ec28fd062fc6407051ea81","observation_id":"ad815325-c0ba-41c6-a0dd-6595078478a7","resolution":{"observed_at":"2026-08-10T17:27:18.415992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.444925Z","title":"SCHEMA: State CHanges MAtter for procedure planning in instructional videos","venue":null,"work_id":"0e52f8c6-431b-4adf-8353-854bade910a1","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.421653Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:35583093048d3d3c28fe8fdb3a97fc91819d3f5c342de85b52b35971143c78d7","observation_id":"ae29bc64-05ae-4610-b9f1-c961e70fb6e0","resolution":{"observed_at":"2026-08-10T17:27:19.451365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.424085Z","title":"Virtualhome: Sim- ulating household activities via programs","venue":null,"work_id":"4526518b-23bb-4135-8c37-66dc9898eb09","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.427256Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b0d4c0a9fac63b591555bc48dfc4e564a95456dd011bfa5fd6195266b4e17621","observation_id":"46042b3c-b577-4cd8-a223-dec461577ac3","resolution":{"observed_at":"2026-08-10T17:27:19.430224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.432722Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.432722Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e0ba703bb124c0e4185a963a62d4f2c11737f5ccce8b6a48000bb7d75d6604d3","observation_id":"1d462551-7fc9-4673-824b-d3ef509b4255","resolution":{"observed_at":"2026-08-10T17:27:18.432722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.392528Z","title":"Grounding action descriptions in videos","venue":null,"work_id":"f32046c2-32a9-4b3c-8cd6-74a415227bfe","year":2013},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.437992Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:2931dd67e13091d33ffd92d729a66c1bd84b2c347c649a52c581a42a8ec3076a","observation_id":"f28cd14f-2aa5-49f4-b2f8-1edd37df038a","resolution":{"observed_at":"2026-08-10T17:27:19.398146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.374611Z","title":"FLAP: Flow-adhering planning with constrained decoding in LLMs","venue":null,"work_id":"d64df349-f2cd-417c-8080-5fe36886fb93","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.443152Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:37ce1691f6d8525660de69ac49256bc20f33b3ff1b1e333ed473342ce3ecf273","observation_id":"8f268d0b-267a-4bcd-b7ac-7362cd2a945d","resolution":{"observed_at":"2026-08-10T17:27:19.380232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.357281Z","title":"proScript: Par- tially ordered scripts generation","venue":null,"work_id":"efbe4f4b-1138-4cd2-bc23-e07eb7eef5e2","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.448309Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7eee648a0f69cef6f6443c555b22bf32500ad3c3afa50e04b81d5ebe4671d13e","observation_id":"69608492-668a-46ee-a34e-8077fe24d1a5","resolution":{"observed_at":"2026-08-10T17:27:19.363004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.339927Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"35adcc99-5470-4a34-a1b3-3b21be8602c9","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.453462Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:0c1112f10f39ce1be0bf8ed3c8336f4edd772d64e5dc38792ee6f06464342d4b","observation_id":"88d099c9-b89b-4ee9-b1a2-b817958e3567","resolution":{"observed_at":"2026-08-10T17:27:19.345705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.322329Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":"fe3e1201-c4a4-4667-93dc-e4ac162777b2","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.458789Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:73f15b68de33bc10397633fa99238dfe2a7aa7994eda3803b9ec5ef680452c48","observation_id":"374b58e8-0949-41aa-ae82-225144ebb97e","resolution":{"observed_at":"2026-08-10T17:27:19.327594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.305127Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"2d7e3401-e2da-41cb-adc2-3fc41dded381","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.464824Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:321a036e7c256d7c3e57f7a29061db3c8590f4bdf17b96634ffccca3371ff655","observation_id":"5c00df61-fe98-42ae-aa1e-54de161d9b76","resolution":{"observed_at":"2026-08-10T17:27:19.310703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.287747Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"c5bacdd7-7693-41cf-92a1-e559d648a20b","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.469567Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9f2344abd6e7a0a298ce4eb5c23e705c5c946df5ff648f1006e769127d052b44","observation_id":"ebf6b249-9a9b-4921-b8c6-45eb5f078a1a","resolution":{"observed_at":"2026-08-10T17:27:19.293438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02655","last_updated":"2022-05-30T19:45:05Z","snapshot_observed_at":"2026-08-13T15:49:33.733918Z","submitted_at":"2022-05-05T13:56:18Z","title":"Language Models Can See: Plugging Visual Controls in Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02655","snapshot_observed_at":"2026-08-10T17:27:18.474723Z","title":"Language models can see: Plugging visual controls in text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.474723Z"},"links":{"cited_paper":"/paper/2205.02655","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c4646196cabc65577b247861b1c3fa41d9546bb2e258cda35365682c36264e59","observation_id":"c3a0b2e7-5820-41df-a9ef-2d276b799ea7","resolution":{"observed_at":"2026-08-10T17:27:18.474723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.271321Z","title":"PandaGPT: One model to instruction-follow them all","venue":null,"work_id":"53bf6ea9-5382-480d-9487-38a07996419a","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.479891Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d56d3ab32514ea2be9c810800c1111a92cbb6614706198822340c82e7fef2fee","observation_id":"6019f744-9b5d-4a78-9201-ffe1265ca81f","resolution":{"observed_at":"2026-08-10T17:27:19.276653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.252052Z","title":"Plate: Visually-grounded planning with transformers in procedural tasks","venue":null,"work_id":"44682dae-8583-4591-8811-270b24e3bfaf","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.484978Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:0c48aeb00434649f7cbc7cb0ecfe89f5b5c117820bb18eeee8d8037cff828165","observation_id":"f9f1a374-9afe-4810-83be-9ba1448966c0","resolution":{"observed_at":"2026-08-10T17:27:19.258622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.233608Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"c9ba0a7f-c095-4627-8884-5a4e87d4169f","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.489713Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:ad0eb55bd089b3da0ffccddb1f9a8cba42dbf2684a731b2a9d5fc2183f382b91","observation_id":"76415b0a-33bb-4fbd-98bb-489517242b8a","resolution":{"observed_at":"2026-08-10T17:27:19.239508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.215758Z","title":"On the planning abilities of large language models-a critical investigation","venue":null,"work_id":"1f9aaf08-a850-4386-9d37-4cc35766d3f1","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.495158Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b8a389fcfeb2ab458fc10ee0ceee17e2e3334d0e49431095a66696b4e2efa6d7","observation_id":"a2a0d350-3c6b-4c88-ad2a-6c639902c601","resolution":{"observed_at":"2026-08-10T17:27:19.222261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.197302Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"ea7f57a1-485a-475e-b00a-412ce3b73f12","year":2017},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.500019Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:4a76478bce2849b4a733439ac5134847615d006af231c812c3de96ee9a83b1be","observation_id":"ecf651f8-0f62-4594-85cc-a4041e7331b5","resolution":{"observed_at":"2026-08-10T17:27:19.203062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.180024Z","title":"Event-guided procedure planning from in- structional videos with text supervision","venue":null,"work_id":"b9670287-a731-4dd8-a171-9a1c8908cb21","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.504726Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d9bb80aa58db62c831c5c04661f6d3efd10a8d6eb16cf82e44bcd09266f36bac","observation_id":"d7d46fa4-61ed-4a8f-8c20-036ce1a5e244","resolution":{"observed_at":"2026-08-10T17:27:19.185574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.162551Z","title":"Pdpp: Projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"90c64c05-5a37-455f-a9d4-bc1a5f91c40f","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.509417Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:fd7ba8d44609459ca80f6b552201e140c568d1c03532161e4d9e86cba31516c9","observation_id":"aa1704bf-798f-4e21-9317-a7a01628461f","resolution":{"observed_at":"2026-08-10T17:27:19.168578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.145157Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":"e244c50d-390b-4ead-849d-d71503e43e6b","year":2016},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.514360Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:235567d4acbbdebed0385b0cdcc062093e6988cba3a697945431739b0267d1e8","observation_id":"641a44df-1b47-42d3-b018-956b5133109d","resolution":{"observed_at":"2026-08-10T17:27:19.150365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-13T20:29:03.722242Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-10T17:27:18.519058Z","title":"Visual chatgpt: Talking, draw- ing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.519058Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:508334714880e2214b487176168b41af96022b990d04bc9753b9ba2ef8d7bf58","observation_id":"5155ce14-7170-4533-a1bc-32587b290c6d","resolution":{"observed_at":"2026-08-10T17:27:18.519058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.128195Z","title":"NExt-GPT: Any-to-any multimodal LLM","venue":null,"work_id":"fab5ffac-faa2-41fe-8637-885c064e4a9a","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.524104Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:6e6d7697c0902aac063003f8bce0b354227ce1f701255eb8a961cf2bc7c65d53","observation_id":"9f82821f-3eaa-4d58-9597-5dec1e9624c7","resolution":{"observed_at":"2026-08-10T17:27:19.133657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.108918Z","title":"Rethinking spatiotemporal feature learning: Speed-accuracy trade-offs in video classification","venue":null,"work_id":"eaf1a940-67ea-43dd-80b7-a7d4d226c5ec","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.528664Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:76df7cc4a4f8b35ed56e540c0e652945d308f759cf0d91b542c85c80783338b3","observation_id":"bfe34a2f-97a6-47ab-8583-2618443845c0","resolution":{"observed_at":"2026-08-10T17:27:19.116500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05128","last_updated":"2023-02-10T09:17:52Z","snapshot_observed_at":"2026-08-13T12:47:33.294489Z","submitted_at":"2023-02-10T09:17:52Z","title":"Translating Natural Language to Planning Goals with Large-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05128","snapshot_observed_at":"2026-08-10T17:27:18.533727Z","title":"Translating natural language to plan- ning goals with large-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.533727Z"},"links":{"cited_paper":"/paper/2302.05128","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:5b39f766db5dfb091522f4465775aaa9614d11dde837b66cb48f894fc871d193","observation_id":"b4329a38-a98a-4794-bac9-b97886dcf609","resolution":{"observed_at":"2026-08-10T17:27:18.533727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.091612Z","title":"Multilevel language and vision integration for text-to-clip retrieval","venue":null,"work_id":"1454cf49-f798-40cd-8b27-477e619e07c2","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.539015Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9653e9f0678f121db09d6c8bd7d286b5e73edb5eb2c6c2fa1ffb900f1955dd4e","observation_id":"d198cda2-5116-439d-ac92-f0bafaac0ec3","resolution":{"observed_at":"2026-08-10T17:27:19.097622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.073622Z","title":"VideoCLIP: Contrastive pre- training for zero-shot video-text understanding","venue":null,"work_id":"16b1545d-b24f-4ed8-a091-f531e6b41000","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.544244Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e6fb5945018860036e0159b3a04265d7122414e0736f777b9aac769c0d5d436a","observation_id":"bb148e8c-adcf-4f31-b9d8-0bd1fa4bb170","resolution":{"observed_at":"2026-08-10T17:27:19.079625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.054773Z","title":"Retrieval- augmented generation with knowledge graphs for customer service question answering","venue":null,"work_id":"b5e868ab-933b-490d-a8a6-07cc5ab3490f","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.549134Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e0f27b880085609555f83c5766e21d23efb22ecc842d86a44f73ac4c3e1fad94","observation_id":"6cc9b393-3050-4d91-a6f8-f455fe2de311","resolution":{"observed_at":"2026-08-10T17:27:19.060275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.037173Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"6bde0a67-2c83-4ca9-a677-7dd6d6d95bed","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.554112Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:25db091702fed348454ce59ebca63bb4382bf9a54474a496639880fbc4fc83c5","observation_id":"f320f8fd-dd08-47a9-9add-799ba20f929d","resolution":{"observed_at":"2026-08-10T17:27:19.043613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.019900Z","title":"Distilling script knowledge from large language models for constrained language planning","venue":null,"work_id":"f977dee2-14df-48f5-a145-9086be80c447","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.559096Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:1722a26e971a384d081df27e4812cc5d4cd0734e187ad4d0a28e0c94fd4b3eba","observation_id":"4a9e3b04-e34b-4f3f-bd07-db480e1e6fe9","resolution":{"observed_at":"2026-08-10T17:27:19.025535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.002045Z","title":"Man: Moment alignment network for natural language moment retrieval via iterative graph adjustment","venue":null,"work_id":"d6c3925e-dc65-4839-a100-cd928d13cd1a","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.563941Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:43345bc24f075cccb7db6bcd6a1b5db6e608f564df3cdbc62b7b36875266df1d","observation_id":"1e5d354d-f8e9-4e08-88f6-567a49c7bad2","resolution":{"observed_at":"2026-08-10T17:27:19.007476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.985423Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversa- tional abilities","venue":null,"work_id":"815c890a-7631-406c-a46e-a9bb56c19f30","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.568729Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:4427dccb4a24e45e48d1ec2ae1e0b391db4568e940e3637708c80b185e766cea","observation_id":"e47a14f2-1409-470a-b597-6372db2921c9","resolution":{"observed_at":"2026-08-10T17:27:18.990834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.968792Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"a2c2d169-2764-412a-bb01-4a4e77d627f8","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.574278Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:de627a889c1a70fd05c7a4e0c00e9007e8e412173c9880fd621a4cff1684f3bb","observation_id":"65d682a9-ad24-4ef0-9aff-985af49ebc05","resolution":{"observed_at":"2026-08-10T17:27:18.974322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.951529Z","title":"Temporal sentence grounding in videos: A survey and fu- ture directions","venue":null,"work_id":"21bd6250-3d4a-494a-bf33-a5ba97f1a39d","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.579525Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:74f08a536c7b3649362ec190312f303d950ae59180a9c6d210fd0f2c7940c8c4","observation_id":"d628f934-164d-4b8b-a513-33d7a7b43b42","resolution":{"observed_at":"2026-08-10T17:27:18.957496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.934052Z","title":"P3iv: Probabilistic procedure planning from instructional videos with weak su- pervision","venue":null,"work_id":"1085ecbe-387f-471a-97fb-ee00beba6ac9","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.584443Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:2fef275e8b0cc6db263cc286ad3911c032e07f7dbd4f796d28753579627bcbfa","observation_id":"703bc398-48a0-48c7-9795-3cb775a7a0ae","resolution":{"observed_at":"2026-08-10T17:27:18.939426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.915691Z","title":"Learning procedure-aware video repre- sentation from instructional videos and their narrations","venue":null,"work_id":"41d7b287-03f9-4e03-92fc-908ac62cb725","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.590544Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9034756285809691bb526f2b21f499ad450e41df76df13ae97d1f9ac75ee1094","observation_id":"1bfea070-78ba-47be-a292-a0398e67453e","resolution":{"observed_at":"2026-08-10T17:27:18.921158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.898827Z","title":"Procedure-aware pretraining for instructional video understanding","venue":null,"work_id":"7d4c4a83-9f37-43b2-b0da-d2db5f31a3cb","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.596552Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f9fb6262f8389f10f8b4e7c147c62d86d9c821d2086caf23f6bfba8db66a2502","observation_id":"cd6107ab-a413-41f7-ad15-d3bcb5ac5f94","resolution":{"observed_at":"2026-08-10T17:27:18.904145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.881493Z","title":"Towards auto- matic learning of procedures from web instructional videos","venue":null,"work_id":"9ee72845-3e81-4c66-bc82-499ad34f40fc","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.602763Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:181f07f95bafb251fbcacf61be221729df36313b2a923db3cf710906fc3cd123","observation_id":"7901844d-b6bf-424c-b788-b3bd49dd1263","resolution":{"observed_at":"2026-08-10T17:27:18.887341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.864026Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"b45dc713-1853-4a54-89a7-2057e7f6d673","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.608913Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:13247e807d0ee220b1bff7c2241818c306dcc4778d1b00e8a3a84c43fbca7f6c","observation_id":"d130331b-ff3b-4241-903e-a583413649ee","resolution":{"observed_at":"2026-08-10T17:27:18.869455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.845491Z","title":"Cross- task weakly supervised learning from instructional videos","venue":null,"work_id":"d36e7bbf-a9c0-4934-918a-3321c03cbd80","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.614377Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:714be3d532751ad925cf9868b1e8dd7c2082a73a2314cb4a4680fc2d655fb5ee","observation_id":"f8de0d6b-998d-4e0c-bf16-2b794b0714b4","resolution":{"observed_at":"2026-08-10T17:27:18.851520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T01:59:06.404360Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":60},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 3 inbound Pith citation observations for arXiv:2501.12231."}