{"as_of":"2026-08-18T17:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2cca5f244216dd69651c43046946ceb94ee0f4fd0d04db681387d99f1df11f46","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:25:57.458346Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.08768/citation-record","integrity":"/paper/2411.08768/integrity","json":"/paper/2411.08768/citation-record.json","paper":"/paper/2411.08768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.878158Z","title":null,"venue":null,"work_id":"e626b95e-142f-496b-bbe6-f35483c2c4e4","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.329469Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:20c462d6eb43530a2f204fb15d258a4d3fe980a6016608d76421f3b7e475a898","observation_id":"83ff7106-7c8c-4849-8f84-6d86cb4b9c59","resolution":{"observed_at":"2026-08-12T21:25:57.882023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.334259Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.334259Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:4b5a68726fa8f179521305dce2c14bec3dab1c0a4f70682ac06d24f14afc51a5","observation_id":"00a0fe10-4be5-4260-854d-63449dcc48fe","resolution":{"observed_at":"2026-08-12T21:25:57.334259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.858050Z","title":"Gui-world: A dataset for gui-oriented multimodal llm-based agents, 2024","venue":null,"work_id":"b04f33bb-7506-4235-ae36-b1d16a708313","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.338531Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:992841bbe67608843191cc85367359734f0e2f116548ffd3154b29ddf3159189","observation_id":"68732f94-8c18-40a7-b17e-6253cb1d3cd9","resolution":{"observed_at":"2026-08-12T21:25:57.862547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.846028Z","title":"Vg4d: Vision-language model goes 4d video recog- nition","venue":null,"work_id":"b0396838-c02a-4ae6-af94-4532d7b20d6a","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.342821Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:dfa20148a2adbb7a9fc01c8e350020dbd46ffc4377bcb58f09f792ddf8a60561","observation_id":"00c757c2-c5fb-4f95-8913-8350b7f206f0","resolution":{"observed_at":"2026-08-12T21:25:57.850388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.832813Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd, 2024","venue":null,"work_id":"a3540149-9ee0-4298-b54a-8bef19aa6129","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.347203Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:8087d2126dd2ad8b759e9ab72f7509a3a87cfc940b0333a42917007ef6a3a102","observation_id":"5e58c4ea-2cfa-4003-a831-f0dff2666657","resolution":{"observed_at":"2026-08-12T21:25:57.837336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.820155Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding, 2024","venue":null,"work_id":"8b4eaa85-90d9-48b2-9dd3-9a4589ad82d4","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.351443Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:b04eb35ecd850e9a31cdbc08e0a185ff7ea4fab476445fc2105b4df02e634edf","observation_id":"355b6808-dc24-4c77-982f-c2d9b5d89bac","resolution":{"observed_at":"2026-08-12T21:25:57.824397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.806077Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":"3bd964cf-34f7-4d5f-9572-1bdacfde6082","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.356101Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:2fc37ecbd3b526b8f27e70e861c3e0c8ccb70437db8094bf44c79badf9ffa74a","observation_id":"e3196b28-7e80-49e6-88a4-23ab1557d86c","resolution":{"observed_at":"2026-08-12T21:25:57.810735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.792574Z","title":"Gemini models","venue":null,"work_id":"abf15b76-7f11-47f4-9389-63dfefeb2eaf","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.359971Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:21c7694f3a1093040c2fc78c6db0a37e6be692d92f9a9927be20fca13145df0d","observation_id":"5a33fbcd-994a-41ab-b620-37c3d3653a5c","resolution":{"observed_at":"2026-08-12T21:25:57.796532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.781304Z","title":null,"venue":null,"work_id":"368cfd43-a555-42b6-a07f-ba61c9bfd7c5","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.364174Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:c1f38b42a417161ee4f3edc403eddf086bab25b0951f017ad961a18a9bbef293","observation_id":"6f931a34-e272-45a8-87dd-924404ff4428","resolution":{"observed_at":"2026-08-12T21:25:57.784644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.769271Z","title":"Smartflow: Robotic process automation using llms, 2024","venue":null,"work_id":"9e94ab69-7748-4721-bd29-77cb9966ad52","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.368073Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:737d27725d6f89ab95bc4755917967dc05a9976da551de60b85a8f328b812e77","observation_id":"b0519d1d-4927-4f95-8f48-a11fbcd5ead7","resolution":{"observed_at":"2026-08-12T21:25:57.773669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.756063Z","title":"Dream2real: Zero-shot 3d object rearrangement with vision-language models","venue":null,"work_id":"61e49851-bbb8-44ae-88e7-0cec64bea7eb","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.372039Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:dc1813ccad9af19d0c1a8c65ed6b24755f75bd19e6da073c08343a6c163839f6","observation_id":"d7429d13-c4e0-4478-a73a-3e1fc0f3b75e","resolution":{"observed_at":"2026-08-12T21:25:57.760739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.743763Z","title":"Wolf: Captioning everything with a world summarization framework, 2024","venue":null,"work_id":"b2bb23ad-abb4-4bc7-9729-b6054c5a80bd","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.376285Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:9bc5ec88608777bd9f82a032bdf757c09f7d80549a0a02f8cf91829d8ecf8c10","observation_id":"0fdc0360-92bd-4fab-8c77-6a1e5bd41df9","resolution":{"observed_at":"2026-08-12T21:25:57.747701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.381034Z","title":"Videochat: Chat-centric video understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.381034Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:5daa3457fef459440c40f87e68015ecda0a24799a56ee4aa6bcaeac1a9dc94dc","observation_id":"b4cd499a-0675-4d0a-a5c5-b0cc12bc989e","resolution":{"observed_at":"2026-08-12T21:25:57.381034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.384739Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.384739Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:53af037aa83bffb5e4c37ce018b38a68162494b01aa7a538b7546d5d7366b923","observation_id":"d95b2274-eb15-4d8d-bd30-8ffcf2d5af75","resolution":{"observed_at":"2026-08-12T21:25:57.384739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.717385Z","title":"Visualwebbench: How far have multi- modal llms evolved in web page understanding and grounding?, 2024","venue":null,"work_id":"72d9e3f7-7d7a-459e-9966-8a45a606e16a","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.388998Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:9c8106f9fbc51f43bc913f4f6976bb99065a806bba63db3a787c97366b6da7f2","observation_id":"5b7f4954-487a-4a59-9acd-d9488ae86eb9","resolution":{"observed_at":"2026-08-12T21:25:57.721681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.705209Z","title":"Online robot navigation and manipulation with distilled vision-language models, 2024","venue":null,"work_id":"ddfb664e-5f43-4186-9055-9c921c837efb","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.392679Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:fabd6cf092a95ab3c1f043f9457d0297da09f87731103443ed6b1c934bd5e073","observation_id":"ff63183a-4361-4743-9227-3b5f7be2dbc9","resolution":{"observed_at":"2026-08-12T21:25:57.709262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.693031Z","title":"Robollm: Robotic vision tasks grounded on multimodal large language models","venue":null,"work_id":"8f52e415-ae5d-4da3-b859-e032063e0bc7","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.396215Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:41d39fd3f3e5b8e1c2d99a1e049108688019bfdfe154d21d15f765160b5f65ed","observation_id":"66795c9f-ab15-4121-aa2a-83e2b4443867","resolution":{"observed_at":"2026-08-12T21:25:57.697203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.399303Z","title":"Omniparser for pure vision based gui agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.399303Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:a0f201c04b4486a88624eeaffc079ccdad51a2049467ed3d3e9d793dcc92c771","observation_id":"9eece4f9-5a86-4fa3-8b58-2f8c5b8b2f6e","resolution":{"observed_at":"2026-08-12T21:25:57.399303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.673687Z","title":null,"venue":null,"work_id":"65b5e45a-ba63-4018-9b54-885e50ed68db","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.402623Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:c6247ffc92eeefbf47efbbb44bf4ccb66249b4c7b26862cae83588494165ecce","observation_id":"adc0d112-8c0f-4e39-a218-7e07b6d9ca02","resolution":{"observed_at":"2026-08-12T21:25:57.677338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.663268Z","title":null,"venue":null,"work_id":"e2f160ce-07bd-45c5-a927-f2c2ce7f97b8","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.406409Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:b7d9818048d95dd568d6bdec0cd3ea586c524042b57f285ebb4ce938e7d342c7","observation_id":"b7b29a5f-30c8-4001-97d6-7ae24254edaf","resolution":{"observed_at":"2026-08-12T21:25:57.666488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.651832Z","title":null,"venue":null,"work_id":"316b0351-273f-4dcf-a204-268e5e212929","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.410428Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:056f88a7604d9663d7925286fde0c58a48a46f4a29d8da740027c251b0a3a818","observation_id":"e008d938-d9a3-4770-a1f0-49e6243e333f","resolution":{"observed_at":"2026-08-12T21:25:57.655923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.640317Z","title":"Owl - always-on wearable ai","venue":null,"work_id":"32e647b2-5f02-4e96-8bb8-f25cbeb219ad","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.413698Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:df34acaebe7da023506c5d42f087bec13223d09c89a5bf0316deb67546182407","observation_id":"0661f689-ed6b-4684-a9d1-bdd96b945477","resolution":{"observed_at":"2026-08-12T21:25:57.644081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.626370Z","title":"bert-embedding","venue":null,"work_id":"6306ee55-f19e-4949-a182-33ded6e0067d","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.417347Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:aedfdc4b2f252c2b037d9902321d010381d16d9ddcfb92b41ccd5c6364cac3f5","observation_id":"ca310773-f698-4aa7-8aa2-01c334297d8d","resolution":{"observed_at":"2026-08-12T21:25:57.630518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.420574Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.420574Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:6b612b830c5711c7e2a5e8855757dd2102bffaa23d544970ad285dfda45317b8","observation_id":"ad818ad9-c9f1-42ca-b44d-6e4f198ff4f4","resolution":{"observed_at":"2026-08-12T21:25:57.420574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.605565Z","title":"Beltran-Hernandez, Masashi Hamaya, Atsushi Hashimoto, Shohei Tanaka, Kento Kawaharazuka, Kazutoshi Tanaka, Yoshitaka Ushiku, and Shinsuke Mori","venue":null,"work_id":"08b2f9d2-4d09-4edb-945d-6c9d00335142","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.423733Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:f6b73034826a042e3f06298d5baddd10a0f03b6bda645778329822bf7df190e8","observation_id":"8caa44b6-4169-4161-acf9-66c196a9b58f","resolution":{"observed_at":"2026-08-12T21:25:57.609927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.592199Z","title":"Karlsson, Bo An, Shuicheng Yan, and Zongqing Lu","venue":null,"work_id":"7d315aa6-098e-41b8-b18b-4607e31c4a77","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.426886Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:49750698c1ad8bbf0ea4aacdefd556540a5d04041b1391206c6a286d27ae7c7b","observation_id":"3c09affd-f4ca-4217-b55c-1514fc754e33","resolution":{"observed_at":"2026-08-12T21:25:57.597318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.580078Z","title":"Sch ¨onberger, Juan Nunez-Iglesias, Franc ¸ois Boulogne, Joshua D","venue":null,"work_id":"9c8af73a-60d9-4562-b559-c5910018d14c","year":2014},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.430293Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:a791517fd3dcaa8751e6c254102f64d9551d1ca589259438dc6661605326a7d6","observation_id":"2bc09ff3-9aa8-4972-8322-d1c51f42eaf2","resolution":{"observed_at":"2026-08-12T21:25:57.584298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.568578Z","title":"Drive anywhere: Generalizable end-to-end autonomous driving with multi- modal foundation models, 2023","venue":null,"work_id":"22c1cdcf-edb9-434c-b4b8-57dc0f39f646","year":2023},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.434030Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:409f157d2e69618e2efb827f0ffaa4fae379a4e46110918b4476e99ad55c3ed8","observation_id":"84a6865f-48a3-4b4d-aaf9-caa12ae79997","resolution":{"observed_at":"2026-08-12T21:25:57.572406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.555157Z","title":"Videoagent: Long-form video understanding with large language model as agent, 2024","venue":null,"work_id":"8168c8d2-1f88-4c74-af52-1edcbf68047f","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.438156Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:13e82b5ceb13c12afb74e6ab25717816094c434097b8a4b2154b7bba4d66324c","observation_id":"40d8d6d9-6bff-4f49-a4e7-88fca66f861b","resolution":{"observed_at":"2026-08-12T21:25:57.559710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.542187Z","title":"Videotree: Adaptive tree- based video representation for llm reasoning on long videos, 2024","venue":null,"work_id":"2f50d173-bd0a-42b5-84ab-79eb3881724c","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.442072Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:73e439d93905f913461e992073d8368656e3821b9474e7552e587c08dabfab17","observation_id":"60abc502-0b87-4dc7-89d2-67dbcb3027f5","resolution":{"observed_at":"2026-08-12T21:25:57.546641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.528239Z","title":"Incorporating scene graphs into pre- trained vision-language models for multimodal open-vocabulary action recognition","venue":null,"work_id":"1a666631-3473-484e-947f-518c8d665c38","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.445966Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:ca06bd49111198996db624c88655cd55840f155dd7c55e17f2d2c70364952bb3","observation_id":"fd03c251-ece6-4aee-8370-a81d11984e58","resolution":{"observed_at":"2026-08-12T21:25:57.532019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.516647Z","title":"Vlfm: Vision-language frontier maps for zero- shot semantic navigation","venue":null,"work_id":"90140489-e7e1-4735-bd2c-518937d71547","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.450139Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:d063b7a3d0e683f4c6ff7867602ffb911ac78a63dffce14c145078883e6ba2ed","observation_id":"cb0ee32d-9b8f-4838-8764-11d6715bbb7c","resolution":{"observed_at":"2026-08-12T21:25:57.520461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.504051Z","title":"Ufo: A ui-focused agent for windows os interaction, 2024","venue":null,"work_id":"4d27837c-5048-4d24-b5c5-2f8a88179fe9","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.454509Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:d1b6e8ba75b0626732d849f51f8e09d042c4d211f9f57e0a779cb12020216069","observation_id":"fa58de06-7a6c-4e10-aeae-c06127417073","resolution":{"observed_at":"2026-08-12T21:25:57.508722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:25:57.490863Z","title":"global_description","venue":null,"work_id":"ef2abb58-7d6e-47db-8996-c6a1d0c3495b","year":2024},"citing_paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T21:25:57.458346Z"},"links":{"citing_paper":"/paper/2411.08768"},"observation_digest":"sha256:97bc4123ee4ed9e8bad1d68d79de4a1c002dc661c73ab172d3778aa38c20bbdf","observation_id":"a81000a5-0509-47cc-8ec0-22ac18b91bfe","resolution":{"observed_at":"2026-08-12T21:25:57.495755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.08768","last_updated":"2024-11-13T16:53:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:08:57.763550Z","submitted_at":"2024-11-13T16:53:29Z","title":"Sharingan: Extract User Action Sequence from Desktop Recordings"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2411.08768."}