使用场景

visAware 适合把视觉内容转成可读信息,也适合在无障碍支持不足的界面中辅助完成操作。

阅读文章过程中对文章插图细节进行追问

微信订阅号、网页文章和社交媒体里经常夹杂配图。visAware 可以在聚焦图片后生成简短描述,并支持进一步的追问。

演示:在微信订阅号文章中识别一张演讲配图,并继续追问还有哪些可描述的信息。

微信聊天过程中对收发的图片进行自动描述

启用自动描述后,在微信聊天中浏览到图片消息时,visAware 会给出图片描述。

演示:依次浏览聊天中的多张图片,听取 visAware 自动生成的描述。

用 Agent 克服软件里的无障碍死角

未考虑无障碍兼容的自绘界面,或需要点选物品且没有替代方案的人机交互验证,可借助 visAware 协助完成操作。

演示:用户请求 Agent 协助安装“火绒安全软件”并关闭设置中的内存防护功能。Agent 顺利的完成了这些步骤。

图片中的人物和活动

一群人围在户外草地的木架旁
visAware 描述摘录: 一群穿着传统或复古服饰的人站在户外草地上围成一圈。支架旁边有一位长黑发男子,似乎正用手里的纤维或绳子向众人讲解什么。 图片来源:National Park Service / NPGallery,Public domain。

风景、插图和复杂画面

书籍插图、旅行照片和网页配图里常有大量空间关系。visAware 可以把“哪里有什么”按画面层次说出来,便于继续追问细节。

高山峡谷,蜿蜒的河流和远处的雪山
visAware 描述摘录: 画面中央是一条蜿蜒的河流,从下方近处一路向远处延伸;左右两侧是高耸山体,远处群山连绵起伏,山顶覆着白雪。 图片来源:National Park Service / NPGallery,Public domain。

数学教材和公式图片

当公式以截图或扫描页形式出现时,visAware 可以将其中的内容转换为 NVDA 可朗读的形式。

演示:在数学教材页面中框选公式区域,并打开识别结果窗口,用户可以按照自己的阅读进度和阅读习惯进行查阅。

图表和数据

用图片呈现的数据图表,可借助 visAware 识别标题、坐标轴、趋势和数据来源。对于阅读报告、网页截图或教学材料非常有帮助。

Population, 1950 to 2100 世界人口预测折线图
visAware 描述摘录: 这是一张显示 1950 到 2100 年世界人口变化的折线图。2020 年之后曲线改为虚线,表示联合国中位情景下的未来预测。 图片来源:Our World in Data,CC BY;数据来源为 UN, World Population Prospects (2024)。