LSSGen 動態流程示意圖

AI Research

生成式 AI、電腦視覺、時序模型與 LLM 的研究和工程實作。

探索 AI 研究

How’s the Weather 視覺化天氣判讀 App

Personal Projects

運用 Agentic Tools,獨立完成產品從 0 到 1 的規劃、設計與實作。

探索獨立專案

互動式牌樓建模畫面

Visual & Interactive

電腦圖學、VFX、影像處理與遊戲,探索畫面如何被計算與互動。

探索視覺與互動

DIY 輕量化電動滑板車

Hardware & Prototyping

結合機電、3D 列印與產品概念,將想法做成能夠實際運作的原型。

探索硬體與原型

01 / AI Research

從研究,到落地。

從模型研究和論文產出,到面向使用者的完整應用,這些作品展示了我前沿研究到產品落地,一路走通的能力。

AI Research & Engineering

Research Preprint · arXiv 2026

DuoAD

Anomaly Detection Few-Shot Training-Free Vision Transformer

運用 ViT [CLS] token 的雙重特性:以穩定的全域語意自動選擇 augmentation,再用對局部異常敏感的 attention logits 強化瑕疵定位。只需少量正常樣本,不訓練、不逐類別調參,也能達到 Few-Shot Anomaly Detection SOTA。

1 / 4-shot Few-shot
industrial inspection
97.7% MVTec-AD
image-level AUROC
0 training Single ViT backbone
without manual config

Project Page arXiv GitHub

DuoAD 利用 CLS token 的語意穩定性與結構敏感性進行異常檢測
一個 [CLS] token,兩種互補特性
DuoAD 自校準資料增強與 attention 引導異常檢測流程
Self-Calibrated Augmentation 與 Attention-Guided Reweighting

Published Research · ICCVW 2025

LSSGen

Diffusion Flow Models DiT Latent Space Scaling

利用 Diffusion coarse to fine 的生成特性,將前期擴散移至低解析度執行,在維持生成流程的同時加速 inference。

1/16x Computation
at ½ resolution
54s36s Faster than
FLUX.1-dev

Project Page

LSSGen 與 FLUX.1-dev、MegaFusion 的生成品質與速度比較
FLUX.1-dev vs. MegaFusion vs. LSSGen(Ours)
LSSGen 多階段 Latent Space Scaling 生成流程架構
Latent Space Scaling 多階段生成流程

漫畫修補 (Inpainting) & 漫畫復原 (Restoration)

Stable Diffusion, VAE 針對 Stable Diffusion 應用於漫畫修補時的問題進行調整,並改良內部 VAE,使其能去除老化漫畫的髒污與泛黃特徵。User Study 結果優於 LaMa、Stable Diffusion 與 Xie et al. 的漫畫 inpainting 模型。

Ti-MAE & Transformer

Ti-MAE, Time Series, Transformer
參考 Ti-MAE 論文,使用 PyTorch Lightning 從頭實作 Transformer 與 Ti-MAE,透過隨機遮罩進行時間序列的自監督學習與分類。

Ti-MAE 模型架構圖

AI Smart Fast Forward

C++, Video
在 Skywatch 實習期間,為可將 24 小時影片濃縮成最長 10 分鐘的智慧縮時演算法導入 AI,降低其對雜訊的敏感度;並同步最佳化運算流程,改善執行時間與記憶體消耗。

AI Smart Fast Forward

CLIP, Milvus Vector DB 以 CLIP 與 Milvus Vector Database 建立相似影像搜尋系統,支援使用文字描述或上傳圖片,從資料庫中找出語意或視覺上相近的影像。

以圖片和文字進行相似影像搜尋的系統介面

Skywatch 產品 QA 機器人

Llama 2, LLM, QLoRA 挑戰在 NVIDIA GeForce RTX 2070 8GB 消費級顯示卡上部署 LLM。使用 GPT-4 產生 Skywatch 產品問答資料集,再透過 Supervised Fine-tuning 與 QLoRA 調整以 Llama 2-7B 為基礎的 Taiwan-LLM-7B,使模型能回答產品問題。

漫畫畫格 (Panel) 和對話框 (Speech Bubble) 的實例切割 (Instance Segmentation)

MViT, Detectron2, Instance Segmentation
使用 Detectron2 訓練以 MViT 為基礎的 Instance Segmentation 模型,自動辨識並切割漫畫中的畫格(Panel)與對話框(Speech Bubble)。

Car Detection and Removal of Landscape Scene

Mask-RCNN, Blender, 2D to 3D Projection
以 Mask R-CNN 找出空拍影像中的車輛與街道雜物,並結合 3D 重建的相機資訊,將 2D mask 投影至場景中,避免雜物像素進入重建流程。最終產出更乾淨的 3D 街道場景,車輛辨識率接近 99%。

Past Coursework DLCV Projects 較早期的深度學習與電腦視覺課程作業,點擊展開

CNN & Semantic Segmentation

  • CNN t-SNE analysis
  • Satellite Semantic Segmentation

DCGAN、WGAN、Diffusion Model & DANN

  • DCGAN
  • WGAN
  • Diffusion Model on MNIST dataset
  • DANN t-SNE Results

| Type | Domain | Class | | ————– | ——————————————————————– | ——————————————————————- | | MNIST-M → SVHN | | | | MNIST-M → USPS | | |

CLIP、Image Captioning

  • Image Captioning

| CLIPScore | 0.8990 | | ——– | ——– | | Predicted | a person standing on a beach with colorful kite . | | Ground Truth | a man is walking towards his kite on the ground. | | Image | |

3D Semantic Segmentation

  • Post

02 / Personal Projects

借助 Agentic Tools,把產品從 0 做到 1。

展現產品問題定義、長任務規劃、技術選型與完整實作能力,並將 AI Agent 納入個人開發流程。

Independent Android Product

How’s the Weather

Agentic Tools 0→1 Product Kotlin Jetpack Compose Google Maps CWA Open Data

一款為台灣日常移動打造的 Android 視覺化天氣判讀 App。
先用摘要抓住重點,再把雷達、雨量、雲層與風場直接疊在地圖上。
不讓冰冷的數字替你做決定,而是讓你看見天氣,自行判斷現在是否適合出門。

Source Code

展開的出門決策卡與雷達地圖 未來一小時累積雨量與地圖

Independent Android Product

Expense Bucket

Agentic Tools Kotlin Jetpack Compose Room CameraX ML Kit

一款為日常消費與旅行打造的 Android 記帳 App。從消費通知與電子發票 QR Code 自動建立可編輯草稿,減少輸入負擔,同時保留每一筆交易的最終控制權。

通知與發票自動擷取 信用卡回饋額度追蹤 旅遊專案與多幣別預算

Source Code

Expense Bucket 月預算水位與交易紀錄首頁 從 Android 通知自動偵測消費並等待使用者確認 Expense Bucket 旅遊專案的多幣別預算與消費分類

03 / Visual & Interactive

讓光線、像素與幾何成為體驗。

從像素、光線與幾何的底層計算,到能夠直接操作與遊玩的互動體驗。

Graphics

Incremental Instant Radiosity

Unity Engine, Ray Tracing, Radiosity

Interactive PailouModeling

Unity Engine, Procedure Modeling

2D to 3D Maze

OpenGL, Visible-Surface Determination
使用 OpenGL 將 2D 迷宮轉換成 3D 場景,手動計算牆面、顏色與繪製位置,並在不使用 Z-Buffer 等 OpenGL 3D 功能的限制下完成可見面判定。

HighDynamicRange-Imaging

Image Alignment using MTB, Solve Response Curve, Radiance Map, Tone Mapping 將多張不同曝光的影像進行 MTB 對齊,求解相機反應曲線並建立 Radiance Map,最後透過 Tone Mapping 產生 HDR 影像。

Image Stitching

SIFT 使用 SIFT 進行特徵偵測與配對,再透過影像對齊、warping、resampling 與 blending,將多張照片合成為完整全景圖。

Games

Tank Battle

Unity Engine, Third Person

Zombie Field 2022 - First Person Shooter

Unreal Engine 4, FPS

04 / Hardware & Prototyping

把生活觀察,做成可運作的實體。

透過機電整合、3D 建模與快速製造,把生活觀察轉化為可以測試、操作與持續改良的實體作品。

DIY Electric Scooter v4

3D Printing, Electric Circuit, Motor Control, Lithium Battery
以迪卡農 Town 7 XL 為基礎,完成可折疊、全車重低於 8 kg 的輕量化電動輔助滑板車。採用可抽換式電池設計,兼顧攜帶、充電與快速補充電力。

Battery Pack of Electric Scooter

3D Printing, Electric Circuit, Lithium Battery
為電動滑板車設計可抽換電池組,由 6 顆 Sanyo NCR-20700B 鋰離子電池組成 12V 系統。可連接 30W PD 充電器與 DC-DC 轉換電路,提供 60W PD 或 20W Dash/VOOC 輸出。

3D Printed KartRider Race Car

3D Printing, 3D Modeling
使用 Autodesk Inventor 建模《跑跑卡丁車》中的「積木舒適 9」,再透過 3D 列印將數位模型製作為實體作品。

準時睡鬧鐘 (黑客松 MakeNTU 2020)

Arduino, 24 Hours, 黑客松, MakeNTU

從發想到實作皆於 24 小時內完成。鬧鐘會在睡覺時間持續響起,直到偵測到手機已放入裝置充電;手機會被鎖在裝置內直到起床鬧鐘響起,藉此將「睡前充電」轉化成準時放下手機的行為提示。若有緊急需求,仍可透過刻意增加操作難度的反向觸控筆使用手機。

智慧約束帶 (創創 AIoT 2022)

Arduino, App
與台科大醫工系及長庚科大護理系同學跨域合作,運用氣囊、橫向電動馬達與 App 管理患者的約束狀況,以降低壓瘡發生風險。作品獲得創創 AIoT 2022 佳作。

被窩空調 (綠色生活創意競賽)

Arduino, App
與台科大電機及設計系同學合作,透過水冷式床墊與棉被直接調節睡眠環境溫度,減少以空調冷卻整個空間所需的能源。作品於綠色生活創意競賽獲得佳作。

動物森林 (與設計系合作之桌遊)

Arduino, 3D Printing, 3D Modeling
與設計系同學合作完成結合卡牌與聲音互動的兒童桌遊。方形主機透過 RFID 辨識動物卡片,按下後播放對應叫聲;設計團隊負責遊戲概念與視覺,我與另一位電機系同學負責機電實作及概念優化。