記事一覧へ戻る
AIエージェント

Kimiのブラウザー拡張、Web操作を再利用可能なSkillに

読了目安 3 分

概要

AI Agentが質問への回答だけでなく、実際のWebサイト上で作業するようになると、ブラウザーは情報を見るための画面から、作業を実行するための環境へ変わる。Kimiは従来のKimi WebBridgeをブラウザー拡張として整理し直し、サイドバーでの対話とWeb操作の記録機能を加えた。

新しい拡張機能の内容

基本機能はWebBridgeから引き継がれている。ユーザーが許可すれば、KimiはChromeやEdgeでページを開き、内容を読み取り、ボタンをクリックするなどの操作を実行できる。ローカルAgentから拡張機能を呼び出す従来の方式も残されている。一方、現在はブラウザーのツールバーからKimiのアイコンを選び、サイドバーで直接対話することも可能になった。

今回の更新で特に重要なのは、操作を記録してSkillにできる点だ。例えば、決まったサイトを開き、その日の情報を探し、データを書き出すといった手順を一度設定すれば、次回から同じ流れを呼び出せる。作業がうまく完了したセッションをSkillとして保存することもできる。

何が変わるのか

これまでのWeb Agentは、同じ仕事でも実行のたびに指示を調整する必要があった。ページの構成やボタンの位置が変わったり、コンテンツの読み込みが遅れたりすると、処理が途中で止まることもある。記録機能がこうした問題をすべて解決するわけではないが、繰り返し手順を毎回説明する負担は減らせる。

ブラウザー拡張の役割も変化している。初期のAI拡張は、Webページの要約、翻訳、質問への回答、文章作成など、主に「ページを読む」ことを支援していた。現在は、ユーザーに代わって「ページを使う」方向へ進んでいる。Kimiの拡張機能は、ページの理解と実際の操作を組み合わせ、さらに操作手順の再利用を目指す製品といえる。

Kimi Code Desktopとの接続

Kimi Code Desktopは開発プロジェクト向けで、Agentが生成したWebページを確認するための内蔵ブラウザーを備えている。これに対してブラウザー拡張は、ユーザーが普段利用しているChromeやEdge上の外部サイトを対象にする。前者はファイル、ターミナル、開発履歴とつながり、後者は日常的なWeb環境とつながる。

両者を合わせると、KimiのAgentは開発作業を行い、内蔵ブラウザーで結果を確認し、必要に応じて外部サイトにもアクセスできる。もっとも、サイト改修、動的読み込み、複雑な操作による失敗は依然として起こり得る。問題が発生した場合は、画面の状態を確認して指示を調整する必要がある。今回の本質は新しいチャット窓ではなく、一度きりのWeb操作を繰り返し利用できるSkillへ変える点にある。

出典:量子位

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
IterSynth、役割分離で深層検索エージェントを再設計
AIエージェント
cctest.ai
AIエージェント

IterSynth、役割分離で深層検索エージェントを再設計

IterSynthは、単一の共有モデルをPlannerとSynthesizerとして交互に動かし、深層検索における計画と証拠統合を分離する。検索履歴全体ではなく更新される要約を状態として使い、RDPOによって役割ごとの学習信号も与える。

続きを読む
CCTest · Blog
AgentKernel:AIエージェントのための回避不能な安全カーネル
AIエージェント
cctest.ai
AIエージェント

AgentKernel:AIエージェントのための回避不能な安全カーネル

AgentKernelは、OSのセキュリティ原則をAIエージェントの実行基盤に取り込み、アイデンティティ、知覚、認知、実行の4領域を保護する構想です。プロンプトインジェクション、メモリ汚染、委譲の悪用、ツールの誤用を意味レベルで扱います。

続きを読む
CCTest · Blog
AIエージェントチームが「協力の仕方」そのものを学ぶ
AIエージェント
cctest.ai
AIエージェント

AIエージェントチームが「協力の仕方」そのものを学ぶ

Self-Organizing Agent Teams(SAT)は、固定メンバーのAIエージェントが過去の協業から、役割分担や対話の進め方、情報共有の方法を学ぶ仕組みです。数学・物理ベンチマークで、単体モデルや理想的な回答ルーターを上回る結果が報告されました。

続きを読む