記事一覧
311件の記事 / ページ 6 / 13

メルカリに学ぶAIガバナンス——「AI戦国時代」を生き抜く企業の勘所
生成AIの業務利用が当たり前となった今、企業はビジネス価値の創出と「シャドーAI」などのリスク管理を同時に求められている。「AI-Native Company」への転換を宣言したメルカリの取り組みから、AIガバナンス策定の実践的ヒントを探る。

学部1年でICMLワークショップに採択、参加すべき? 初めての学会を最大限に活かす方法
大学1年生が初めての筆頭著者論文をICMLワークショップに採択された体験談がRedditで話題になっています。費用や一人参加への不安を抱えながらも「行くべきか」と問うその投稿から、初めての国際学会参加をどう活かすかを考えてみます。

Claude Opus 4.8が示す「正直すぎるAI」の光と影——忖度しない設計の評価が分かれる理由
Anthropicが提供するClaude Opus 4.8は、性能向上に加えて「正直さ」の改善を大きな特徴として打ち出している。ユーザーの期待に迎合せず、事実を率直に伝える設計は一部から高く評価される一方、使い勝手の面では賛否が分かれているとも報告されている。本稿では、その背景と論点を整理する。

Qwen3.5-9BはGemma-4-12Bより小さいのに強い?ベンチマーク比較を解説
「Gemmaって話題だけど、実際どうなの?」と思っている方へ。海外コミュニティで注目されている比較検証によると、より小さいモデルであるQwen3.5-9BがGemma-4-12Bを8つ中5つのベンチマークで上回ったという結果が報告されています。今回はその中身をわかりやすく解説します。

RTX 4090とMacBook M4 Proを束ねてローカルLLMを動かせるか?現実的な検証
デスクトップPC(RTX 4090・24GB VRAM)とMacBook Pro(M4 Pro・48GBメモリ)を組み合わせ、ローカルLLM推論に使えるか。USB-C/USB4経由の異種OS間分散推論の可能性と限界を、実測データをもとに整理する。

「ベイズ統計」って何?Pythonで学ぶ入門編をやさしく解説
「ベイズ統計」という言葉を聞いたことはあるけれど、何のことかよくわからない、という方は多いと思います。今回は、Pythonを使ってベイズ統計の考え方を初歩から学べる入門記事をもとに、その基本的な流れをできるだけわかりやすくお伝えします。

フロリダ州、OpenAIとサム・アルトマンを提訴——暴力事件との関連を問う初の訴訟
フロリダ州が、OpenAIおよびCEOのサム・アルトマン氏を対象とした訴訟を提起した。同州立大学での銃撃事件にChatGPTが関与したと主張するもので、AIサービスを暴力事件と直接結びつけた訴訟としては初のケースとして注目されている。

「ハーネス」って何? Hugging FaceがAIエージェント用語の混乱を整理
「ハーネス」「スキャフォールド」……AIエージェントの話題で飛び交うこれらの言葉、人によって使い方がバラバラで混乱していませんか? Hugging Faceがこの状況を整理しました。初心者でも迷わないよう、基本用語をひとつひとつ丁寧に解説します。

エリン・ブロコビッチ、データセンターの「秘密主義」に照準を当てる
環境活動家エリン・ブロコビッチが新たなミッションとして、データセンターの情報開示問題に取り組み始めた。AI・クラウドインフラの急拡大を背景に、地域コミュニティへの環境影響を巡る透明性要求が高まっている。

ブラウザ上でPython ASGIアプリを動かす:Service Worker+Pyodideの新手法
PyodideとService Workerを組み合わせ、ブラウザ上でPython ASGIアプリをネイティブに近い形で動作させる手法が登場した。従来のWeb Worker方式が抱えていたJavaScript非実行の制約を克服し、Datasette Liteの本格的なアップグレードへの道が開かれようとしている。

バイブコーダーへの報復:プロンプトインジェクションでデータ消去を仕込んだ開発者の事件
「バイブコーディング」に嫌気が差した開発者が、他者のコードにデータ消去を引き起こすプロンプトインジェクションを密かに埋め込んだとされる事件が話題を呼んでいる。AIコード生成への過信がセキュリティリスクに直結することを示す、象徴的な出来事だ。

TXT・Markdown・HTML——出力形式でLLMの品質はどう変わるか
プロンプトで指定する出力形式がLLMの品質・速度・トークン数に与える影響を、Qwen3.6 35B A3Bを使った実測データで比較した投稿が話題だ。Markdownが品質スコア78/100で首位。HTMLはトークン爆発と品質低下を招く結果となった。

AIエージェントも「老化」する——AgingBenchが示すモデル交換の落とし穴
長期運用されたAIエージェントは、より高性能なモデルへ切り替えるだけでは性能が向上しないどころか、むしろ低下する可能性があることを示す研究が公開された。AgingBenchと呼ばれる縦断的ベンチマークの知見は、「新モデルに差し替えれば改善する」という直感的な前提を根本から問い直すものと考えられる。

SnowflakeがAWSと$6Bの5年契約——NvidiaへのAIチップ依存に変化の兆し
データクラウド大手のSnowflakeが、AI用CPUチップ調達を目的としてAmazon Web Services(AWS)と総額$60億(約9兆円)規模の5年間契約を締結した。Nvidiaが独占してきたAIチップ市場に対し、クラウド大手が独自路線を強める動きとして注目される。

失敗データを組織知に変える――ギリアがマルチモーダルLLM統合プラットフォームを提供開始
ギリアは3Dモデルや解析結果をマルチモーダルLLMで統合し、設計現場の暗黙知を形式知化する新プラットフォームの提供を開始した。不採用案や失敗の文脈まで組織資産として検索・活用できる仕組みで、RAGでは届かない製造現場の課題に切り込む。

週3.25億DLの「Starlette」に重大脆弱性——数百万のAIエージェントが危機
検知。オープンソースパッケージ「Starlette」に「BadHost」と命名された重大脆弱性が発見された。週間ダウンロード数は3億2500万件。多数のAIエージェント基盤が影響を受ける可能性がある。

Qwen 3.7 オープンソース公開を待つコミュニティの声
観測。Alibaba の Qwen チームによる次世代モデル「Qwen 3.7」のオープンソース公開を巡り、LocalLLaMA コミュニティで待望論が噴出している。パラメータ規模への拘りより「まず公開してほしい」という声が象徴的だ。

人間の約90%が右利きである謎——オックスフォード大学が分析
人間の約90%が右利きであるという事実は広く知られているものの、その根本的な原因は現時点でも解明されていない。オックスフォード大学の研究チームがこの問いに取り組んでおり、利き手の偏りがなぜ生じるのかについての分析が注目を集めている。

AIエージェントの「なぜ」を可視化するOSS「Spice」——決定層という新概念
AIエージェントは「実行」が得意になった。だが「何をすべきか、なぜそれか」という上位の意思決定は依然として人間任せだ。その空白を埋めようとするOSSプロジェクト「Spice」が登場した。エージェントの推論境界を記録・可視化する「決定層」という設計思想を持つ。

ローカルLLMフロントエンド選びの現実:vim職人からOpen WebUIまで
ローカルLLMを動かすとき、フロントエンドの選択は思いのほか個人差が大きい。Reddit「r/LocalLLaMA」に投稿されたスレッドでは、vimカスタムプラグインという極端な例を起点に、実際に使われているUIの多様性が浮かび上がった。llama-serverを「デフォルト」と見なしつつも「限界を感じる」という声は、多くのローカルLLMユーザーが共感するポイントだろう。

MCPって結局何?ツール呼び出しとどう違うのか初心者向けに解説
「MCPって名前は聞くけど、ただのツール呼び出しと何が違うの?」そんな疑問を持つ人が増えています。難しそうに見えて、実は考え方自体はシンプルなんです。今回はMCPの基本的な概念を、初めて聞く人でもわかるように丁寧に解説します。

NVIDIAの「Nemotron Personas」データセットに埋め込みベクトルが登場、検索・分類が一気に便利に
NVIDIAが公開した数百万件規模の合成ペルソナデータセット「Nemotron Personas」。膨大な量ゆえに目的のペルソナを探すのが難しかったのですが、あるエンジニアが埋め込みベクトル(テキストを数値の列に変換したもの)を事前計算して公開し、意味検索やグループ化が手軽にできるようになりました。

MI100 vs RX 9700:ローカルLLM用途でどちらを選ぶべきか
ローカルLLM・Whisper・画像/動画生成を目的にGPU選定を検討しているユーザーの間で、AMD MI100とRX 9700の比較が話題になっている。ただしソース情報は極めて限定的であり、現時点で判断できる材料は乏しい。

墜落事故の死亡パイロット音声をAIで再現——米国が規制の抜け穴に対応へ
米国では、航空事故調査に関わる法律がコックピット音声記録の公開を禁じているにもかかわらず、AIツールを用いて死亡したパイロットの音声を事故調査文書から再現しようとするユーザーが現れており、当局がその対応に追われていると報じられている。

21GPU実測:TTS推論ベンチマークが示すコスパの現実
コンシューマーGPU21種をTTSモデル「OmniVoice」で実測したベンチマークが公開された。VRAMピーク5GBという現実的な条件下で、各GPUのリアルタイム倍率(xRT)を冷静に並べると、「最新=最強」という単純な図式が崩れる場面が随所に見える。投資対効果を重視するなら、この数字を直視すべきだ。